99 种语言,零配置
语种自动判定:中文、英语、西班牙语、日语等数十种语言在同一条流里处理。
把通话、语音消息和访谈录音转成文字,支持 99 种语言。协议与 OpenAI Whisper 一致,一行代码即可切换。
10 分钟免费额度 — 注册后立即到账
超出额度后 — 每分钟音频最高 0.006 USD,按量付费
语种自动判定:中文、英语、西班牙语、日语等数十种语言在同一条流里处理。
一分钟音频几秒钟转录完,文字在同一个请求里返回——没有队列,不用轮询。
录音和转录文本保存不超过 24 小时——仅供核对质量——之后自动删除。
兼容官方 openai-sdk:只换地址和密钥。响应和错误格式完全一致。
已经在调用 OpenAI Whisper?改两行即可。
from openai import OpenAI
client = OpenAI(base_url="https://voicesscribe.com/v1", api_key="your key")
r = client.audio.transcriptions.create(model="whisper-1", file=open("call.ogg", "rb"))
print(r.text)
注册只需一分钟,密钥连同客户后台访问权限立即发放。
把 SDK 指向我们的接口并填入你的密钥——其余代码原样不动。
分钟数、转录历史和账期金额都在客户后台,实时更新。
单一接口 POST /v1/audio/transcriptions — 与 OpenAI 相同。
ogg · opus · mp3 · wav · m4a · webm — 最大 25 MB
json · text · verbose_json · srt · vtt
prompt 参数提高名称、人名和编号的识别准确率。
现成的 srt 和 vtt,或 verbose_json 里带时间的分段。
常见任务的分步说明——附代码与错误处理。
如何把电话对话转成文字并纳入常规流程。
处理即时通讯工具的 ogg/opus,以及短录音的准确率。
一个请求就从网络研讨会或视频得到现成字幕。
真正能改善你自己音频字错率的八个方法。
协议和响应格式完全一致,代码不用改——换个地址和密钥即可。识别在我们自己的硬件上运行。
99 种语言,包括中文、英语、西班牙语和德语。语种根据音频自动判定,无需指定。
一分钟音频几秒钟处理完。文字在同一个请求里返回——不需要轮询任务状态。
录音和转录文本保存不超过 24 小时——仅供核对质量——之后自动删除。
ogg、opus、mp3、wav、m4a、webm 等常见格式,单次最大 25 MB。响应可选 json、text、verbose_json、srt 和 vtt。
按音频分钟计费:每分钟最高 0.006 USD,量大另议。只对成功处理的请求计费——出错的请求不消耗分钟数。