服务运行中

音频转文字 API

把通话、语音消息和访谈录音转成文字,支持 99 种语言。协议与 OpenAI Whisper 一致,一行代码即可切换。

10 分钟免费额度 — 注册后立即到账

超出额度后 — 每分钟音频最高 0.006 USD,按量付费

为什么选择 voicescribe

99 种语言,零配置

语种自动判定:中文、英语、西班牙语、日语等数十种语言在同一条流里处理。

几秒返回结果

一分钟音频几秒钟转录完,文字在同一个请求里返回——没有队列,不用轮询。

数据不留存

录音和转录文本保存不超过 24 小时——仅供核对质量——之后自动删除。

代码不用改

兼容官方 openai-sdk:只换地址和密钥。响应和错误格式完全一致。

一分钟完成接入

已经在调用 OpenAI Whisper?改两行即可。

from openai import OpenAI

client = OpenAI(base_url="https://voicesscribe.com/v1", api_key="your key")
r = client.audio.transcriptions.create(model="whisper-1", file=open("call.ogg", "rb"))
print(r.text)
1
获取密钥

注册只需一分钟,密钥连同客户后台访问权限立即发放。

2
更换地址

把 SDK 指向我们的接口并填入你的密钥——其余代码原样不动。

3
后台跟踪用量

分钟数、转录历史和账期金额都在客户后台,实时更新。

语音识别 API 的能力

单一接口 POST /v1/audio/transcriptions — 与 OpenAI 相同。

音频格式

ogg · opus · mp3 · wav · m4a · webm — 最大 25 MB

响应格式

json · text · verbose_json · srt · vtt

术语提示

prompt 参数提高名称、人名和编号的识别准确率。

字幕与时间轴

现成的 srtvtt,或 verbose_json 里带时间的分段。

教程与示例

常见任务的分步说明——附代码与错误处理。

全部文章 →

常见问题

与 OpenAI Whisper API 有什么区别?

协议和响应格式完全一致,代码不用改——换个地址和密钥即可。识别在我们自己的硬件上运行。

支持哪些语言?

99 种语言,包括中文、英语、西班牙语和德语。语种根据音频自动判定,无需指定。

转录要多长时间?

一分钟音频几秒钟处理完。文字在同一个请求里返回——不需要轮询任务状态。

上传的录音会怎样?

录音和转录文本保存不超过 24 小时——仅供核对质量——之后自动删除。

接受哪些音频格式?

ogg、opus、mp3、wav、m4a、webm 等常见格式,单次最大 25 MB。响应可选 json、text、verbose_json、srt 和 vtt。

价格是多少?

按音频分钟计费:每分钟最高 0.006 USD,量大另议。只对成功处理的请求计费——出错的请求不消耗分钟数。