语音识别该选哪个 Whisper 模型
Whisper 有好几个尺寸,从三千九百万参数的 tiny 到十五亿参数的 large。差别不只是准确率,还决定速度、显存和每分钟音频的最终成本。下面按用途拆开讲。
型号一览
| 模型 | 参数量 | 显存 | 速度 | 适用场景 |
|---|---|---|---|---|
| tiny | 3900 万 | 约 1 GB | 极快 | 草稿转录、语音指令 |
| base | 7400 万 | 约 1 GB | 快 | 音质好的短语音 |
| small | 2.44 亿 | 约 2 GB | 中等 | 清晰单语种讲话 |
| medium | 7.69 亿 | 约 5 GB | 较慢 | 噪音、口音、混合语种 |
| large-v3 | 15.5 亿 | 约 10 GB | 慢 | 最高准确率、复杂音频 |
另外还有 large-v3-turbo:同样的大模型,解码器做了精简,速度快数倍,在普通语音上几乎不掉准确率。
小模型在哪里失手
录音棚里的单人讲话,各个尺寸差别不大。音频一变难,差距立刻显现:
- 专有名词。小模型会自信地把人名换成读音相近的普通词。
- 口音和语速。抢话、吞音的地方,tiny 和 base 会整句丢失。
- 中途换语言。小模型切换很差,有时会把识别做成翻译。
- 噪音。街上、车里、开放式办公室,小模型开始编造内容。
这个选择的成本
自购显卡跑 large-v3 意味着 10 GB 显存和一台长期占用的机器。云端租卡按小时计费,不按音频分钟计费,所以空转和干活一个价。按分钟计费的服务把这个问题绕开了:大模型一直在跑,你只为实际用量付费。
经验值:每天音频量不到十小时,自己养显卡比按分钟付费更贵。
实际怎么选
语音消息、通话和会议,直接用能拿到的最大模型:准确率的收益抵得过速度损失,事后人工订正的成本更高。小模型只在两种情况下合理——设备端离线识别,以及只看总量不看每个词的海量归档粗筛。
我们的 API 跑的是 large-v3-turbo,不需要你选择:请求里写 whisper-1 只是为了兼容既有代码。
用你自己的录音试一试。 注册只需一分钟,免费额度足够判断识别质量。
免费获取 API 密钥常见问题
large-v3-turbo 和 large-v3 差在哪?
turbo 精简了解码器,速度快数倍,普通语音上的准确率几乎一致。特别难的音频里完整版 large 还能再多出零点几个百分点。
请求里必须指定模型吗?
写 whisper-1 即可,这个名字只为兼容既有代码。服务端跑哪个模型不需要你配置。
是不是模型越大越准?
音频难的时候是。干净的单人录音里,small 和 large 的差距只有零点几个百分点,肉眼看不出来。
自建需要多少显存?
large-v3 在 fp16 下大约 10 GB。small 和 base 能塞进 2 GB,但准确率明显下降。
相关阅读
- 自建 Whisper 服务器还是用转录 API:哪个更省 — 自建 Whisper 与直接调用 API 的对比:显卡投入、运维成本、上手时间,以及自建开始划算的音频量分界线。
- 如何提高语音识别准确率:八个实用方法 — 真正能改善转录质量的八件事:音频预处理、指定语种、prompt 词表、切分策略、响应格式,以及如何测量字错率。
- 语音识别到底把哪些语言处理得好 — 99 种支持语言并不平等:哪些可靠、哪些要打折扣、语种自动检测何时失灵,以及中途切换语言的录音该怎么处理。