首页博客 → 语音识别该选哪个 Whisper 模型

语音识别该选哪个 Whisper 模型

发布于 2026-08-20 · 5 分钟阅读

Whisper 有好几个尺寸,从三千九百万参数的 tiny 到十五亿参数的 large。差别不只是准确率,还决定速度、显存和每分钟音频的最终成本。下面按用途拆开讲。

型号一览

模型参数量显存速度适用场景
tiny3900 万约 1 GB极快草稿转录、语音指令
base7400 万约 1 GB音质好的短语音
small2.44 亿约 2 GB中等清晰单语种讲话
medium7.69 亿约 5 GB较慢噪音、口音、混合语种
large-v315.5 亿约 10 GB最高准确率、复杂音频

另外还有 large-v3-turbo:同样的大模型,解码器做了精简,速度快数倍,在普通语音上几乎不掉准确率。

小模型在哪里失手

录音棚里的单人讲话,各个尺寸差别不大。音频一变难,差距立刻显现:

这个选择的成本

自购显卡跑 large-v3 意味着 10 GB 显存和一台长期占用的机器。云端租卡按小时计费,不按音频分钟计费,所以空转和干活一个价。按分钟计费的服务把这个问题绕开了:大模型一直在跑,你只为实际用量付费。

经验值:每天音频量不到十小时,自己养显卡比按分钟付费更贵。

实际怎么选

语音消息、通话和会议,直接用能拿到的最大模型:准确率的收益抵得过速度损失,事后人工订正的成本更高。小模型只在两种情况下合理——设备端离线识别,以及只看总量不看每个词的海量归档粗筛。

我们的 API 跑的是 large-v3-turbo,不需要你选择:请求里写 whisper-1 只是为了兼容既有代码。

用你自己的录音试一试。 注册只需一分钟,免费额度足够判断识别质量。

免费获取 API 密钥

常见问题

large-v3-turbo 和 large-v3 差在哪?

turbo 精简了解码器,速度快数倍,普通语音上的准确率几乎一致。特别难的音频里完整版 large 还能再多出零点几个百分点。

请求里必须指定模型吗?

写 whisper-1 即可,这个名字只为兼容既有代码。服务端跑哪个模型不需要你配置。

是不是模型越大越准?

音频难的时候是。干净的单人录音里,small 和 large 的差距只有零点几个百分点,肉眼看不出来。

自建需要多少显存?

large-v3 在 fp16 下大约 10 GB。small 和 base 能塞进 2 GB,但准确率明显下降。

相关阅读