首页 → 博客 → 自建 Whisper 服务器还是用转录 API:哪个更省
自建 Whisper 服务器还是用转录 API:哪个更省
Whisper 是开源的,体积几个 GB,一条命令就能跑起来,想自己部署很正常。但硬件账单按月来,音频却按分钟来;量小的时候,自建输给 API 不止一点。我们把账算清楚。
自建实际包含什么
加载模型是最简单的一步,剩下的都在一个月后出现:
- 显卡。large-v3 需要约 10 GB 显存,也就是 12 GB 以上的卡。
- 队列。一张卡放不下两个并发请求,得自己写调度。
- 格式转换。客户发来 m4a、ogg、webm,你得维护 ffmpeg 并跟进编解码器。
- 值班。驱动、CUDA 升级、崩溃后重启,这些都是活人的时间。
算账
取一个常见量:每月 500 分钟音频。
| 方案 | 每月支出 | 还需要什么 |
|---|---|---|
| 云端租卡 | 最低档也要 100 美元起 | 部署、升级、监控 |
| 自购显卡 | 一次性 400–800 美元加电费 | 机位、散热、故障停机 |
| 按分钟计费的 API | 500 分钟乘以单价 | 无 |
租来的卡是全天计费的,队列空着也一样收钱。“自建更便宜”的估算就是在这里崩掉的:500 分钟音频不到九小时机时,而一个月有 720 小时。
自建什么时候更划算
两种情况值得自己搭。
持续的大流量。一旦显卡每天至少忙半天,成本摊到数千分钟上,单价就低于任何 API。
数据不能出边界。医疗、银行、涉密场景,这不是价格问题。其余情况值得先看供应商怎么处理录音:如果一天内删除且不用于训练,风险和你已经在用的其他云服务差不多。
合理的推进顺序
一上来就自建几乎都太早:你既不知道自己音频上的准确率,也不知道真实用量。可行的顺序是:
- 先接 API,把真实录音跑一遍——这是一天的工作量。
- 攒够一个月的分钟数,看实际账单。
- 如果量大到显卡能一直忙,再迁到自己这边,把 API 留作峰值兜底。
协议两边一致,所以来回迁移只改地址和密钥,代码完全不动。
用你自己的录音试一试。 注册只需一分钟,免费额度足够判断识别质量。
免费获取 API 密钥常见问题
多大的量自购显卡才回本?
大致是显卡每天忙上半天。每月几百分钟的量,卡大部分时间空转,按分钟付费更便宜。
没有显卡能跑吗?
CPU 也能跑,但慢几十倍:一分钟音频要几分钟。偶尔处理文件可以,做流水线不现实。
以后迁回自己这边麻烦吗?
协议相同,客户端只改地址和密钥。但队列、转换、监控要从头搭。
用 API 的隐私怎么办?
看保留期。我们的录音和转录文本在 24 小时内删除,且不用于训练模型。
相关阅读
- 语音识别该选哪个 Whisper 模型 — 从 tiny 到 large-v3 的差别:速度、准确率、显存占用,以及什么情况下小模型反而更划算。附成本对比。
- 语音转文字计费:你实际在为什么付费 — 转录服务如何计费、音频里哪些部分在花钱、什么时候自建 GPU 比调用 API 更划算,以及如何估算自己每月的支出。
- 转录的隐私与安全:该向供应商确认什么 — 向语音识别供应商必问的五个问题:保留期、是否用于训练、通道加密、员工访问权限,以及能否按请求删除。