不写代码也能把音频批量转成文字
自动转录并不需要程序员。任何自动化平台都能发带文件的 HTTP 请求,这就够了。下面是 n8n、Make 和 Zapier 的配置,以及所有人都会踩一次的文件字段坑。
平台需要什么
各家的做法是一样的:
- 地址 https://voicesscribe.com/v1/audio/transcriptions,方法 POST。
- Authorization 请求头,值为 Bearer 加你的密钥。
- 表单体:二进制字段 file,文本字段 model 取值 whisper-1。
返回是带 text 字段的 JSON,后续步骤用的就是它。
n8n
用 HTTP Request 节点:方法 POST,地址 https://voicesscribe.com/v1/audio/transcriptions,鉴权走请求头。Body 选 Form-Data,加两个参数——model 填 whisper-1,file 选 n8n Binary File 类型并指向上一节点的二进制属性,通常叫 data。
这里最经典的失败是把文件当文本发。如果收到 400,十有八九是 file 字段传的是字符串而不是二进制属性。
Make 与 Zapier
Make 用 HTTP 模块的 Make a request 动作:body 类型选 multipart/form-data,file 字段映射到上一模块的二进制输出(Google Drive 文件、邮件附件都行),model 填 whisper-1。
Zapier 用 Webhooks by Zapier 的 Custom Request:文件取自上一步的附件,鉴权头手动添加。Zapier 对附件大小有限制,长录音要先压缩。
文本往哪里去
半小时就能搭好的三种连接:
- 邮箱到表格。带附件的邮件进来,文件送去转录,文本写成表格新的一行。
- 网盘到知识库。监控文件夹里的新文件,自动变成一篇带转录的页面。
- 电话系统到 CRM。通话录音转成文字,作为备注挂到商机卡片上。
如果流程要处理一批文件,记得加并发上限:平台喜欢一次性全发出去,然后直接撞上频率限制。
用你自己的录音试一试。 注册只需一分钟,免费额度足够判断识别质量。
免费获取 API 密钥常见问题
需要现成的集成模块吗?
不需要。任何平台都有的通用 HTTP 节点就够了。
文件最大多少?
25 MB。很多无代码平台对附件的限制还更小,所以长录音最好先压成 opus。
怎么直接拿到字幕?
在表单里加 response_format 字段,填 srt 或 vtt,返回的就是现成的字幕文件。
流程返回 400 怎么排查?
先确认 file 字段传的是二进制数据,而不是文件名或链接,这是最常见的原因。
相关阅读
- 如何为音频存档搭建批量转录流水线 — 转录上万条录音而不丢失任何一条:任务队列、并发控制、重试策略、崩溃后续跑,以及如何把账单控制在预期之内。
- 如何让语音备忘自动变成文字笔记 — 把手机和录音笔里的语音备忘变成可搜索的笔记:同步文件夹、监视脚本、笔记模板,以及户外录音的准确率技巧。
- 转录 API 的报错分别代表什么 — 逐个解释转录接口的状态码:401、400、413、429、502 各自的原因和修法,以及哪些失败值得自动重试。