如何让语音备忘自动变成文字笔记
想法总在走路时冒出来,边走边说比打字快得多。问题出现在之后:文件夹里躺着上百条录音,什么也找不到。转录把这堆东西变成普通文本,可以搜索、可以互相链接。
全自动的链路
可用的方案由三部分组成:
- 手机上的录音应用把文件写进一个会同步到电脑的文件夹。
- 电脑上的脚本发现新文件,送去转录。
- 文本作为笔记落在原始音频旁边。
全程无需点击:说完一分钟后,笔记已经在知识库里。
监视脚本
最简单的版本不需要任何依赖——遍历文件夹,处理还没有文本的那些。
import pathlib, datetime
from openai import OpenAI
client = OpenAI(base_url="https://voicesscribe.com/v1", api_key="your key")
vault = pathlib.Path.home() / "Vault" / "voice"
for audio in vault.glob("*.m4a"):
note = audio.with_suffix(".md")
if note.exists():
continue
with audio.open("rb") as f:
text = client.audio.transcriptions.create(model="whisper-1", file=f).text
stamp = datetime.datetime.fromtimestamp(audio.stat().st_mtime)
note.write_text(
f"---\ndate: {stamp:%Y-%m-%d %H:%M}\nsource: {audio.name}\n---\n\n{text}\n",
encoding="utf-8")
print("完成:", note.name)
挂到计划任务上每五分钟跑一次,笔记几乎是即时出现的。
给笔记加标题和结构
原始转录是一整段连续的口语。要好用,笔记需要标题和大致结构,这时语言模型就派上用场:把同一段文本送去做摘要,结果放在开头作为概览和待办清单。
完整转录也要留着。摘要会丢细节,而你之后搜索知识库时用的,正是当时说出口的那些原话。
户外录音的准确率
走路时的备忘是难料:风声、脚步、吞掉的字尾。三个明显有效的习惯:
- 把手机拿近一点,这比任何参数都重要。
- 如果你总用同一种语言口述,就把语言代码传进去。
- 固定一份提示词:项目名、同事名字、专业术语。
用你自己的录音试一试。 注册只需一分钟,免费额度足够判断识别质量。
免费获取 API 密钥常见问题
手机录音是什么格式?
通常是 m4a 或 ogg,两种都能直接收,不需要转换。
备忘里混着两种语言怎么办?
语种会根据声音自动判定,混合的档案不用任何设置。只有确定单一语种时才值得显式指定。
没有电脑能做吗?
可以,只要自动化平台能读云端文件夹,整个流程就跑在云上。
录音之后会怎样?
录音和转录文本保存不超过 24 小时,之后自动删除。
相关阅读
- 语音消息转文字:Telegram、WhatsApp 及其他即时通讯工具 — 如何自动把语音消息转成文字:处理 ogg/opus 格式、提升短录音准确率、应对静音,以及可直接使用的聊天机器人代码。
- 不写代码也能把音频批量转成文字 — 在自动化平台里搭转录流程:n8n、Make、Zapier 中的 HTTP 请求怎么配,文件字段怎么传,结果写到哪里。
- 如何从会议转录自动生成纪要 — 两步式会议纪要流程:先精确转录录音,再用不会编造事实的提示词提取决议、负责人和截止时间。