首页博客 → 如何让语音备忘自动变成文字笔记

如何让语音备忘自动变成文字笔记

发布于 2026-08-20 · 5 分钟阅读

想法总在走路时冒出来,边走边说比打字快得多。问题出现在之后:文件夹里躺着上百条录音,什么也找不到。转录把这堆东西变成普通文本,可以搜索、可以互相链接。

全自动的链路

可用的方案由三部分组成:

  1. 手机上的录音应用把文件写进一个会同步到电脑的文件夹。
  2. 电脑上的脚本发现新文件,送去转录。
  3. 文本作为笔记落在原始音频旁边。

全程无需点击:说完一分钟后,笔记已经在知识库里。

监视脚本

最简单的版本不需要任何依赖——遍历文件夹,处理还没有文本的那些。

import pathlib, datetime
from openai import OpenAI

client = OpenAI(base_url="https://voicesscribe.com/v1", api_key="your key")
vault = pathlib.Path.home() / "Vault" / "voice"

for audio in vault.glob("*.m4a"):
    note = audio.with_suffix(".md")
    if note.exists():
        continue
    with audio.open("rb") as f:
        text = client.audio.transcriptions.create(model="whisper-1", file=f).text
    stamp = datetime.datetime.fromtimestamp(audio.stat().st_mtime)
    note.write_text(
        f"---\ndate: {stamp:%Y-%m-%d %H:%M}\nsource: {audio.name}\n---\n\n{text}\n",
        encoding="utf-8")
    print("完成:", note.name)

挂到计划任务上每五分钟跑一次,笔记几乎是即时出现的。

给笔记加标题和结构

原始转录是一整段连续的口语。要好用,笔记需要标题和大致结构,这时语言模型就派上用场:把同一段文本送去做摘要,结果放在开头作为概览和待办清单。

完整转录也要留着。摘要会丢细节,而你之后搜索知识库时用的,正是当时说出口的那些原话。

户外录音的准确率

走路时的备忘是难料:风声、脚步、吞掉的字尾。三个明显有效的习惯:

用你自己的录音试一试。 注册只需一分钟,免费额度足够判断识别质量。

免费获取 API 密钥

常见问题

手机录音是什么格式?

通常是 m4a 或 ogg,两种都能直接收,不需要转换。

备忘里混着两种语言怎么办?

语种会根据声音自动判定,混合的档案不用任何设置。只有确定单一语种时才值得显式指定。

没有电脑能做吗?

可以,只要自动化平台能读云端文件夹,整个流程就跑在云上。

录音之后会怎样?

录音和转录文本保存不超过 24 小时,之后自动删除。

相关阅读