首页 → 博客 → 播客转录:节目笔记、章节和可被搜索的单集页面
播客转录:节目笔记、章节和可被搜索的单集页面
音频对搜索引擎是不可见的。一集塞满专家回答的一小时节目,带来的自然流量和一个空页面完全一样——直到你把文字发布出来。转录同时也是节目笔记、章节、金句和社交帖子最便宜的来源。
转录对播客的价值
一次转录请求同时喂饱四件事:
- 自然搜索。单集页面开始因为嘉宾回答过的那些问题被搜到,而不只是因为节目名称。
- 无障碍。听障听众,以及所有没带耳机通勤的人,可以改成阅读。
- 内容复用。社交平台的金句、邮件通讯的摘要、博客文章,都出自同一份文字。
- 导航。带时间轴的章节让人直接跳到自己要听的那一段。
准备音频文件
提交已发布的成品(混音和母带处理过的文件),而不是原始分轨。如果放不进 25 MB 的请求限制,就为识别单独压一份:
ffmpeg -i episode-42.wav -ac 1 -ar 16000 -b:a 48k episode-42.mp3
这一份只用于转录,音质损失无所谓——16 kHz 单声道本来就是模型内部使用的规格。
拿到带时间轴的转录
使用 verbose_json:它同时返回完整文本和带起止时间的分段,章节就是从这些分段里生成的。
from openai import OpenAI
client = OpenAI(base_url="https://voicesscribe.com/v1", api_key="your key")
with open("episode-42.mp3", "rb") as f:
r = client.audio.transcriptions.create(
model="whisper-1", file=f,
response_format="verbose_json",
prompt="Guest: Maria Alvarez, CTO at Nordwind Systems. Topics: observability, OpenTelemetry, on-call rotation.",
)
open("episode-42.txt", "w", encoding="utf-8").write(r.text)
把嘉宾姓名、公司和主要术语写进 prompt。人名是通用模型最先出错的地方,而它恰恰是别人拿来搜索的关键词。
从分段生成章节
章节标记不过是带标题的时间点。把分段按几分钟聚成块,再让语言模型给每块起标题:
blocks, cur, start = [], [], 0
for s in r.segments:
cur.append(s.text)
if s.end - start > 300: # 大致五分钟一块
blocks.append((start, " ".join(cur)))
cur, start = [], s.end
blocks.append((start, " ".join(cur)))
for t, text in blocks:
print(f"{int(t)//60:02d}:{int(t)%60:02d} {title_for(text)}")
结果可以直接放进支持章节时间戳的平台的单集简介,也可以放进你自己网站上的页面。
用转录写节目笔记
节目笔记 = 摘要 + 链接 + 金句。三者都可以从文字里一次性起草:
notes = llm(f"""From this podcast transcript produce:
- a two-sentence episode summary,
- five bullet points of what the guest actually claims,
- three quotable lines, verbatim,
- every book, tool and company mentioned.
{transcript}""")
人名和产品清单一定要人工核对。转录在普通口语上很准,恰恰在专有名词处最不可靠——而那正是事实性错误最扎眼的地方。
怎样发布才能被搜索引擎读到
转录只有以文字形式出现在页面上,才对搜索有用:
- 用普通 HTML,不要 PDF 或图片。把文字放进页面正文,最好用时间戳做小标题。
- 一集一个页面,各有自己的标题和描述,不要堆成一个长长的归档页。
- 在播放器旁边挂一个 VTT 轨道,让听众可以跟读:
response_format="vtt"直接返回可用的文件。 - 结构化数据。把页面标记为 PodcastEpisode,让单集以媒体对象而不是文章的形式展示。
不要直接粘贴原始识别结果。花十分钟分段并修正人名,就是「有人读的页面」和「一堵让人转身就走的文字墙」之间的区别。
这样做的成本
按音频分钟计费,所以算术很好预测:每周一期、每期一小时的节目,一个月大约四小时转录量。这是播客里最便宜的一环——比托管便宜,更远远低于剪辑这一集所花的成本。
处理速度快于实时,因此整个历史节目库可以一次批量跑完,通宵之后就变成一批可被检索的页面。
用你自己的录音试一试。 注册只需一分钟,免费额度足够判断识别质量。
免费获取 API 密钥常见问题
应该发布完整转录还是只发摘要?
发布完整文本:这才是让单集能被嘉宾回答过的长尾问题搜到的原因。顶部放一段摘要,帮读者判断要不要继续看。
转录能把嘉宾的名字写对吗?
把嘉宾姓名和公司通过 prompt 传进去,通常就能写对。专有名词是任何识别模型的弱点,发布前请核对。
怎样得到带时间戳的章节?
请求 verbose_json:它会返回带起止时间的分段。把这些分段按几分钟聚成块,再给每块起个标题。
两位主持人加一位嘉宾的单集能转吗?
可以,语音会被完整转录,但单个混音文件不会带说话人标签。如果原始多轨工程还在,建议分轨转录。
一集里有多种语言怎么办?
语种是根据录音开头判定的,所以双语单集最好切成片段,按语言分别转录。
相关阅读
- 从视频和网络研讨会自动生成 SRT 与 VTT 字幕 — 如何从录播视频或网络研讨会得到带时间轴的现成字幕:提取音轨、SRT 与 VTT 的区别、代码示例,以及常见问题的解决办法。
- 如何提高语音识别准确率:八个实用方法 — 真正能改善转录质量的八件事:音频预处理、指定语种、prompt 词表、切分策略、响应格式,以及如何测量字错率。
- 如何把会议录音转成可用的会议纪要 — 把 Zoom、Teams 和 Google Meet 的录音变成可检索的文字和结构化纪要:文件在哪里、如何转录、如何提取决议和待办事项。