Início → Blog → Transcrição de podcast: show notes, capítulos e episódios encontráveis
Transcrição de podcast: show notes, capítulos e episódios encontráveis
Áudio é invisível para buscadores. Um episódio de uma hora cheio de respostas de especialista traz exatamente o mesmo tráfego orgânico que uma página vazia — até você publicar o texto. A transcrição também é a fonte mais barata de show notes, capítulos, citações e posts.
O que a transcrição dá a um podcast
Uma única requisição de transcrição alimenta quatro trabalhos diferentes:
- Busca orgânica. A página do episódio passa a ranquear pelas perguntas que o convidado respondeu, não só pelo nome do programa.
- Acessibilidade. Ouvintes com perda auditiva, e todo mundo que está sem fone no trânsito, podem ler em vez de ouvir.
- Reaproveitamento. Citações para redes sociais, resumo para a newsletter e um post de blog saem todos do mesmo texto.
- Navegação. Capítulos com marcação de tempo levam a pessoa direto ao trecho que interessa.
Preparando o arquivo de áudio
Envie o episódio publicado — o arquivo mixado e masterizado — em vez das faixas brutas. Se ele não couber no limite de 25 MB, recodifique uma cópia só para o reconhecimento:
ffmpeg -i episodio-42.wav -ac 1 -ar 16000 -b:a 48k episodio-42.mp3
Essa cópia serve apenas para transcrever, então a perda de qualidade não importa — mono a 16 kHz é com o que o modelo trabalha internamente de qualquer forma.
Obtendo a transcrição com tempos
Peça verbose_json: ele devolve tanto o texto completo quanto segmentos com início e fim, e os capítulos são construídos a partir desses segmentos.
from openai import OpenAI
client = OpenAI(base_url="https://voicesscribe.com/v1", api_key="sua chave")
with open("episodio-42.mp3", "rb") as f:
r = client.audio.transcriptions.create(
model="whisper-1", file=f,
response_format="verbose_json",
prompt="Convidada: Maria Alvarez, CTO da Nordwind Systems. Temas: observabilidade, OpenTelemetry, escala de plantão.",
)
open("episodio-42.txt", "w", encoding="utf-8").write(r.text)
Coloque o nome do convidado, a empresa e os termos principais no prompt. Nomes próprios são a primeira coisa que um modelo geral erra, e são exatamente o que as pessoas procuram.
Montando capítulos a partir dos segmentos
Marcadores de capítulo são apenas tempos com títulos. Agrupe os segmentos em blocos de alguns minutos e deixe um modelo de linguagem nomear cada bloco:
blocos, atual, inicio = [], [], 0
for s in r.segments:
atual.append(s.text)
if s.end - inicio > 300: # blocos de cerca de cinco minutos
blocos.append((inicio, " ".join(atual)))
atual, inicio = [], s.end
blocos.append((inicio, " ".join(atual)))
for t, texto in blocos:
print(f"{int(t)//60:02d}:{int(t)%60:02d} {titulo_para(texto)}")
O resultado vai direto para a descrição do episódio nas plataformas que aceitam capítulos, e para a página no seu próprio site.
Escrevendo show notes a partir da transcrição
Show notes são resumo mais links mais citações. As três partes podem ser rascunhadas do texto em uma passada:
notas = llm(f"""A partir desta transcrição de podcast, produza:
- um resumo do episódio em duas frases,
- cinco tópicos com o que o convidado realmente afirma,
- três frases citáveis, na íntegra,
- todos os livros, ferramentas e empresas mencionados.
{transcript}""")
Sempre confira a lista de nomes e produtos à mão. A transcrição é precisa na fala comum e menos confiável exatamente onde aparecem nomes próprios — que é onde um erro factual fica mais visível.
Publicando de forma que os buscadores leiam
A transcrição só ajuda na busca se estiver na página como texto:
- HTML comum, não PDF nem imagem. Texto no corpo da página, de preferência com os tempos como subtítulos.
- Uma página por episódio, com título e descrição próprios, em vez de uma página-arquivo enorme.
- Uma faixa VTT ao lado do player para acompanhar a leitura:
response_format="vtt"devolve pronta. - Dados estruturados. Marque a página como PodcastEpisode para que o episódio apareça como objeto de mídia, não como artigo.
Não cole a saída bruta do reconhecimento. Dez minutos separando parágrafos e corrigindo nomes é a diferença entre uma página que as pessoas leem e um paredão de texto que elas abandonam.
Quanto custa manter isso
A cobrança é por minuto de áudio, então a conta é previsível: um programa semanal com episódios de uma hora dá cerca de quatro horas de transcrição por mês. É a parte barata de um podcast — mais barata que a hospedagem e muito mais barata que a edição que produziu o episódio.
O processamento roda mais rápido que o tempo real, então o catálogo inteiro pode ser transcrito em um lote noturno e publicado como um arquivo de páginas pesquisáveis.
Teste com as suas próprias gravações. O cadastro leva um minuto e os minutos gratuitos bastam para avaliar a qualidade.
Obter uma chave de API grátisPerguntas frequentes
Devo publicar a transcrição completa ou só um resumo?
Publique o texto completo: é ele que torna o episódio encontrável nas perguntas de cauda longa que o convidado respondeu. Um resumo no topo ajuda o leitor a decidir se continua.
A transcrição vai acertar o nome do convidado?
Passe nome e empresa pelo parâmetro prompt e normalmente sim. Nomes próprios são o ponto fraco de qualquer modelo de reconhecimento, então confira antes de publicar.
Como obtenho capítulos com marcação de tempo?
Peça verbose_json: ele devolve segmentos com início e fim. Agrupe esses segmentos em blocos de alguns minutos e dê um título a cada bloco.
Dá para transcrever um episódio com dois apresentadores e um convidado?
Dá, a fala é transcrita por inteiro, mas um arquivo único e misturado não volta identificado por locutor. Se as faixas separadas da sessão ainda existirem, transcreva-as em separado.
E episódios em mais de um idioma?
O idioma é detectado pelo começo da gravação, então um episódio bilíngue rende mais se for dividido em trechos e transcrito um idioma por vez.
Leitura relacionada
- Legendas SRT e VTT automáticas a partir de vídeos e webinars — Como obter legendas prontas com marcações de tempo a partir de um webinar ou vídeo: extração do áudio, formatos SRT e VTT, código e os problemas mais frequentes.
- Como melhorar a precisão da transcrição: oito ajustes práticos — Oito mudanças que realmente movem a qualidade da transcrição: preparo do áudio, idioma explícito, o parâmetro prompt, corte em pausas, formatos e como medir o erro.
- Como transcrever gravações de reuniões e ter atas utilizáveis — Transforme gravações do Zoom, Teams e Meet em texto pesquisável e atas estruturadas: onde está o arquivo, como transcrevê-lo e como extrair decisões e tarefas.