InícioBlog → Transcrição de podcast: show notes, capítulos e episódios encontráveis

Transcrição de podcast: show notes, capítulos e episódios encontráveis

Publicado em 2026-08-18 · 6 min de leitura

Áudio é invisível para buscadores. Um episódio de uma hora cheio de respostas de especialista traz exatamente o mesmo tráfego orgânico que uma página vazia — até você publicar o texto. A transcrição também é a fonte mais barata de show notes, capítulos, citações e posts.

O que a transcrição dá a um podcast

Uma única requisição de transcrição alimenta quatro trabalhos diferentes:

Preparando o arquivo de áudio

Envie o episódio publicado — o arquivo mixado e masterizado — em vez das faixas brutas. Se ele não couber no limite de 25 MB, recodifique uma cópia só para o reconhecimento:

ffmpeg -i episodio-42.wav -ac 1 -ar 16000 -b:a 48k episodio-42.mp3

Essa cópia serve apenas para transcrever, então a perda de qualidade não importa — mono a 16 kHz é com o que o modelo trabalha internamente de qualquer forma.

Obtendo a transcrição com tempos

Peça verbose_json: ele devolve tanto o texto completo quanto segmentos com início e fim, e os capítulos são construídos a partir desses segmentos.

from openai import OpenAI

client = OpenAI(base_url="https://voicesscribe.com/v1", api_key="sua chave")

with open("episodio-42.mp3", "rb") as f:
    r = client.audio.transcriptions.create(
        model="whisper-1", file=f,
        response_format="verbose_json",
        prompt="Convidada: Maria Alvarez, CTO da Nordwind Systems. Temas: observabilidade, OpenTelemetry, escala de plantão.",
    )

open("episodio-42.txt", "w", encoding="utf-8").write(r.text)

Coloque o nome do convidado, a empresa e os termos principais no prompt. Nomes próprios são a primeira coisa que um modelo geral erra, e são exatamente o que as pessoas procuram.

Montando capítulos a partir dos segmentos

Marcadores de capítulo são apenas tempos com títulos. Agrupe os segmentos em blocos de alguns minutos e deixe um modelo de linguagem nomear cada bloco:

blocos, atual, inicio = [], [], 0
for s in r.segments:
    atual.append(s.text)
    if s.end - inicio > 300:            # blocos de cerca de cinco minutos
        blocos.append((inicio, " ".join(atual)))
        atual, inicio = [], s.end
blocos.append((inicio, " ".join(atual)))

for t, texto in blocos:
    print(f"{int(t)//60:02d}:{int(t)%60:02d}  {titulo_para(texto)}")

O resultado vai direto para a descrição do episódio nas plataformas que aceitam capítulos, e para a página no seu próprio site.

Escrevendo show notes a partir da transcrição

Show notes são resumo mais links mais citações. As três partes podem ser rascunhadas do texto em uma passada:

notas = llm(f"""A partir desta transcrição de podcast, produza:
- um resumo do episódio em duas frases,
- cinco tópicos com o que o convidado realmente afirma,
- três frases citáveis, na íntegra,
- todos os livros, ferramentas e empresas mencionados.

{transcript}""")

Sempre confira a lista de nomes e produtos à mão. A transcrição é precisa na fala comum e menos confiável exatamente onde aparecem nomes próprios — que é onde um erro factual fica mais visível.

Publicando de forma que os buscadores leiam

A transcrição só ajuda na busca se estiver na página como texto:

Não cole a saída bruta do reconhecimento. Dez minutos separando parágrafos e corrigindo nomes é a diferença entre uma página que as pessoas leem e um paredão de texto que elas abandonam.

Quanto custa manter isso

A cobrança é por minuto de áudio, então a conta é previsível: um programa semanal com episódios de uma hora dá cerca de quatro horas de transcrição por mês. É a parte barata de um podcast — mais barata que a hospedagem e muito mais barata que a edição que produziu o episódio.

O processamento roda mais rápido que o tempo real, então o catálogo inteiro pode ser transcrito em um lote noturno e publicado como um arquivo de páginas pesquisáveis.

Teste com as suas próprias gravações. O cadastro leva um minuto e os minutos gratuitos bastam para avaliar a qualidade.

Obter uma chave de API grátis

Perguntas frequentes

Devo publicar a transcrição completa ou só um resumo?

Publique o texto completo: é ele que torna o episódio encontrável nas perguntas de cauda longa que o convidado respondeu. Um resumo no topo ajuda o leitor a decidir se continua.

A transcrição vai acertar o nome do convidado?

Passe nome e empresa pelo parâmetro prompt e normalmente sim. Nomes próprios são o ponto fraco de qualquer modelo de reconhecimento, então confira antes de publicar.

Como obtenho capítulos com marcação de tempo?

Peça verbose_json: ele devolve segmentos com início e fim. Agrupe esses segmentos em blocos de alguns minutos e dê um título a cada bloco.

Dá para transcrever um episódio com dois apresentadores e um convidado?

Dá, a fala é transcrita por inteiro, mas um arquivo único e misturado não volta identificado por locutor. Se as faixas separadas da sessão ainda existirem, transcreva-as em separado.

E episódios em mais de um idioma?

O idioma é detectado pelo começo da gravação, então um episódio bilíngue rende mais se for dividido em trechos e transcrito um idioma por vez.

Leitura relacionada