Início → Blog → Como transcrever um vídeo do YouTube para texto
Como transcrever um vídeo do YouTube para texto
Existem três formas de transformar um vídeo do YouTube em texto, e elas diferem enormemente em qualidade e no que você tem direito de fazer com o resultado. Escolher a errada é como se acaba com um paredão de palavras sem pontuação e sem marcações de tempo.
Opção 1: as legendas que o YouTube já gerou
Todo vídeo popular já tem legendas automáticas. Abra o painel de transcrição abaixo do vídeo, copie o texto e pronto — sem código e sem custo.
Onde isso desanda:
- A qualidade varia muito. As legendas automáticas são geradas uma vez, no upload, por um modelo ajustado para abrangência e não para precisão. Termos técnicos, nomes e números sofrem.
- Em muitos idiomas não há pontuação. Você recebe um fluxo de palavras, o que serve para busca e é inútil para leitura.
- Não escala. Copiar à mão funciona para um vídeo, não para o acervo de um canal.
- Podem simplesmente não existir em canais menores ou em idiomas menos comuns.
Para um único vídeo que você quer ler uma vez, pare por aqui — é grátis e leva dez segundos. Para qualquer coisa repetível, siga em frente.
Opção 2: a sua própria transcrição do áudio
É o que você quer quando o texto importa: para os seus vídeos, para pesquisa, para conteúdo que será publicado. Extraia o áudio, mande reconhecer, receba texto pontuado e com marcações de tempo.
Extraindo o áudio de um arquivo que você já tem:
ffmpeg -i video.mp4 -vn -ac 1 -ar 16000 -b:a 48k audio.mp3
Depois, uma requisição:
from openai import OpenAI
client = OpenAI(base_url="https://voicesscribe.com/v1", api_key="sua chave")
with open("audio.mp3", "rb") as f:
r = client.audio.transcriptions.create(
model="whisper-1", file=f, response_format="verbose_json",
)
print(r.text)
A diferença para as legendas automáticas é imediata: pontuação, maiúsculas corretas e segmentos com tempos exatos que você pode transformar em capítulos ou legendas.
Uma nota sobre baixar vídeos de terceiros
Baixar vídeo do YouTube é restrito pelos termos de serviço da plataforma, e o conteúdo em si costuma ser obra protegida de alguém. Transcrever os seus próprios uploads, ou material sobre o qual você tem direitos, é tranquilo. Para todo o resto, as opções honestas são o painel de transcrição embutido ou pedir ao autor.
Isto não é orientação jurídica e as regras mudam de país para país — mas «a ferramenta facilitava» nunca foi defesa, e vale saber de que lado da linha você está antes de montar um pipeline.
Opção 3: o acervo inteiro de um canal
Para o seu próprio catálogo, o trabalho é o padrão em lote: uma pasta de arquivos, uma fila e o estado derivado do que já existe em disco.
import pathlib
from openai import OpenAI
client = OpenAI(base_url="https://voicesscribe.com/v1", api_key="sua chave")
OUT = pathlib.Path("transcricoes"); OUT.mkdir(exist_ok=True)
for video in pathlib.Path("videos").glob("*.mp4"):
out = OUT / (video.stem + ".txt")
if out.exists():
continue # já feito — não pague duas vezes
audio = video.with_suffix(".mp3")
# ffmpeg -i video.mp4 -vn -ac 1 -ar 16000 -b:a 48k audio.mp3
with audio.open("rb") as f:
out.write_text(client.audio.transcriptions.create(
model="whisper-1", file=f).text, encoding="utf-8")
Uma hora de vídeo vira cerca de 25 MB de áudio mono, o que cabe em uma única requisição. Gravações mais longas são divididas — o limite é de 25 MB por requisição.
Legendas em vez de texto puro
Se a meta é devolver legendas ao vídeo em vez de ler o texto, peça o formato de legenda diretamente e pule a etapa de conversão:
srt = client.audio.transcriptions.create(
model="whisper-1", file=f, response_format="srt",
)
open("video.srt", "w", encoding="utf-8").write(srt)
O SRT resultante é enviado na seção de legendas do vídeo e substitui a faixa automática. Para a maioria dos canais isso sozinho já é um salto visível de qualidade, porque as suas legendas passam a ter pontuação e os nomes escritos certo.
Deixando o texto pronto para publicar
- Alimente o vocabulário. Nome do canal, nomes de convidados, nomes de produtos e jargão recorrente vão no parâmetro
prompt— é ali que os erros de reconhecimento se concentram. - Informe o idioma quando o vídeo é de um idioma só:
language="pt"elimina deslizes de detecção no começo. - Preserve os tempos. O formato
verbose_jsondevolve segmentos com início e fim — a matéria-prima de capítulos, cortes e links diretos. - Leia uma vez antes de publicar. Dez minutos corrigindo nomes e quebrando parágrafos é a diferença entre uma página que as pessoas leem e um paredão de texto.
Qual opção escolher
| Situação | Melhor opção |
|---|---|
| Um vídeo, você quer a essência agora | Painel de transcrição embutido |
| Vídeo seu, o texto será publicado | Transcrição própria do áudio |
| Acervo inteiro de um canal | Pipeline em lote sobre o áudio |
| Precisa de legendas no vídeo | Transcrição própria com response_format=srt |
| Vídeo de outra pessoa | Painel de transcrição, ou pedir ao autor |
Teste com as suas próprias gravações. O cadastro leva um minuto e os minutos gratuitos bastam para avaliar a qualidade.
Obter uma chave de API grátisPerguntas frequentes
Posso simplesmente copiar a transcrição do YouTube?
Para um único vídeo, sim — o painel de transcrição é grátis e instantâneo. Mas é gerado automaticamente, então pontuação e nomes próprios não são confiáveis, e copiar à mão não escala para um acervo.
Preciso baixar o vídeo para transcrevê-lo?
Só a faixa de áudio, e só de vídeos sobre os quais você tem direitos. O áudio é dezenas de vezes menor que o vídeo, e a imagem não é usada pelo reconhecimento.
Quanto tempo leva um vídeo de uma hora?
Poucos minutos: o processamento roda mais rápido que o tempo real. Extrair o áudio com o ffmpeg costuma demorar mais que a própria transcrição.
Vou ter marcações de tempo?
Sim, com response_format=verbose_json você recebe segmentos com início e fim exatos, e com srt ou vtt recebe um arquivo de legenda pronto.
A transcrição é melhor que as legendas automáticas do YouTube?
No mesmo áudio, uma passagem dedicada de transcrição entrega pontuação, maiúsculas corretas e um tratamento bem melhor de nomes e termos — especialmente ao passar o vocabulário pelo parâmetro prompt.
Leitura relacionada
- Legendas SRT e VTT automáticas a partir de vídeos e webinars — Como obter legendas prontas com marcações de tempo a partir de um webinar ou vídeo: extração do áudio, formatos SRT e VTT, código e os problemas mais frequentes.
- Como montar um pipeline de transcrição para um acervo de áudio — Transcrever milhares de gravações sem perder nenhuma: fila de trabalho, concorrência, novas tentativas, retomada após uma queda e controle do valor da fatura.
- Como melhorar a precisão da transcrição: oito ajustes práticos — Oito mudanças que realmente movem a qualidade da transcrição: preparo do áudio, idioma explícito, o parâmetro prompt, corte em pausas, formatos e como medir o erro.