Início → Blog → Como transcrever uma entrevista sem digitá-la à mão
Como transcrever uma entrevista sem digitá-la à mão
Uma hora de entrevista leva de quatro a seis horas para ser digitada à mão. A transcrição automática reduz isso a minutos de máquina mais vinte minutos de conferência — mas só se a gravação e a conferência forem feitas direito, e é aí que a maior parte da qualidade se decide.
Quase toda a precisão se decide antes de apertar gravar
Nenhum modelo recupera informação que nunca foi captada. Três coisas importam mais que qualquer parâmetro que você venha a ajustar depois:
- Ponha o microfone perto das bocas. Um celular na mesa entre duas pessoas num café grava principalmente o café. O mesmo celular na altura do peito grava a entrevista.
- Elimine o ruído que está sob o seu controle. Ar-condicionado, janela aberta, música de fundo — cada um custa precisão em todas as frases.
- Grave duas faixas, se puder. Dois celulares, ou uma chamada gravada por canal, entregam a separação de vozes de graça depois. É a decisão de maior valor em todo o processo.
Gravar num notebook com um microfone externo barato ganha de longe de um celular no bolso, e não custa nada além de organização.
A transcrição em si
Uma requisição. Peça segmentos com tempos — numa entrevista, são eles que tornam as citações verificáveis:
from openai import OpenAI
client = OpenAI(base_url="https://voicesscribe.com/v1", api_key="sua chave")
with open("entrevista.mp3", "rb") as f:
r = client.audio.transcriptions.create(
model="whisper-1", file=f,
response_format="verbose_json",
language="pt",
prompt="Entrevista com a Dra. Elena Marchetti, epidemiologista, sobre vigilância em águas residuais.",
)
for s in r.segments:
m, seg = divmod(int(s.start), 60)
print(f"[{m:02d}:{seg:02d}] {s.text.strip()}")
O prompt é onde entram o nome do entrevistado, a área dele e os termos especializados. Entrevistas são densas em nomes próprios, e nomes próprios são exatamente onde o reconhecimento escorrega — uma linha de dica resolve a maioria.
Duas vozes em um arquivo
Uma gravação única e misturada não volta identificada por locutor. É uma limitação real, e tem contornos práticos:
- Faixas separadas. Transcreva cada faixa por si e você tem a separação perfeita, com tempos que permitem intercalar.
- Canais separados. Se o gravador colocou cada pessoa em um canal, divida o arquivo antes:
ffmpeg -i in.wav -map_channel 0.0.0 a.wav -map_channel 0.0.1 b.wav - Marque depois. Numa entrevista de duas pessoas os turnos se alternam de forma previsível e quem pergunta é o entrevistador. Ler uma vez e acrescentar os nomes leva poucos minutos para uma hora de texto.
Para a maioria das entrevistas a segunda e a terceira opções bastam. Não monte um pipeline de separação de locutores antes de saber que precisa de um.
Conferindo o resultado
A transcrição automática é precisa na fala comum e menos confiável exatamente onde mais importa numa entrevista: nomes, números, organizações e termos técnicos. Uma passada de vinte minutos focada nessas quatro categorias pega quase tudo.
Os tempos tornam isso prático — para qualquer frase duvidosa, salte para aquele segundo da gravação e ouça. É também assim que se evita a pior falha de uma entrevista publicada: uma citação que soa bem e nunca foi dita.
# localiza os trechos que valem ouvir você mesmo
for s in r.segments:
if any(c.isdigit() for c in s.text) or any(p[:1].isupper() for p in s.text.split()[1:]):
print(f"{int(s.start)//60:02d}:{int(s.start)%60:02d} {s.text.strip()}")Da transcrição ao que você realmente queria
A transcrição é matéria-prima. O que costuma ser usado é uma de três coisas:
- Citações com marcação de tempo — para a reportagem, conferíveis contra a gravação.
- Temas em várias entrevistas — para pesquisa, quando as mesmas perguntas foram feitas dez vezes.
- Um resumo para quem não estava lá — o time quer as conclusões, não a transcrição.
As três podem ser rascunhadas por um modelo de linguagem a partir do texto, com uma regra que mantém tudo honesto: peça explicitamente citações na íntegra e nada que não esteja na transcrição. Depois confira as citações pelos tempos.
Consentimento e armazenamento
Duas coisas para resolver antes de o gravador começar, não depois:
- Avise a pessoa de que está gravando e de que o áudio será transcrito por máquina. Em muitas jurisdições a primeira parte é exigência legal; a segunda é simplesmente justa.
- Saiba quanto tempo o áudio vive. Aqui, gravações e transcrições são apagadas automaticamente depois de 24 horas — tempo suficiente para baixar o resultado, e curto o bastante para não existir um acervo passível de vazamento.
Em pesquisa com comitê de ética, esse prazo de retenção costuma ser exatamente o detalhe sobre o qual perguntam.
Teste com as suas próprias gravações. O cadastro leva um minuto e os minutos gratuitos bastam para avaliar a qualidade.
Obter uma chave de API grátisPerguntas frequentes
Quanto tempo leva transcrever uma entrevista de uma hora?
Poucos minutos de máquina — o processamento roda mais rápido que o tempo real. Reserve o esforço real para conferir nomes, números e termos depois.
A transcrição mostra quem falou?
Não a partir de uma gravação única e misturada. Grave cada participante em uma faixa ou canal separado e transcreva-os em separado — isso dá a separação exata de graça.
Qual a precisão com sotaque?
Fala clara num idioma bem suportado é reconhecida com segurança, inclusive com muitos sotaques. Sotaque forte, vozes sobrepostas e ruído de fundo reduzem a precisão, e é por isso que a posição do microfone importa mais que qualquer ajuste.
Dá para ter marcações de tempo nas citações?
Sim — peça verbose_json e cada segmento volta com início e fim exatos, então qualquer citação pode ser conferida na gravação em segundos.
A gravação fica armazenada em algum lugar?
Gravações e transcrições ficam por no máximo 24 horas, para você baixar o resultado, e depois são apagadas automaticamente.
Leitura relacionada
- Como transcrever gravações de reuniões e ter atas utilizáveis — Transforme gravações do Zoom, Teams e Meet em texto pesquisável e atas estruturadas: onde está o arquivo, como transcrevê-lo e como extrair decisões e tarefas.
- Quem disse o quê: separando locutores em uma transcrição — Por que uma gravação única e misturada não volta identificada por locutor, e quatro formas práticas de obter a separação mesmo assim — da gravação multipista aos canais.
- Como melhorar a precisão da transcrição: oito ajustes práticos — Oito mudanças que realmente movem a qualidade da transcrição: preparo do áudio, idioma explícito, o parâmetro prompt, corte em pausas, formatos e como medir o erro.