Início → Blog → Qual formato de áudio usar para reconhecimento de fala
Qual formato de áudio usar para reconhecimento de fala
O formato parece um detalhe técnico até o arquivo esbarrar no limite de tamanho ou a conta de tráfego começar a surpreender. A precisão quase não depende do contêiner; o tempo de envio e o custo dependem muito. Veja o que enviar e por quê.
O que o serviço aceita
Todos os contêineres comuns funcionam: ogg, opus, mp3, wav, m4a, webm, flac. O teto é 25 MB por arquivo. Internamente o áudio é convertido para 16 kHz mono de qualquer forma, então qualidade acima desse patamar não muda o resultado.
Daí sai uma regra simples: não pague em megabytes por dados que serão descartados.
Quanto pesa uma hora
| Formato | Uma hora | Observação |
|---|---|---|
| wav 44,1 kHz estéreo | cerca de 600 MB | sem compressão, não cabe no limite |
| mp3 128 kbps | cerca de 55 MB | habitual, exagerado para voz |
| mp3 64 kbps mono | cerca de 28 MB | aceitável, ainda pesado |
| opus 24 kbps mono | cerca de 11 MB | o ponto ideal para fala |
O opus foi feito para voz e continua inteligível em bitrates nos quais o mp3 desmonta. Uma hora de conversa cabe em uma dezena de megabytes com folga.
Um comando para normalizar qualquer coisa
Seja o que for que a telefonia ou o gravador produziu, isto coloca tudo em forma:
ffmpeg -i input.wav -vn -ac 1 -ar 16000 -c:a libopus -b:a 24k output.ogg
Sinalizador por sinalizador: vn descarta a faixa de vídeo, ac 1 mistura para mono, ar 16000 define a taxa que o modelo espera, b:a 24k é bitrate de sobra para fala.
Mantenha estéreo em um único caso: quando os interlocutores estão em canais separados e você pretende transcrevê-los individualmente.
O que não fazer
- Recomprimir o que já é comprimido. mp3 para mp3 só acrescenta artefatos e não economiza — vá direto da fonte para opus.
- Aumentar a taxa de amostragem. Converter telefonia de 8 kHz para 48 kHz não acrescenta informação, só bytes.
- Remover silêncio com agressividade. Cortar pausas quebra as marcações de tempo e cola falas de pessoas diferentes.
- Enviar o vídeo inteiro. A faixa de áudio é vinte vezes menor e transcreve igual.
Teste com as suas próprias gravações. O cadastro leva um minuto e os minutos gratuitos bastam para avaliar a qualidade.
Obter uma chave de API grátisPerguntas frequentes
O formato afeta a precisão?
Muito pouco. A diferença só aparece em bitrates muito baixos — abaixo de 16 kbps a fala começa a se desfazer. Opus 24 kbps mono é indistinguível do wav original no resultado.
E se o arquivo passar de 25 MB?
Comprima para opus primeiro; costuma bastar. Se a gravação for mesmo longa, corte nas pausas e junte as transcrições.
É obrigatório converter antes de enviar?
Não, todos os formatos comuns são aceitos. Converter economiza tráfego e tempo de envio, e em gravações longas mantém você abaixo do limite.
Áudio de telefone a 8 kHz serve?
Sim, áudio telefônico transcreve bem. Não aumente a taxa de amostragem, isso não acrescenta informação alguma.
Leitura relacionada
- Preparando áudio para transcrição: receitas de ffmpeg — Comandos ffmpeg prontos para reconhecimento de fala: extrair áudio de vídeo, converter para mono, cortar silêncio, dividir nas pausas e separar canais.
- Como transcrever uma gravação que não cabe em uma requisição — O que fazer com áudio de várias horas: compressão, corte nas pausas, processamento paralelo dos pedaços e junção em um texto com tempos contínuos.
- Como melhorar a precisão da transcrição: oito ajustes práticos — Oito mudanças que realmente movem a qualidade da transcrição: preparo do áudio, idioma explícito, o parâmetro prompt, corte em pausas, formatos e como medir o erro.