Início → Blog → Quais idiomas o reconhecimento de fala realmente domina
Quais idiomas o reconhecimento de fala realmente domina
Noventa e nove idiomas soa como um problema resolvido. Na prática a lista é um gradiente: uma dúzia de idiomas em que o reconhecimento chega perto do humano, um meio longo em que ele é útil com conferência, e uma cauda em que a saída dá mais trabalho do que economiza.
A lista é um gradiente, não um selo
O suporte vem de quanto daquele idioma havia nos dados de treino, e isso é distribuído de forma muito desigual. Um agrupamento prático e aproximado:
| Nível | Idiomas | O que esperar |
|---|---|---|
| Forte | Inglês, espanhol, alemão, francês, italiano, português, russo, japonês, chinês | Erro de um dígito em fala limpa; usável com conferência leve |
| Bom | Polonês, holandês, turco, coreano, ucraniano, árabe, sueco, tcheco e similares | Conteúdo confiável, mais deslizes em nomes e termos |
| Utilizável | A maioria dos demais idiomas europeus e dos asiáticos maiores | A essência sai certa; conte com edição de verdade |
| Cauda fraca | Idiomas com poucos recursos, no fim da lista | Teste no seu próprio áudio antes de construir algo em cima |
O único número que importa é o que você mede nas suas gravações — sotaque, qualidade do áudio e assunto deslocam o resultado mais do que o nível da tabela.
Como a detecção funciona e quando falha
Por padrão o idioma é detectado automaticamente pelo começo da gravação. Em qualquer coisa mais longa que algumas frases isso é confiável. Falha em duas situações:
- Trechos muito curtos. Três segundos de fala são pouca evidência, e uma frase curta em um idioma pode parecer outro.
- Aberturas ruidosas. Se a gravação começa com música, tom de espera ou vozes sobrepostas, a detecção trabalha em cima disso.
Os dois casos se resolvem dizendo qual é o idioma:
r = client.audio.transcriptions.create(
model="whisper-1", file=f, language="pt",
)
Use o código de duas letras. Informá-lo também pula a etapa de detecção, então o processamento fica marginalmente mais rápido.
Conferindo o que foi detectado
Quando o fluxo é de fato multilíngue, deixe a detecção rodar e leia o resultado — ele volta acompanhado de um valor de confiança:
r = client.audio.transcriptions.create(
model="whisper-1", file=f, response_format="verbose_json",
)
print(r.language, r.language_probability)
if r.language_probability < 0.6:
enviar_para_revisao(r) # confiança baixa — conferir à mão
Essa é também a forma mais barata de rotear mensagens que chegam: detecte o idioma, mande a conversa para quem o fala e marque os poucos por cento incertos para um humano.
Gravações que trocam de idioma
Esta é a limitação real, e vale entendê-la com precisão: o idioma é decidido uma vez, pelo começo da gravação, e o resto é transcrito naquele modo. Quem começa em alemão e passa ao inglês no meio da frase terá a parte em inglês transcrita como se fosse alemão — muitas vezes como algo que parece plausível e não faz sentido.
Duas maneiras de lidar:
- Divida na troca e transcreva cada parte com o seu idioma, se as trocas forem poucas e previsíveis (uma entrevista bilíngue, uma conferência com dois palestrantes).
- Aceite o idioma dominante se o segundo aparece só em empréstimos e termos técnicos ocasionais — esse caso costuma funcionar bem, porque essas palavras são transcritas como soam.
O que não funciona é esperar que uma única requisição acompanhe a troca. Nada nos parâmetros muda isso.
Nomes e termos são o ponto fraco em todo idioma
Em toda a lista, os erros se concentram no mesmo lugar: nomes próprios. Nomes de produtos, sobrenomes, topônimos, siglas — palavras que o modelo tem pouca razão para esperar. A correção é a mesma em todo lugar:
r = client.audio.transcriptions.create(
model="whisper-1", file=f, language="fr",
prompt="Intervenants : Amélie Roussel, Karim Benali. Produits : Kestrel, Hawknest.",
)
Escreva a dica no idioma do áudio. Ela inclina o reconhecimento para aquelas grafias e, como efeito colateral, para o estilo de pontuação da própria dica.
O que testar antes de se comprometer
- Vinte gravações reais no idioma alvo, nas condições da sua produção — não amostras limpas de estúdio.
- Meça a taxa de erro naquilo que importa: se o negócio precisa de números de pedido, conte os erros em números à parte.
- Rode com e sem
languagedefinido — em trechos curtos a diferença costuma ser maior que a de qualquer outra mudança. - Acrescente uma lista de termos e meça de novo. Se o seu problema são nomes próprios, é aqui que ele se resolve.
Uma tarde disso diz mais que qualquer benchmark publicado, porque foi medido no áudio que você vai realmente enviar.
Teste com as suas próprias gravações. O cadastro leva um minuto e os minutos gratuitos bastam para avaliar a qualidade.
Obter uma chave de API grátisPerguntas frequentes
Os 99 idiomas têm a mesma precisão?
Não. Uma dúzia de idiomas muito falados chega perto da precisão humana em fala limpa; a qualidade cai gradualmente ao longo da lista. Teste sempre nas suas próprias gravações em vez de confiar no número.
Devo definir o idioma ou deixar detectar?
Defina quando o áudio é de um idioma só, sobretudo em trechos curtos, em que a detecção tem pouco com que trabalhar. Deixe a detecção ligada quando as gravações realmente chegam em idiomas diferentes.
O que acontece se a pessoa trocar de idioma?
O idioma é decidido pelo começo da gravação e o resto é transcrito naquele modo. Divida o áudio na troca e transcreva cada parte em separado.
Como sei qual idioma foi detectado?
Peça verbose_json — a resposta inclui o idioma detectado e uma probabilidade. Probabilidade baixa é um sinal confiável para revisar aquela gravação.
O parâmetro prompt funciona em todos os idiomas?
Funciona, e deve ser escrito no idioma do áudio. É a correção mais eficaz para nomes e termos especializados, que são a principal fonte de erro em qualquer idioma.
Leitura relacionada
- Transcrição de mensagens de voz: WhatsApp, Telegram e outros — Como transformar mensagens de voz em texto automaticamente: o formato ogg/opus, o problema das gravações curtas e exemplos de código para bots de atendimento.
- Como melhorar a precisão da transcrição: oito ajustes práticos — Oito mudanças que realmente movem a qualidade da transcrição: preparo do áudio, idioma explícito, o parâmetro prompt, corte em pausas, formatos e como medir o erro.
- Como transcrever a gravação de uma chamada — Guia passo a passo para transformar a gravação de uma ligação em texto pela API em poucos minutos. Com exemplos em Python e C# e a lista de erros mais comuns.