InícioBlog → Quais idiomas o reconhecimento de fala realmente domina

Quais idiomas o reconhecimento de fala realmente domina

Publicado em 2026-08-18 · 5 min de leitura

Noventa e nove idiomas soa como um problema resolvido. Na prática a lista é um gradiente: uma dúzia de idiomas em que o reconhecimento chega perto do humano, um meio longo em que ele é útil com conferência, e uma cauda em que a saída dá mais trabalho do que economiza.

A lista é um gradiente, não um selo

O suporte vem de quanto daquele idioma havia nos dados de treino, e isso é distribuído de forma muito desigual. Um agrupamento prático e aproximado:

NívelIdiomasO que esperar
ForteInglês, espanhol, alemão, francês, italiano, português, russo, japonês, chinêsErro de um dígito em fala limpa; usável com conferência leve
BomPolonês, holandês, turco, coreano, ucraniano, árabe, sueco, tcheco e similaresConteúdo confiável, mais deslizes em nomes e termos
UtilizávelA maioria dos demais idiomas europeus e dos asiáticos maioresA essência sai certa; conte com edição de verdade
Cauda fracaIdiomas com poucos recursos, no fim da listaTeste no seu próprio áudio antes de construir algo em cima

O único número que importa é o que você mede nas suas gravações — sotaque, qualidade do áudio e assunto deslocam o resultado mais do que o nível da tabela.

Como a detecção funciona e quando falha

Por padrão o idioma é detectado automaticamente pelo começo da gravação. Em qualquer coisa mais longa que algumas frases isso é confiável. Falha em duas situações:

Os dois casos se resolvem dizendo qual é o idioma:

r = client.audio.transcriptions.create(
    model="whisper-1", file=f, language="pt",
)

Use o código de duas letras. Informá-lo também pula a etapa de detecção, então o processamento fica marginalmente mais rápido.

Conferindo o que foi detectado

Quando o fluxo é de fato multilíngue, deixe a detecção rodar e leia o resultado — ele volta acompanhado de um valor de confiança:

r = client.audio.transcriptions.create(
    model="whisper-1", file=f, response_format="verbose_json",
)

print(r.language, r.language_probability)

if r.language_probability < 0.6:
    enviar_para_revisao(r)     # confiança baixa — conferir à mão

Essa é também a forma mais barata de rotear mensagens que chegam: detecte o idioma, mande a conversa para quem o fala e marque os poucos por cento incertos para um humano.

Gravações que trocam de idioma

Esta é a limitação real, e vale entendê-la com precisão: o idioma é decidido uma vez, pelo começo da gravação, e o resto é transcrito naquele modo. Quem começa em alemão e passa ao inglês no meio da frase terá a parte em inglês transcrita como se fosse alemão — muitas vezes como algo que parece plausível e não faz sentido.

Duas maneiras de lidar:

O que não funciona é esperar que uma única requisição acompanhe a troca. Nada nos parâmetros muda isso.

Nomes e termos são o ponto fraco em todo idioma

Em toda a lista, os erros se concentram no mesmo lugar: nomes próprios. Nomes de produtos, sobrenomes, topônimos, siglas — palavras que o modelo tem pouca razão para esperar. A correção é a mesma em todo lugar:

r = client.audio.transcriptions.create(
    model="whisper-1", file=f, language="fr",
    prompt="Intervenants : Amélie Roussel, Karim Benali. Produits : Kestrel, Hawknest.",
)

Escreva a dica no idioma do áudio. Ela inclina o reconhecimento para aquelas grafias e, como efeito colateral, para o estilo de pontuação da própria dica.

O que testar antes de se comprometer

  1. Vinte gravações reais no idioma alvo, nas condições da sua produção — não amostras limpas de estúdio.
  2. Meça a taxa de erro naquilo que importa: se o negócio precisa de números de pedido, conte os erros em números à parte.
  3. Rode com e sem language definido — em trechos curtos a diferença costuma ser maior que a de qualquer outra mudança.
  4. Acrescente uma lista de termos e meça de novo. Se o seu problema são nomes próprios, é aqui que ele se resolve.

Uma tarde disso diz mais que qualquer benchmark publicado, porque foi medido no áudio que você vai realmente enviar.

Teste com as suas próprias gravações. O cadastro leva um minuto e os minutos gratuitos bastam para avaliar a qualidade.

Obter uma chave de API grátis

Perguntas frequentes

Os 99 idiomas têm a mesma precisão?

Não. Uma dúzia de idiomas muito falados chega perto da precisão humana em fala limpa; a qualidade cai gradualmente ao longo da lista. Teste sempre nas suas próprias gravações em vez de confiar no número.

Devo definir o idioma ou deixar detectar?

Defina quando o áudio é de um idioma só, sobretudo em trechos curtos, em que a detecção tem pouco com que trabalhar. Deixe a detecção ligada quando as gravações realmente chegam em idiomas diferentes.

O que acontece se a pessoa trocar de idioma?

O idioma é decidido pelo começo da gravação e o resto é transcrito naquele modo. Divida o áudio na troca e transcreva cada parte em separado.

Como sei qual idioma foi detectado?

Peça verbose_json — a resposta inclui o idioma detectado e uma probabilidade. Probabilidade baixa é um sinal confiável para revisar aquela gravação.

O parâmetro prompt funciona em todos os idiomas?

Funciona, e deve ser escrito no idioma do áudio. É a correção mais eficaz para nomes e termos especializados, que são a principal fonte de erro em qualquer idioma.

Leitura relacionada