Início → Blog → Qual modelo Whisper escolher para reconhecimento de fala
Qual modelo Whisper escolher para reconhecimento de fala
O Whisper existe em vários tamanhos, do tiny com 39 milhões de parâmetros ao large com 1,5 bilhão. A diferença não é só precisão: ela define velocidade, VRAM e, no fim, o custo por minuto de áudio. Veja como escolher conforme a tarefa.
A linha de modelos
| Modelo | Parâmetros | VRAM | Velocidade | Bom para |
|---|---|---|---|---|
| tiny | 39 mi | ~1 GB | muito rápida | rascunhos, comandos de voz |
| base | 74 mi | ~1 GB | rápida | clipes curtos com áudio limpo |
| small | 244 mi | ~2 GB | moderada | fala clara, um idioma |
| medium | 769 mi | ~5 GB | mais lenta | ruído, sotaques, idiomas misturados |
| large-v3 | 1,55 bi | ~10 GB | lenta | precisão máxima, áudio difícil |
Há ainda o large-v3-turbo: o mesmo modelo grande com o decodificador enxugado. Roda várias vezes mais rápido e quase não perde precisão em fala comum.
Onde os modelos pequenos quebram
Numa gravação de estúdio com um único locutor, os tamanhos quase não se distinguem. A diferença aparece justamente quando o áudio complica:
- Nomes próprios e jargão. O modelo pequeno troca com confiança um sobrenome por uma palavra comum parecida.
- Sotaque e fala rápida. tiny e base perdem trechos inteiros quando as pessoas se atropelam.
- Troca de idioma no meio. Modelos pequenos mudam mal e às vezes traduzem em vez de transcrever.
- Ruído. Rua, carro, escritório aberto — é aí que o modelo pequeno começa a inventar.
O preço dessa escolha
Uma GPU própria para o large-v3 significa 10 GB de VRAM e uma máquina permanentemente ocupada. GPU alugada na nuvem cobra por hora, não por minuto de áudio, então o tempo ocioso custa igual ao tempo de trabalho. Um serviço por minuto elimina a questão: o modelo grande está sempre no ar e você paga o volume real.
Regra prática: abaixo de umas dez horas de áudio por dia, manter GPU própria custa mais do que pagar por minuto.
O que escolher na prática
Para mensagens de voz, chamadas e reuniões, use o maior modelo disponível: o ganho de precisão compensa a perda de velocidade, e corrigir erro à mão sai mais caro que ambos. Modelos pequenos se justificam em dois casos — reconhecimento no dispositivo sem rede e varreduras grosseiras de arquivos enormes, em que importa o volume e não cada palavra.
Nossa API roda large-v3-turbo, então não há o que escolher: a requisição envia whisper-1 apenas por compatibilidade com código existente.
Teste com as suas próprias gravações. O cadastro leva um minuto e os minutos gratuitos bastam para avaliar a qualidade.
Obter uma chave de API grátisPerguntas frequentes
Qual a diferença entre large-v3-turbo e large-v3?
O turbo tem decodificador reduzido: várias vezes mais rápido com precisão praticamente igual em fala comum. Em áudio difícil o large completo ainda ganha por frações de ponto percentual.
É preciso indicar o modelo na requisição?
Envie whisper-1 — esse nome existe por compatibilidade. Qual modelo roda do nosso lado não é algo que você precise configurar.
O modelo maior é sempre mais preciso?
Em áudio difícil, sim. Numa gravação limpa de um locutor, a diferença entre small e large é de frações de ponto e invisível na prática.
Quanta VRAM uma instalação própria exige?
Cerca de 10 GB em fp16 para o large-v3. small e base cabem em 2 GB, com perda visível de precisão.
Leitura relacionada
- Servidor próprio com Whisper ou API de transcrição: o que custa menos — Comparação honesta entre rodar o Whisper por conta própria e usar uma API: custo de GPU, manutenção, tempo até o primeiro resultado e o volume de equilíbrio.
- Como melhorar a precisão da transcrição: oito ajustes práticos — Oito mudanças que realmente movem a qualidade da transcrição: preparo do áudio, idioma explícito, o parâmetro prompt, corte em pausas, formatos e como medir o erro.
- Quais idiomas o reconhecimento de fala realmente domina — Os 99 idiomas suportados não são iguais: quais são confiáveis, onde a precisão cai, como funciona a detecção e o que fazer com gravações que trocam de idioma.