InícioBlog → Qual modelo Whisper escolher para reconhecimento de fala

Qual modelo Whisper escolher para reconhecimento de fala

Publicado em 2026-08-20 · 5 min de leitura

O Whisper existe em vários tamanhos, do tiny com 39 milhões de parâmetros ao large com 1,5 bilhão. A diferença não é só precisão: ela define velocidade, VRAM e, no fim, o custo por minuto de áudio. Veja como escolher conforme a tarefa.

A linha de modelos

ModeloParâmetrosVRAMVelocidadeBom para
tiny39 mi~1 GBmuito rápidarascunhos, comandos de voz
base74 mi~1 GBrápidaclipes curtos com áudio limpo
small244 mi~2 GBmoderadafala clara, um idioma
medium769 mi~5 GBmais lentaruído, sotaques, idiomas misturados
large-v31,55 bi~10 GBlentaprecisão máxima, áudio difícil

Há ainda o large-v3-turbo: o mesmo modelo grande com o decodificador enxugado. Roda várias vezes mais rápido e quase não perde precisão em fala comum.

Onde os modelos pequenos quebram

Numa gravação de estúdio com um único locutor, os tamanhos quase não se distinguem. A diferença aparece justamente quando o áudio complica:

O preço dessa escolha

Uma GPU própria para o large-v3 significa 10 GB de VRAM e uma máquina permanentemente ocupada. GPU alugada na nuvem cobra por hora, não por minuto de áudio, então o tempo ocioso custa igual ao tempo de trabalho. Um serviço por minuto elimina a questão: o modelo grande está sempre no ar e você paga o volume real.

Regra prática: abaixo de umas dez horas de áudio por dia, manter GPU própria custa mais do que pagar por minuto.

O que escolher na prática

Para mensagens de voz, chamadas e reuniões, use o maior modelo disponível: o ganho de precisão compensa a perda de velocidade, e corrigir erro à mão sai mais caro que ambos. Modelos pequenos se justificam em dois casos — reconhecimento no dispositivo sem rede e varreduras grosseiras de arquivos enormes, em que importa o volume e não cada palavra.

Nossa API roda large-v3-turbo, então não há o que escolher: a requisição envia whisper-1 apenas por compatibilidade com código existente.

Teste com as suas próprias gravações. O cadastro leva um minuto e os minutos gratuitos bastam para avaliar a qualidade.

Obter uma chave de API grátis

Perguntas frequentes

Qual a diferença entre large-v3-turbo e large-v3?

O turbo tem decodificador reduzido: várias vezes mais rápido com precisão praticamente igual em fala comum. Em áudio difícil o large completo ainda ganha por frações de ponto percentual.

É preciso indicar o modelo na requisição?

Envie whisper-1 — esse nome existe por compatibilidade. Qual modelo roda do nosso lado não é algo que você precise configurar.

O modelo maior é sempre mais preciso?

Em áudio difícil, sim. Numa gravação limpa de um locutor, a diferença entre small e large é de frações de ponto e invisível na prática.

Quanta VRAM uma instalação própria exige?

Cerca de 10 GB em fp16 para o large-v3. small e base cabem em 2 GB, com perda visível de precisão.

Leitura relacionada