Início → Blog → Servidor próprio com Whisper ou API de transcrição: o que custa menos
Servidor próprio com Whisper ou API de transcrição: o que custa menos
O Whisper é aberto, ocupa poucos gigabytes e sobe com um comando — a tentação de hospedar é compreensível. Mas a conta do hardware chega mensalmente enquanto o áudio chega por minuto, e em volumes pequenos a instalação própria perde feio para uma API. Vamos à conta.
O que a instalação própria inclui de verdade
Carregar o modelo é a parte fácil. O resto aparece um mês depois:
- GPU. O large-v3 pede cerca de 10 GB de VRAM, ou seja, placa de 12 GB para cima.
- Fila. Duas requisições simultâneas não cabem na mesma placa — é preciso um escalonador.
- Conversão de formatos. Os clientes mandam m4a, ogg, webm, então você mantém ffmpeg e persegue codecs.
- Plantão. Driver, atualização de CUDA, reinício após falha — isso é tempo de gente.
Fazendo as contas
Pegue uma carga típica: 500 minutos de áudio por mês.
| Opção | Gasto mensal | Ainda é preciso |
|---|---|---|
| GPU alugada na nuvem | a partir de 100 dólares na placa mais simples | instalação, atualizações, monitoramento |
| Placa própria | 400–800 dólares de entrada mais energia | espaço, refrigeração, parada em caso de defeito |
| API por minuto | 500 minutos vezes a tarifa | nada |
A placa alugada é cobrada vinte e quatro horas por dia, inclusive com a fila vazia. É aí que a estimativa de que "sai mais barato" desmorona: 500 minutos de áudio são menos de nove horas de placa em 720 disponíveis.
Quando a instalação própria ganha
Dois casos justificam servidor próprio.
Volume alto e constante. Quando a placa fica ocupada ao menos meio dia, o custo se dilui em milhares de minutos e o preço por minuto cai abaixo de qualquer API.
Dados que não podem sair. Saúde, bancos, trabalho sigiloso — ali a resposta não passa por preço. Nos demais casos, vale checar como o fornecedor guarda as gravações: se são apagadas em um dia e não vão para treinamento, o risco é comparável ao de qualquer nuvem que você já usa.
Uma ordem sensata
Começar pela instalação própria quase sempre é cedo demais: você não conhece nem a precisão no seu áudio nem o volume real. A sequência que funciona:
- Conectar-se a uma API e rodar gravações reais — isso é um dia de trabalho.
- Juntar um mês de minutos e olhar a fatura de verdade.
- Se o volume cresceu a ponto de manter a placa ocupada, trazer para dentro e deixar a API como reserva de pico.
Como o protocolo é o mesmo nos dois sentidos, migrar significa trocar endereço e chave — o código não se move.
Teste com as suas próprias gravações. O cadastro leva um minuto e os minutos gratuitos bastam para avaliar a qualidade.
Obter uma chave de API grátisPerguntas frequentes
A partir de que volume a GPU se paga?
Aproximadamente quando ela fica ocupada meio dia. Com algumas centenas de minutos por mês a placa fica ociosa e pagar por minuto sai mais barato.
Dá para rodar sem GPU?
Dá, na CPU, mas dezenas de vezes mais devagar: um minuto de áudio leva minutos. Serve para arquivos esporádicos, não para uma esteira.
Quão difícil é migrar depois?
O protocolo é idêntico, então o código do cliente troca URL e chave. O resto — fila, conversão, monitoramento — se constrói do zero.
E a privacidade usando uma API?
Olhe a retenção. Aqui gravações e transcrições são apagadas em 24 horas e nunca usadas para treinar modelos.
Leitura relacionada
- Qual modelo Whisper escolher para reconhecimento de fala — Como os modelos Whisper diferem de tiny a large-v3: velocidade, precisão, exigência de VRAM e quando um modelo menor é realmente a melhor escolha.
- Preço da transcrição: pelo que você realmente paga — Como funciona a cobrança da transcrição, quais partes do áudio custam dinheiro sem você notar, quando uma GPU própria sai mais barata e como estimar o gasto mensal.
- Privacidade e segurança das transcrições: o que perguntar ao fornecedor — Cinco perguntas para um fornecedor de reconhecimento de fala: retenção, uso dos dados em treinamento, criptografia, acesso de funcionários e exclusão sob pedido.