Início → Blog → Como transcrever a gravação de uma chamada
Como transcrever a gravação de uma chamada
Times de vendas e suporte gravam centenas de conversas por dia, mas ninguém consegue ouvir tudo. A transcrição transforma essas gravações em texto que dá para buscar, analisar e enviar para o CRM. Veja como montar isso em poucos minutos sem reescrever o código que já existe.
Por que transcrever chamadas
A versão em texto resolve quatro coisas que o áudio sozinho não resolve:
- Busca por conteúdo. Encontrar todas as chamadas em que um produto ou uma objeção foi mencionada leva segundos, não horas de escuta.
- Controle de qualidade. O gestor lê o texto em um minuto em vez de ouvir dez minutos de gravação.
- Análise. As transcrições vão para um modelo de linguagem e voltam como temas, tom e problemas recorrentes.
- Conformidade. Texto é mais fácil de armazenar e de auditar contra o script do que um arquivo de áudio.
O que você vai precisar
O conjunto mínimo são três coisas:
- As gravações em qualquer formato comum: mp3, wav, ogg, m4a. A telefonia costuma entregar mp3 ou wav.
- Uma chave de API. O cadastro leva um minuto e a chave sai na hora.
- Qualquer linguagem com um cliente HTTP. Abaixo há exemplos em Python e C#, mas qualquer uma serve.
Servidor próprio, placa de vídeo e instalação de modelos não entram na lista — o reconhecimento roda do lado do serviço.
Passo 1. Obtenha a chave de acesso
Cadastre-se e copie a chave no formato vs_live_… na área do cliente, seção «Conexão». A chave equivale a uma senha: guarde-a em variáveis de ambiente, nunca no código-fonte.
Os minutos gratuitos dão para rodar uma dezena de conversas reais e avaliar a qualidade antes de pagar qualquer coisa.
Passo 2. Envie a primeira gravação
O protocolo é compatível com o Whisper da OpenAI, então o SDK oficial funciona. Em Python:
from openai import OpenAI
client = OpenAI(base_url="https://voicesscribe.com/v1", api_key="sua chave")
with open("chamada-2026-08-18.mp3", "rb") as f:
result = client.audio.transcriptions.create(model="whisper-1", file=f)
print(result.text)
Em C# a ideia é a mesma, com o cliente oficial da OpenAI:
var options = new OpenAIClientOptions { Endpoint = new Uri("https://voicesscribe.com/v1") };
var client = new OpenAIClient(new ApiKeyCredential("sua chave"), options);
var audio = client.GetAudioClient("whisper-1");
var result = await audio.TranscribeAudioAsync("chamada.mp3");
Console.WriteLine(result.Value.Text);
Para testar sem escrever uma linha de código, direto do terminal:
curl https://voicesscribe.com/v1/audio/transcriptions \
-H "Authorization: Bearer sua chave" \
-F file=@chamada.mp3 -F model=whisper-1Passo 3. Escolha o formato da resposta
O parâmetro response_format decide o que volta:
| Valor | O que você recebe | Quando usar |
|---|---|---|
json | O texto inteiro | Gravar no CRM, busca por conteúdo |
verbose_json | Texto e segmentos com tempos e idioma | Marcar o diálogo, pular para um trecho |
srt, vtt | Legendas prontas | Gravações de reuniões e webinars |
text | Texto puro, sem envelope | Scripts rápidos e pipelines |
Passo 4. Melhore a precisão no seu vocabulário
Nomes de empresas, sobrenomes e códigos de produto saem bem mais certos quando você os sugere ao modelo pelo parâmetro prompt:
result = client.audio.transcriptions.create(
model="whisper-1", file=f,
prompt="Falamos dos planos Light, Ótimo e Premium; atendente Nogueira",
)
A dica não aparece na resposta — ela apenas desloca o reconhecimento na direção dos termos certos. Se o fluxo é de um idioma só, acrescente language="pt": acelera o processamento e elimina erros de detecção em falas curtas.
Passo 5. Coloque a transcrição em produção
O desenho que funciona para telefonia: assim que a gravação fica pronta, ela entra na fila e vai para o reconhecimento, e o resultado vai para o registro da negociação.
import os, pathlib
from openai import OpenAI
client = OpenAI(base_url="https://voicesscribe.com/v1", api_key=os.environ["VS_KEY"])
for path in pathlib.Path("gravacoes").glob("*.mp3"):
with path.open("rb") as f:
text = client.audio.transcriptions.create(model="whisper-1", file=f).text
path.with_suffix(".txt").write_text(text, encoding="utf-8")
print(path.name, "pronto")
O processamento roda mais rápido que o tempo real: uma conversa de um minuto sai em segundos, então até o arquivo de um dia inteiro é resolvido em poucos minutos.
Erros comuns e o que significam
| Código | Causa | Solução |
|---|---|---|
| 401 | Chave inválida ou bloqueada | Confira o cabeçalho Authorization: Bearer … |
| 400 | Arquivo vazio ou corrompido | Verifique se a gravação abre em um player |
| 413 | Arquivo maior que 25 MB | Comprima em mp3/opus ou divida em partes |
| 429 | Requisições demais ou minutos esgotados | Reduza o ritmo ou troque de plano |
Gravações longas compensam mais em opus ou mp3: uma hora de conversa em wav ocupa centenas de megabytes, em opus são poucos.
Teste com as suas próprias gravações. O cadastro leva um minuto e os minutos gratuitos bastam para avaliar a qualidade.
Obter uma chave de API grátisPerguntas frequentes
Quanto custa transcrever uma chamada?
A cobrança é por minuto de áudio, então o custo depende da duração da conversa. Quem se cadastra recebe minutos gratuitos na hora, o suficiente para testar a qualidade nas próprias gravações.
Qual a precisão em uma gravação telefônica?
O áudio de telefone é comprimido e tem faixa de frequências menor que uma gravação de estúdio, mas os modelos atuais lidam bem com ele. Em fala limpa quase não há erros; ruído, interrupções e sotaque forte reduzem a precisão.
Dá para separar as falas do atendente e do cliente?
Se a telefonia grava cada lado em um canal ou arquivo próprio, transcreva-os separadamente — a separação sai exata. A separação automática dentro de um arquivo único não é feita.
O que acontece com as gravações depois do processamento?
Gravações e transcrições ficam armazenadas por no máximo 24 horas, para você conferir o resultado, e depois são apagadas automaticamente.
Preciso de servidor próprio ou placa de vídeo?
Não. O reconhecimento roda do lado do serviço; do seu lado basta uma requisição HTTP.
Leitura relacionada
- Transcrição de mensagens de voz: WhatsApp, Telegram e outros — Como transformar mensagens de voz em texto automaticamente: o formato ogg/opus, o problema das gravações curtas e exemplos de código para bots de atendimento.
- Como migrar da API Whisper da OpenAI para outro serviço — Guia de migração a partir do Whisper da OpenAI: o que muda no código, o que se mantém igual, como comparar a qualidade e como não quebrar uma integração em produção.
- Como melhorar a precisão da transcrição: oito ajustes práticos — Oito mudanças que realmente movem a qualidade da transcrição: preparo do áudio, idioma explícito, o parâmetro prompt, corte em pausas, formatos e como medir o erro.