InícioBlog → Como transcrever a gravação de uma chamada

Como transcrever a gravação de uma chamada

Publicado em 2026-08-18 · 6 min de leitura

Times de vendas e suporte gravam centenas de conversas por dia, mas ninguém consegue ouvir tudo. A transcrição transforma essas gravações em texto que dá para buscar, analisar e enviar para o CRM. Veja como montar isso em poucos minutos sem reescrever o código que já existe.

Por que transcrever chamadas

A versão em texto resolve quatro coisas que o áudio sozinho não resolve:

O que você vai precisar

O conjunto mínimo são três coisas:

  1. As gravações em qualquer formato comum: mp3, wav, ogg, m4a. A telefonia costuma entregar mp3 ou wav.
  2. Uma chave de API. O cadastro leva um minuto e a chave sai na hora.
  3. Qualquer linguagem com um cliente HTTP. Abaixo há exemplos em Python e C#, mas qualquer uma serve.

Servidor próprio, placa de vídeo e instalação de modelos não entram na lista — o reconhecimento roda do lado do serviço.

Passo 1. Obtenha a chave de acesso

Cadastre-se e copie a chave no formato vs_live_… na área do cliente, seção «Conexão». A chave equivale a uma senha: guarde-a em variáveis de ambiente, nunca no código-fonte.

Os minutos gratuitos dão para rodar uma dezena de conversas reais e avaliar a qualidade antes de pagar qualquer coisa.

Passo 2. Envie a primeira gravação

O protocolo é compatível com o Whisper da OpenAI, então o SDK oficial funciona. Em Python:

from openai import OpenAI

client = OpenAI(base_url="https://voicesscribe.com/v1", api_key="sua chave")

with open("chamada-2026-08-18.mp3", "rb") as f:
    result = client.audio.transcriptions.create(model="whisper-1", file=f)

print(result.text)

Em C# a ideia é a mesma, com o cliente oficial da OpenAI:

var options = new OpenAIClientOptions { Endpoint = new Uri("https://voicesscribe.com/v1") };
var client = new OpenAIClient(new ApiKeyCredential("sua chave"), options);
var audio = client.GetAudioClient("whisper-1");
var result = await audio.TranscribeAudioAsync("chamada.mp3");
Console.WriteLine(result.Value.Text);

Para testar sem escrever uma linha de código, direto do terminal:

curl https://voicesscribe.com/v1/audio/transcriptions \
  -H "Authorization: Bearer sua chave" \
  -F file=@chamada.mp3 -F model=whisper-1

Passo 3. Escolha o formato da resposta

O parâmetro response_format decide o que volta:

ValorO que você recebeQuando usar
jsonO texto inteiroGravar no CRM, busca por conteúdo
verbose_jsonTexto e segmentos com tempos e idiomaMarcar o diálogo, pular para um trecho
srt, vttLegendas prontasGravações de reuniões e webinars
textTexto puro, sem envelopeScripts rápidos e pipelines

Passo 4. Melhore a precisão no seu vocabulário

Nomes de empresas, sobrenomes e códigos de produto saem bem mais certos quando você os sugere ao modelo pelo parâmetro prompt:

result = client.audio.transcriptions.create(
    model="whisper-1", file=f,
    prompt="Falamos dos planos Light, Ótimo e Premium; atendente Nogueira",
)

A dica não aparece na resposta — ela apenas desloca o reconhecimento na direção dos termos certos. Se o fluxo é de um idioma só, acrescente language="pt": acelera o processamento e elimina erros de detecção em falas curtas.

Passo 5. Coloque a transcrição em produção

O desenho que funciona para telefonia: assim que a gravação fica pronta, ela entra na fila e vai para o reconhecimento, e o resultado vai para o registro da negociação.

import os, pathlib
from openai import OpenAI

client = OpenAI(base_url="https://voicesscribe.com/v1", api_key=os.environ["VS_KEY"])

for path in pathlib.Path("gravacoes").glob("*.mp3"):
    with path.open("rb") as f:
        text = client.audio.transcriptions.create(model="whisper-1", file=f).text
    path.with_suffix(".txt").write_text(text, encoding="utf-8")
    print(path.name, "pronto")

O processamento roda mais rápido que o tempo real: uma conversa de um minuto sai em segundos, então até o arquivo de um dia inteiro é resolvido em poucos minutos.

Erros comuns e o que significam

CódigoCausaSolução
401Chave inválida ou bloqueadaConfira o cabeçalho Authorization: Bearer …
400Arquivo vazio ou corrompidoVerifique se a gravação abre em um player
413Arquivo maior que 25 MBComprima em mp3/opus ou divida em partes
429Requisições demais ou minutos esgotadosReduza o ritmo ou troque de plano

Gravações longas compensam mais em opus ou mp3: uma hora de conversa em wav ocupa centenas de megabytes, em opus são poucos.

Teste com as suas próprias gravações. O cadastro leva um minuto e os minutos gratuitos bastam para avaliar a qualidade.

Obter uma chave de API grátis

Perguntas frequentes

Quanto custa transcrever uma chamada?

A cobrança é por minuto de áudio, então o custo depende da duração da conversa. Quem se cadastra recebe minutos gratuitos na hora, o suficiente para testar a qualidade nas próprias gravações.

Qual a precisão em uma gravação telefônica?

O áudio de telefone é comprimido e tem faixa de frequências menor que uma gravação de estúdio, mas os modelos atuais lidam bem com ele. Em fala limpa quase não há erros; ruído, interrupções e sotaque forte reduzem a precisão.

Dá para separar as falas do atendente e do cliente?

Se a telefonia grava cada lado em um canal ou arquivo próprio, transcreva-os separadamente — a separação sai exata. A separação automática dentro de um arquivo único não é feita.

O que acontece com as gravações depois do processamento?

Gravações e transcrições ficam armazenadas por no máximo 24 horas, para você conferir o resultado, e depois são apagadas automaticamente.

Preciso de servidor próprio ou placa de vídeo?

Não. O reconhecimento roda do lado do serviço; do seu lado basta uma requisição HTTP.

Leitura relacionada