BerandaBlog → Cara mengubah rekaman telepon menjadi teks

Cara mengubah rekaman telepon menjadi teks

Diterbitkan 2026-08-18 · 6 menit baca

Tim penjualan dan dukungan merekam ratusan percakapan setiap hari, tetapi mendengarkan semuanya jelas mustahil. Transkripsi mengubah rekaman itu menjadi teks yang bisa dicari, dianalisis, dan dikirim ke CRM. Berikut cara menyiapkannya dalam beberapa menit tanpa menulis ulang kode yang sudah ada.

Mengapa rekaman telepon perlu ditranskrip

Versi teks menyelesaikan empat hal yang tidak bisa diberikan audio:

Apa saja yang dibutuhkan

Perlengkapan minimalnya ada tiga:

  1. Rekaman percakapan dalam format umum apa pun: mp3, wav, ogg, m4a. Sistem telepon biasanya memberikan mp3 atau wav.
  2. Kunci akses API. Pendaftaran satu menit dan kunci langsung diberikan.
  3. Bahasa pemrograman apa pun yang punya klien HTTP. Contoh di bawah memakai Python dan C#, tetapi apa pun bisa.

Server sendiri, kartu grafis, dan pemasangan model tidak diperlukan — pengenalan berjalan di sisi layanan.

Langkah 1. Ambil kunci akses

Daftar, lalu salin kunci berformat vs_live_… dari area klien, bagian «Koneksi». Kunci itu setara kata sandi: simpan di variabel lingkungan, bukan di dalam kode.

Menit gratis yang diberikan cukup untuk menjalankan sepuluh percakapan nyata dan menilai kualitasnya sebelum membayar apa pun.

Langkah 2. Kirim rekaman pertama

Protokolnya kompatibel dengan Whisper milik OpenAI, jadi SDK resmi bisa dipakai langsung. Python:

from openai import OpenAI

client = OpenAI(base_url="https://voicesscribe.com/v1", api_key="kunci Anda")

with open("telepon-2026-08-18.mp3", "rb") as f:
    result = client.audio.transcriptions.create(model="whisper-1", file=f)

print(result.text)

C# — maksudnya sama, dengan klien resmi OpenAI:

var options = new OpenAIClientOptions { Endpoint = new Uri("https://voicesscribe.com/v1") };
var client = new OpenAIClient(new ApiKeyCredential("kunci Anda"), options);
var audio = client.GetAudioClient("whisper-1");
var result = await audio.TranscribeAudioAsync("telepon.mp3");
Console.WriteLine(result.Value.Text);

Untuk mencobanya tanpa menulis satu baris kode pun, langsung dari terminal:

curl https://voicesscribe.com/v1/audio/transcriptions \
  -H "Authorization: Bearer kunci Anda" \
  -F file=@telepon.mp3 -F model=whisper-1

Langkah 3. Pilih format respons

Parameter response_format menentukan apa yang kembali:

NilaiYang Anda dapatKapan dipakai
jsonTeks utuhSimpan ke CRM, pencarian isi
verbose_jsonTeks plus segmen dengan waktu dan bahasaMenandai dialog, melompat ke satu momen
srt, vttBerkas subtitle siap pakaiRekaman rapat dan webinar
textTeks polos tanpa pembungkusSkrip cepat dan pipeline

Langkah 4. Naikkan akurasi pada kosakata Anda

Nama perusahaan, nama orang, dan kode produk dikenali jauh lebih tepat kalau Anda menyebutkannya lewat parameter prompt:

result = client.audio.transcriptions.create(
    model="whisper-1", file=f,
    prompt="Membahas paket Ringan, Optimum, dan Premium; agen Wijaya",
)

Petunjuk itu tidak muncul di respons — ia hanya menggeser pengenalan ke arah istilah yang benar. Kalau arus rekaman jelas satu bahasa, tambahkan language="id": prosesnya lebih cepat dan galat deteksi pada kalimat pendek hilang.

Langkah 5. Jalankan transkripsi secara rutin

Pola yang bekerja untuk telepon: begitu rekaman siap, ia masuk antrean dan dikirim untuk dikenali, lalu hasilnya ditempel ke kartu transaksi.

import os, pathlib
from openai import OpenAI

client = OpenAI(base_url="https://voicesscribe.com/v1", api_key=os.environ["VS_KEY"])

for path in pathlib.Path("rekaman").glob("*.mp3"):
    with path.open("rb") as f:
        text = client.audio.transcriptions.create(model="whisper-1", file=f).text
    path.with_suffix(".txt").write_text(text, encoding="utf-8")
    print(path.name, "selesai")

Pemrosesan berjalan lebih cepat daripada waktu nyata: percakapan satu menit selesai dalam hitungan detik, jadi arsip sehari penuh pun beres dalam beberapa menit.

Galat yang sering muncul dan artinya

KodePenyebabSolusi
401Kunci salah atau diblokirPeriksa header Authorization: Bearer …
400Berkas kosong atau rusakPastikan rekaman bisa dibuka pemutar
413Berkas lebih dari 25 MBKompres ke mp3/opus atau potong jadi beberapa bagian
429Terlalu sering atau menit habisTurunkan laju permintaan atau ganti paket

Rekaman panjang lebih hemat disimpan dalam opus atau mp3: satu jam percakapan dalam wav memakan ratusan megabyte, dalam opus hanya beberapa.

Coba dengan rekaman Anda sendiri. Pendaftaran memakan waktu satu menit, dan menit gratisnya cukup untuk menilai kualitasnya.

Ambil kunci API gratis

Pertanyaan yang sering diajukan

Berapa biaya transkripsi satu panggilan?

Penagihan dihitung per menit audio, jadi biayanya bergantung pada durasi percakapan. Pengguna baru langsung mendapat menit gratis, cukup untuk menguji kualitas pada rekaman sendiri.

Seberapa akurat rekaman telepon dikenali?

Audio telepon terkompresi dan rentang frekuensinya lebih sempit daripada rekaman studio, tetapi model masa kini menanganinya dengan baik. Pada ucapan bersih hampir tidak ada galat; derau, saling potong, dan aksen kuat menurunkan akurasi.

Bisakah suara agen dan pelanggan dipisahkan?

Kalau sistem telepon merekam masing-masing pihak ke kanal atau berkas terpisah, transkrip keduanya secara terpisah — pemisahannya jadi tepat. Pemisahan otomatis di dalam satu berkas tidak dilakukan.

Apa yang terjadi pada rekaman setelah diproses?

Rekaman dan transkrip disimpan tidak lebih dari 24 jam supaya Anda sempat memeriksa hasilnya, lalu dihapus otomatis.

Perlukah server atau kartu grafis sendiri?

Tidak. Pengenalan berjalan di sisi layanan; dari sisi Anda cukup satu permintaan HTTP.

Bacaan terkait