Beranda → Blog → Cara mengubah rekaman telepon menjadi teks
Cara mengubah rekaman telepon menjadi teks
Tim penjualan dan dukungan merekam ratusan percakapan setiap hari, tetapi mendengarkan semuanya jelas mustahil. Transkripsi mengubah rekaman itu menjadi teks yang bisa dicari, dianalisis, dan dikirim ke CRM. Berikut cara menyiapkannya dalam beberapa menit tanpa menulis ulang kode yang sudah ada.
Mengapa rekaman telepon perlu ditranskrip
Versi teks menyelesaikan empat hal yang tidak bisa diberikan audio:
- Pencarian isi. Menemukan semua panggilan yang menyebut satu produk atau satu keberatan butuh hitungan detik, bukan berjam-jam mendengarkan.
- Kontrol kualitas. Atasan membaca teks dalam satu menit, bukan mendengarkan rekaman sepuluh menit.
- Analisis. Transkrip diberikan ke model bahasa dan kembali sebagai topik, nada bicara, serta masalah yang berulang.
- Kepatuhan. Teks lebih mudah disimpan dan diperiksa terhadap skrip dibanding arsip audio.
Apa saja yang dibutuhkan
Perlengkapan minimalnya ada tiga:
- Rekaman percakapan dalam format umum apa pun: mp3, wav, ogg, m4a. Sistem telepon biasanya memberikan mp3 atau wav.
- Kunci akses API. Pendaftaran satu menit dan kunci langsung diberikan.
- Bahasa pemrograman apa pun yang punya klien HTTP. Contoh di bawah memakai Python dan C#, tetapi apa pun bisa.
Server sendiri, kartu grafis, dan pemasangan model tidak diperlukan — pengenalan berjalan di sisi layanan.
Langkah 1. Ambil kunci akses
Daftar, lalu salin kunci berformat vs_live_… dari area klien, bagian «Koneksi». Kunci itu setara kata sandi: simpan di variabel lingkungan, bukan di dalam kode.
Menit gratis yang diberikan cukup untuk menjalankan sepuluh percakapan nyata dan menilai kualitasnya sebelum membayar apa pun.
Langkah 2. Kirim rekaman pertama
Protokolnya kompatibel dengan Whisper milik OpenAI, jadi SDK resmi bisa dipakai langsung. Python:
from openai import OpenAI
client = OpenAI(base_url="https://voicesscribe.com/v1", api_key="kunci Anda")
with open("telepon-2026-08-18.mp3", "rb") as f:
result = client.audio.transcriptions.create(model="whisper-1", file=f)
print(result.text)
C# — maksudnya sama, dengan klien resmi OpenAI:
var options = new OpenAIClientOptions { Endpoint = new Uri("https://voicesscribe.com/v1") };
var client = new OpenAIClient(new ApiKeyCredential("kunci Anda"), options);
var audio = client.GetAudioClient("whisper-1");
var result = await audio.TranscribeAudioAsync("telepon.mp3");
Console.WriteLine(result.Value.Text);
Untuk mencobanya tanpa menulis satu baris kode pun, langsung dari terminal:
curl https://voicesscribe.com/v1/audio/transcriptions \
-H "Authorization: Bearer kunci Anda" \
-F file=@telepon.mp3 -F model=whisper-1Langkah 3. Pilih format respons
Parameter response_format menentukan apa yang kembali:
| Nilai | Yang Anda dapat | Kapan dipakai |
|---|---|---|
json | Teks utuh | Simpan ke CRM, pencarian isi |
verbose_json | Teks plus segmen dengan waktu dan bahasa | Menandai dialog, melompat ke satu momen |
srt, vtt | Berkas subtitle siap pakai | Rekaman rapat dan webinar |
text | Teks polos tanpa pembungkus | Skrip cepat dan pipeline |
Langkah 4. Naikkan akurasi pada kosakata Anda
Nama perusahaan, nama orang, dan kode produk dikenali jauh lebih tepat kalau Anda menyebutkannya lewat parameter prompt:
result = client.audio.transcriptions.create(
model="whisper-1", file=f,
prompt="Membahas paket Ringan, Optimum, dan Premium; agen Wijaya",
)
Petunjuk itu tidak muncul di respons — ia hanya menggeser pengenalan ke arah istilah yang benar. Kalau arus rekaman jelas satu bahasa, tambahkan language="id": prosesnya lebih cepat dan galat deteksi pada kalimat pendek hilang.
Langkah 5. Jalankan transkripsi secara rutin
Pola yang bekerja untuk telepon: begitu rekaman siap, ia masuk antrean dan dikirim untuk dikenali, lalu hasilnya ditempel ke kartu transaksi.
import os, pathlib
from openai import OpenAI
client = OpenAI(base_url="https://voicesscribe.com/v1", api_key=os.environ["VS_KEY"])
for path in pathlib.Path("rekaman").glob("*.mp3"):
with path.open("rb") as f:
text = client.audio.transcriptions.create(model="whisper-1", file=f).text
path.with_suffix(".txt").write_text(text, encoding="utf-8")
print(path.name, "selesai")
Pemrosesan berjalan lebih cepat daripada waktu nyata: percakapan satu menit selesai dalam hitungan detik, jadi arsip sehari penuh pun beres dalam beberapa menit.
Galat yang sering muncul dan artinya
| Kode | Penyebab | Solusi |
|---|---|---|
| 401 | Kunci salah atau diblokir | Periksa header Authorization: Bearer … |
| 400 | Berkas kosong atau rusak | Pastikan rekaman bisa dibuka pemutar |
| 413 | Berkas lebih dari 25 MB | Kompres ke mp3/opus atau potong jadi beberapa bagian |
| 429 | Terlalu sering atau menit habis | Turunkan laju permintaan atau ganti paket |
Rekaman panjang lebih hemat disimpan dalam opus atau mp3: satu jam percakapan dalam wav memakan ratusan megabyte, dalam opus hanya beberapa.
Coba dengan rekaman Anda sendiri. Pendaftaran memakan waktu satu menit, dan menit gratisnya cukup untuk menilai kualitasnya.
Ambil kunci API gratisPertanyaan yang sering diajukan
Berapa biaya transkripsi satu panggilan?
Penagihan dihitung per menit audio, jadi biayanya bergantung pada durasi percakapan. Pengguna baru langsung mendapat menit gratis, cukup untuk menguji kualitas pada rekaman sendiri.
Seberapa akurat rekaman telepon dikenali?
Audio telepon terkompresi dan rentang frekuensinya lebih sempit daripada rekaman studio, tetapi model masa kini menanganinya dengan baik. Pada ucapan bersih hampir tidak ada galat; derau, saling potong, dan aksen kuat menurunkan akurasi.
Bisakah suara agen dan pelanggan dipisahkan?
Kalau sistem telepon merekam masing-masing pihak ke kanal atau berkas terpisah, transkrip keduanya secara terpisah — pemisahannya jadi tepat. Pemisahan otomatis di dalam satu berkas tidak dilakukan.
Apa yang terjadi pada rekaman setelah diproses?
Rekaman dan transkrip disimpan tidak lebih dari 24 jam supaya Anda sempat memeriksa hasilnya, lalu dihapus otomatis.
Perlukah server atau kartu grafis sendiri?
Tidak. Pengenalan berjalan di sisi layanan; dari sisi Anda cukup satu permintaan HTTP.
Bacaan terkait
- Transkripsi pesan suara: WhatsApp, Telegram, dan lainnya — Cara mengubah pesan suara menjadi teks secara otomatis: format ogg/opus, menangani rekaman pendek, dan contoh kode untuk bot layanan pelanggan.
- Cara pindah dari OpenAI Whisper API ke layanan lain — Panduan migrasi dari Whisper OpenAI: apa yang berubah di kode, apa yang tetap sama, cara membandingkan kualitas, dan cara tidak merusak integrasi yang sedang berjalan.
- Cara meningkatkan akurasi transkripsi: delapan langkah praktis — Delapan perubahan yang benar-benar menggerakkan kualitas transkripsi: menyiapkan audio, menyebut bahasa, parameter prompt, memotong di jeda, format, dan cara mengukur galat.