BerandaBlog → Cara mentranskrip wawancara tanpa mengetik ulang sendiri

Cara mentranskrip wawancara tanpa mengetik ulang sendiri

Diterbitkan 2026-08-18 · 6 menit baca

Wawancara satu jam butuh empat sampai enam jam untuk diketik ulang dengan tangan. Transkripsi otomatis memangkasnya menjadi beberapa menit waktu mesin ditambah dua puluh menit pemeriksaan — tetapi hanya kalau perekaman dan pemeriksaannya dilakukan dengan benar, dan di situlah sebagian besar kualitas ditentukan.

Sebagian besar akurasi ditentukan sebelum tombol rekam ditekan

Tidak ada model yang bisa memulihkan informasi yang tidak pernah terekam. Tiga hal ini lebih penting daripada parameter mana pun yang akan Anda setel nanti:

Merekam di laptop lewat mikrofon eksternal murah mengalahkan ponsel di dalam saku dengan selisih lebar, dan tidak berbiaya apa pun selain sedikit penataan.

Transkripsinya sendiri

Satu permintaan. Minta segmen dengan penanda waktu — untuk wawancara, itulah yang membuat kutipan bisa diperiksa:

from openai import OpenAI

client = OpenAI(base_url="https://voicesscribe.com/v1", api_key="kunci Anda")

with open("wawancara.mp3", "rb") as f:
    r = client.audio.transcriptions.create(
        model="whisper-1", file=f,
        response_format="verbose_json",
        language="id",
        prompt="Wawancara dengan Dr. Elena Marchetti, epidemiolog, tentang pemantauan air limbah.",
    )

for s in r.segments:
    m, dtk = divmod(int(s.start), 60)
    print(f"[{m:02d}:{dtk:02d}] {s.text.strip()}")

Parameter prompt adalah tempat nama narasumber, bidangnya, dan istilah khususnya. Wawancara padat dengan nama diri, dan nama diri persis di mana pengenalan tergelincir — satu baris petunjuk memperbaiki sebagian besarnya.

Dua suara dalam satu berkas

Satu rekaman campuran tidak kembali berlabel pembicara. Itu keterbatasan yang nyata, dan ada jalan keluarnya yang praktis:

Untuk kebanyakan wawancara, pilihan kedua dan ketiga sudah cukup. Jangan membangun pipeline pemisahan pembicara sebelum Anda tahu memang membutuhkannya.

Memeriksa hasilnya

Transkripsi otomatis akurat pada ucapan biasa dan paling tidak bisa diandalkan justru di tempat yang paling penting bagi sebuah wawancara: nama, angka, nama lembaga, dan istilah khusus. Satu pemeriksaan dua puluh menit yang fokus pada empat kategori itu menangkap hampir semuanya.

Penanda waktu membuat ini praktis — untuk kalimat mana pun yang Anda ragukan, lompat ke detik itu di rekaman dan dengarkan. Begitu juga cara menghindari kegagalan terburuk pada wawancara yang diterbitkan: kutipan yang enak dibaca dan tidak pernah diucapkan.

# mencari bagian yang layak Anda dengarkan sendiri
for s in r.segments:
    if any(c.isdigit() for c in s.text) or any(k[:1].isupper() for k in s.text.split()[1:]):
        print(f"{int(s.start)//60:02d}:{int(s.start)%60:02d}  {s.text.strip()}")

Dari transkrip ke yang sebenarnya Anda butuhkan

Transkrip adalah bahan mentah. Yang benar-benar dipakai biasanya salah satu dari tiga hal:

Ketiganya bisa dirancang oleh model bahasa dari teksnya, dengan satu aturan yang menjaganya tetap jujur: minta secara tegas kutipan kata per kata dan tidak ada apa pun yang tidak ada di transkrip. Setelah itu periksa kutipannya lewat penanda waktu.

Persetujuan dan penyimpanan

Dua hal yang layak dibereskan sebelum perekam menyala, bukan sesudahnya:

Untuk riset yang melewati kajian etik, jangka penyimpanan itu biasanya justru detail yang ditanyakan komitenya.

Coba dengan rekaman Anda sendiri. Pendaftaran memakan waktu satu menit, dan menit gratisnya cukup untuk menilai kualitasnya.

Ambil kunci API gratis

Pertanyaan yang sering diajukan

Berapa lama wawancara satu jam ditranskrip?

Beberapa menit waktu mesin — pemrosesan berjalan lebih cepat daripada waktu nyata. Anggarkan usaha yang sebenarnya untuk memeriksa nama, angka, dan istilah sesudahnya.

Apakah transkripnya menunjukkan siapa yang bicara?

Tidak dari satu rekaman campuran. Rekam tiap peserta ke jalur atau kanal terpisah lalu transkrip masing-masing — itu memberi pemisahan yang tepat secara cuma-cuma.

Seberapa akurat untuk ucapan beraksen?

Ucapan yang jelas dalam bahasa yang didukung baik dikenali dengan mantap, termasuk banyak aksen. Aksen berat, suara yang saling tumpang tindih, dan derau latar menurunkan akurasi — karena itulah penempatan mikrofon lebih penting daripada setelan apa pun.

Bisakah saya mendapat penanda waktu untuk kutipan?

Bisa — minta verbose_json dan tiap segmen kembali dengan waktu mulai dan selesai yang tepat, sehingga kutipan mana pun bisa diperiksa terhadap rekaman dalam hitungan detik.

Apakah rekamannya disimpan di suatu tempat?

Rekaman dan transkrip disimpan tidak lebih dari 24 jam supaya Anda bisa mengunduh hasilnya, setelah itu dihapus otomatis.

Bacaan terkait