Beranda → Blog → Cara mentranskrip wawancara tanpa mengetik ulang sendiri
Cara mentranskrip wawancara tanpa mengetik ulang sendiri
Wawancara satu jam butuh empat sampai enam jam untuk diketik ulang dengan tangan. Transkripsi otomatis memangkasnya menjadi beberapa menit waktu mesin ditambah dua puluh menit pemeriksaan — tetapi hanya kalau perekaman dan pemeriksaannya dilakukan dengan benar, dan di situlah sebagian besar kualitas ditentukan.
Sebagian besar akurasi ditentukan sebelum tombol rekam ditekan
Tidak ada model yang bisa memulihkan informasi yang tidak pernah terekam. Tiga hal ini lebih penting daripada parameter mana pun yang akan Anda setel nanti:
- Dekatkan mikrofon ke mulut. Ponsel yang tergeletak di antara dua orang di meja kafe merekam kafenya. Ponsel yang sama, dipegang setinggi dada, merekam wawancaranya.
- Matikan derau yang Anda kendalikan. Pendingin ruangan, jendela terbuka, musik latar — masing-masing memakan akurasi di setiap kalimat.
- Rekam dua jalur kalau bisa. Dua ponsel, atau panggilan yang direkam per kanal, memberi pemisahan pembicara secara cuma-cuma nanti. Ini keputusan bernilai tertinggi dalam seluruh alur kerja.
Merekam di laptop lewat mikrofon eksternal murah mengalahkan ponsel di dalam saku dengan selisih lebar, dan tidak berbiaya apa pun selain sedikit penataan.
Transkripsinya sendiri
Satu permintaan. Minta segmen dengan penanda waktu — untuk wawancara, itulah yang membuat kutipan bisa diperiksa:
from openai import OpenAI
client = OpenAI(base_url="https://voicesscribe.com/v1", api_key="kunci Anda")
with open("wawancara.mp3", "rb") as f:
r = client.audio.transcriptions.create(
model="whisper-1", file=f,
response_format="verbose_json",
language="id",
prompt="Wawancara dengan Dr. Elena Marchetti, epidemiolog, tentang pemantauan air limbah.",
)
for s in r.segments:
m, dtk = divmod(int(s.start), 60)
print(f"[{m:02d}:{dtk:02d}] {s.text.strip()}")
Parameter prompt adalah tempat nama narasumber, bidangnya, dan istilah khususnya. Wawancara padat dengan nama diri, dan nama diri persis di mana pengenalan tergelincir — satu baris petunjuk memperbaiki sebagian besarnya.
Dua suara dalam satu berkas
Satu rekaman campuran tidak kembali berlabel pembicara. Itu keterbatasan yang nyata, dan ada jalan keluarnya yang praktis:
- Jalur terpisah. Transkrip tiap jalur sendiri-sendiri dan Anda mendapat pemisahan sempurna, dengan waktu yang bisa disisipkan berselang-seling.
- Kanal terpisah. Kalau perekamnya menempatkan tiap orang di satu kanal, pisahkan berkasnya lebih dulu:
ffmpeg -i in.wav -map_channel 0.0.0 a.wav -map_channel 0.0.1 b.wav - Tandai setelahnya. Dalam wawancara dua orang, giliran bicara bergantian secara terduga, dan yang bertanya adalah pewawancara. Membacanya sekali sambil menambahkan nama hanya beberapa menit untuk teks satu jam.
Untuk kebanyakan wawancara, pilihan kedua dan ketiga sudah cukup. Jangan membangun pipeline pemisahan pembicara sebelum Anda tahu memang membutuhkannya.
Memeriksa hasilnya
Transkripsi otomatis akurat pada ucapan biasa dan paling tidak bisa diandalkan justru di tempat yang paling penting bagi sebuah wawancara: nama, angka, nama lembaga, dan istilah khusus. Satu pemeriksaan dua puluh menit yang fokus pada empat kategori itu menangkap hampir semuanya.
Penanda waktu membuat ini praktis — untuk kalimat mana pun yang Anda ragukan, lompat ke detik itu di rekaman dan dengarkan. Begitu juga cara menghindari kegagalan terburuk pada wawancara yang diterbitkan: kutipan yang enak dibaca dan tidak pernah diucapkan.
# mencari bagian yang layak Anda dengarkan sendiri
for s in r.segments:
if any(c.isdigit() for c in s.text) or any(k[:1].isupper() for k in s.text.split()[1:]):
print(f"{int(s.start)//60:02d}:{int(s.start)%60:02d} {s.text.strip()}")Dari transkrip ke yang sebenarnya Anda butuhkan
Transkrip adalah bahan mentah. Yang benar-benar dipakai biasanya salah satu dari tiga hal:
- Kutipan dengan penanda waktu — untuk artikel, bisa diperiksa terhadap rekaman.
- Tema lintas banyak wawancara — untuk riset, saat pertanyaan yang sama diajukan sepuluh kali.
- Ringkasan bagi yang tidak hadir — tim butuh kesimpulannya, bukan transkripnya.
Ketiganya bisa dirancang oleh model bahasa dari teksnya, dengan satu aturan yang menjaganya tetap jujur: minta secara tegas kutipan kata per kata dan tidak ada apa pun yang tidak ada di transkrip. Setelah itu periksa kutipannya lewat penanda waktu.
Persetujuan dan penyimpanan
Dua hal yang layak dibereskan sebelum perekam menyala, bukan sesudahnya:
- Beri tahu bahwa percakapan direkam dan audionya akan ditranskrip mesin. Di banyak yurisdiksi bagian pertama adalah kewajiban hukum; bagian kedua sekadar adil.
- Ketahui berapa lama audionya bertahan. Di sini rekaman dan transkrip dihapus otomatis setelah 24 jam — cukup lama untuk mengunduh hasilnya, cukup singkat sehingga tidak ada arsip yang bisa bocor.
Untuk riset yang melewati kajian etik, jangka penyimpanan itu biasanya justru detail yang ditanyakan komitenya.
Coba dengan rekaman Anda sendiri. Pendaftaran memakan waktu satu menit, dan menit gratisnya cukup untuk menilai kualitasnya.
Ambil kunci API gratisPertanyaan yang sering diajukan
Berapa lama wawancara satu jam ditranskrip?
Beberapa menit waktu mesin — pemrosesan berjalan lebih cepat daripada waktu nyata. Anggarkan usaha yang sebenarnya untuk memeriksa nama, angka, dan istilah sesudahnya.
Apakah transkripnya menunjukkan siapa yang bicara?
Tidak dari satu rekaman campuran. Rekam tiap peserta ke jalur atau kanal terpisah lalu transkrip masing-masing — itu memberi pemisahan yang tepat secara cuma-cuma.
Seberapa akurat untuk ucapan beraksen?
Ucapan yang jelas dalam bahasa yang didukung baik dikenali dengan mantap, termasuk banyak aksen. Aksen berat, suara yang saling tumpang tindih, dan derau latar menurunkan akurasi — karena itulah penempatan mikrofon lebih penting daripada setelan apa pun.
Bisakah saya mendapat penanda waktu untuk kutipan?
Bisa — minta verbose_json dan tiap segmen kembali dengan waktu mulai dan selesai yang tepat, sehingga kutipan mana pun bisa diperiksa terhadap rekaman dalam hitungan detik.
Apakah rekamannya disimpan di suatu tempat?
Rekaman dan transkrip disimpan tidak lebih dari 24 jam supaya Anda bisa mengunduh hasilnya, setelah itu dihapus otomatis.
Bacaan terkait
- Cara mentranskrip rekaman rapat dan mendapat notulen yang berguna — Ubah rekaman Zoom, Teams, dan Google Meet menjadi teks yang bisa dicari serta notulen terstruktur: di mana berkasnya, cara mentranskrip, dan cara menarik keputusannya.
- Siapa mengatakan apa: memisahkan pembicara dalam transkrip — Mengapa satu rekaman campuran tidak kembali berlabel pembicara, dan empat cara praktis untuk tetap mendapatkan pemisahannya — dari rekaman multijalur sampai pisah kanal.
- Cara meningkatkan akurasi transkripsi: delapan langkah praktis — Delapan perubahan yang benar-benar menggerakkan kualitas transkripsi: menyiapkan audio, menyebut bahasa, parameter prompt, memotong di jeda, format, dan cara mengukur galat.