Beranda → Blog → Cara mentranskrip rekaman rapat dan mendapat notulen yang berguna
Cara mentranskrip rekaman rapat dan mendapat notulen yang berguna
Rekaman rapat adalah folder yang tidak pernah dibuka siapa pun. Semua ingat ada keputusan yang diambil, tidak ada yang ingat keputusan yang mana, dan menonton ulang empat puluh menit demi menemukannya jelas tidak akan terjadi. Transkripsi mengubah rekaman itu menjadi sesuatu yang bisa dicari, dikutip, dan diringkas dalam hitungan detik.
Apa yang berubah dengan adanya transkrip
Empat hal yang tidak bisa diberikan rekaman itu sendiri:
- Pencarian lintas rapat. Satu kueri menemukan semua pembahasan yang menyebut satu klien, satu tenggat, atau satu pos anggaran.
- Notulen yang benar-benar ditulis. Keputusan dan tugas ditarik dari teks, bukan bergantung pada seseorang yang mengetik selama rapat berlangsung.
- Konteks bagi yang tidak hadir. Membaca transkrip memakan seperlima waktu dibanding menonton rekamannya.
- Jejak yang awet. Teks bertahan melewati perpindahan platform; arsip video biasanya tidak.
Di mana rekamannya sebenarnya berada
Sebelum menulis kode apa pun, temukan berkasnya. Tiap platform menyimpannya dengan cara berbeda:
| Platform | Tempat mencarinya | Yang Anda dapat |
|---|---|---|
| Zoom | Folder rekaman lokal, atau rekaman awan di akun web | mp4 plus jalur audio m4a terpisah |
| Microsoft Teams | OneDrive atau SharePoint, lewat obrolan rapat | mp4 |
| Google Meet | Folder Meet Recordings di Drive | mp4 |
Rekaman lokal Zoom adalah kasus yang paling nyaman: berkas audio saja sudah tersedia dan tidak perlu konversi.
Langkah 1. Ambil audionya dan perkecil
Satu jam video rapat berukuran gigabyte; satu jam ucapan yang sama dalam mp3 sekitar 25 MB. Rapat hampir seluruhnya ucapan, jadi jalur mono pada bitrate sederhana tidak kehilangan apa pun yang penting:
ffmpeg -i rapat.mp4 -vn -ac 1 -ar 16000 -b:a 48k rapat.mp3
Mono pada 16 kHz persis yang diharapkan model pengenalan. Berkasnya jadi cukup kecil sehingga rapat dua jam pun masih muat dalam beberapa permintaan saja.
Langkah 2. Transkrip dengan penanda waktu
Untuk rapat, mintalah verbose_json alih-alih teks polos: segmennya membawa waktu mulai dan selesai, dan itulah yang memungkinkan Anda melompat kembali ke rekaman nanti.
from openai import OpenAI
client = OpenAI(base_url="https://voicesscribe.com/v1", api_key="kunci Anda")
with open("rapat.mp3", "rb") as f:
r = client.audio.transcriptions.create(
model="whisper-1", file=f,
response_format="verbose_json",
prompt="Sinkronisasi produk mingguan: roadmap, rilis kuartal ketiga, migrasi Kubernetes",
)
for s in r.segments:
print(f"[{int(s.start)//60:02d}:{int(s.start)%60:02d}] {s.text.strip()}")
Parameter prompt adalah tempat kosakata perusahaan Anda: nama proyek, singkatan internal, nama orang. Rapat penuh istilah yang belum pernah didengar model umum mana pun, dan satu baris petunjuk memperbaiki sebagian besarnya.
Langkah 3. Ubah transkrip menjadi notulen
Transkrip itu sendiri masih bahan mentah. Yang berguna adalah ringkasan pendek berisi keputusan dan penanggung jawab, dan itu pekerjaan model bahasa — transkrip masuk, notulen terstruktur keluar:
notulen = llm(f"""Berikut transkrip sebuah rapat. Kembalikan:
1) ringkasan dalam lima butir,
2) keputusan yang diambil,
3) tugas dalam bentuk «penanggung jawab — tugas — tenggat».
Gunakan hanya yang ada di teks; jangan mengarang butir baru.
{transcript}""")
Dua aturan menjaga hasilnya tetap bisa dipercaya: minta secara tegas «hanya yang ada di teks», dan simpan penanda waktunya agar setiap klaim bisa diperiksa terhadap rekaman.
Siapa yang mengatakan apa
Jawaban jujurnya: satu jalur audio campuran tidak kembali dengan label pembicara. Ada dua jalan memutar yang praktis:
- Jalur terpisah. Zoom bisa merekam tiap peserta ke berkas audio sendiri. Transkrip satu per satu dan pemisahan per pembicara Anda dapat secara cuma-cuma.
- Perkenalan di awal. Kalau semua menyebut namanya pada menit pertama, baik model maupun pembaca jauh lebih mudah mengikuti siapa itu siapa.
Untuk notulen, penetapan siapa berbicara biasanya kalah penting dibanding keputusannya sendiri — jangan membangun sesuatu yang rumit sebelum Anda tahu memang membutuhkannya.
Rapat panjang dan biayanya
Penagihan dihitung per menit audio, jadi dua tuasnya jelas: jangan mentranskrip yang tidak dibutuhkan, dan jangan mengirim keheningan.
# memotong rapat panjang menjadi bagian setengah jam
ffmpeg -i rapat.mp3 -f segment -segment_time 1800 -c copy bagian%03d.mp3
Rapat status yang rutin biasanya layak ditranskrip utuh; lokakarya dua jam sering lebih baik ditangani dengan mentranskrip bagian tempat keputusan benar-benar diambil. Aturan praktis yang berhasil: transkrip semuanya selama sebulan, lihat apa yang benar-benar dicari orang, lalu persempit.
Coba dengan rekaman Anda sendiri. Pendaftaran memakan waktu satu menit, dan menit gratisnya cukup untuk menilai kualitasnya.
Ambil kunci API gratisPertanyaan yang sering diajukan
Bisakah berkas mp4 dikirim langsung?
Ambil dulu jalur audionya dengan ffmpeg. Video puluhan kali lebih besar dan gambarnya tidak dipakai sama sekali dalam pengenalan, jadi Anda hanya membayar waktu unggah.
Berapa lama rapat satu jam diproses?
Paling lama beberapa menit: pemrosesan berjalan lebih cepat daripada waktu nyata, dan memotong rekaman panjang memungkinkan bagian-bagiannya dikirim paralel.
Apakah transkrip menandai siapa yang berbicara?
Tidak dari satu jalur campuran. Rekam peserta ke berkas audio terpisah lalu transkrip satu per satu — itu memberi pemisahan yang tepat.
Bagaimana memastikan istilah internal tertulis benar?
Kirimkan lewat parameter prompt: nama proyek, singkatan, dan nama orang yang ditulis dalam satu baris meningkatkan pengenalannya secara nyata.
Apakah rekamannya disimpan di suatu tempat?
Rekaman dan transkrip bertahan tidak lebih dari 24 jam supaya Anda bisa mengunduh hasilnya dari area klien, setelah itu dihapus otomatis.
Bacaan terkait
- Subtitle SRT dan VTT otomatis dari video dan webinar — Cara mendapatkan berkas subtitle bertanda waktu dari rekaman webinar atau video: ekstraksi audio, format SRT dan VTT, contoh kode, dan masalah yang sering muncul.
- Cara mengubah rekaman telepon menjadi teks — Panduan langkah demi langkah mengubah rekaman percakapan telepon menjadi teks lewat API dalam hitungan menit. Lengkap dengan contoh Python, C#, dan daftar galat.
- Cara meningkatkan akurasi transkripsi: delapan langkah praktis — Delapan perubahan yang benar-benar menggerakkan kualitas transkripsi: menyiapkan audio, menyebut bahasa, parameter prompt, memotong di jeda, format, dan cara mengukur galat.