Beranda → Blog → Cara mengubah video YouTube menjadi teks
Cara mengubah video YouTube menjadi teks
Ada tiga cara mengubah video YouTube menjadi teks, dan ketiganya berbeda jauh dalam kualitas maupun dalam apa yang boleh Anda lakukan dengan hasilnya. Memilih yang keliru adalah cara paling umum berakhir dengan dinding kata tanpa tanda baca dan tanpa penanda waktu.
Pilihan 1: takarir yang sudah dibuat YouTube
Setiap video populer sudah punya takarir otomatis. Buka panel transkrip di bawah video, salin teksnya, selesai — tanpa kode, tanpa biaya.
Di mana cara ini berantakan:
- Kualitasnya sangat bervariasi. Takarir otomatis dibuat sekali, saat unggah, oleh model yang disetel untuk cakupan luas alih-alih ketepatan. Istilah teknis, nama, dan angka paling menderita.
- Banyak bahasa tanpa tanda baca. Yang Anda dapat adalah aliran kata: cukup untuk pencarian, tidak berguna untuk dibaca.
- Tidak bisa diskalakan. Menyalin manual cocok untuk satu video, bukan untuk arsip satu kanal.
- Bisa saja tidak ada sama sekali pada kanal kecil atau bahasa yang kurang umum.
Untuk satu video yang ingin Anda baca sekali, berhenti di sini — gratis dan sepuluh detik. Untuk apa pun yang berulang, lanjutkan membaca.
Pilihan 2: transkripsi audio Anda sendiri
Ini yang Anda butuhkan saat teksnya penting: untuk video Anda sendiri, untuk riset, untuk konten yang akan diterbitkan. Ambil audionya, kirim untuk dikenali, dapatkan teks bertanda baca lengkap dengan penanda waktu.
Mengambil audio dari berkas yang sudah Anda miliki:
ffmpeg -i video.mp4 -vn -ac 1 -ar 16000 -b:a 48k audio.mp3
Lalu satu permintaan:
from openai import OpenAI
client = OpenAI(base_url="https://voicesscribe.com/v1", api_key="kunci Anda")
with open("audio.mp3", "rb") as f:
r = client.audio.transcriptions.create(
model="whisper-1", file=f, response_format="verbose_json",
)
print(r.text)
Bedanya dengan takarir otomatis terasa langsung: tanda baca, huruf kapital yang benar, dan segmen dengan waktu presisi yang bisa Anda ubah menjadi bab atau takarir.
Catatan tentang mengunduh video orang lain
Mengunduh video dari YouTube dibatasi ketentuan layanannya, dan kontennya sendiri biasanya karya berhak cipta milik orang lain. Mentranskrip unggahan Anda sendiri, atau materi yang haknya Anda pegang, sepenuhnya wajar. Untuk selebihnya, pilihan yang jujur adalah panel transkrip bawaan atau meminta izin kepada pembuatnya.
Ini bukan nasihat hukum dan aturannya berbeda antarnegara — tetapi «alatnya memudahkan» tidak pernah menjadi pembelaan, dan ada baiknya tahu Anda berada di sisi mana sebelum membangun pipeline.
Pilihan 3: memproses arsip satu kanal
Untuk katalog lama Anda sendiri, pekerjaannya adalah pola massal: satu folder berkas, satu antrean kerja, dan keadaan yang diturunkan dari apa yang sudah ada di disk.
import pathlib
from openai import OpenAI
client = OpenAI(base_url="https://voicesscribe.com/v1", api_key="kunci Anda")
OUT = pathlib.Path("transkrip"); OUT.mkdir(exist_ok=True)
for video in pathlib.Path("video").glob("*.mp4"):
out = OUT / (video.stem + ".txt")
if out.exists():
continue # sudah selesai — jangan bayar dua kali
audio = video.with_suffix(".mp3")
# ffmpeg -i video.mp4 -vn -ac 1 -ar 16000 -b:a 48k audio.mp3
with audio.open("rb") as f:
out.write_text(client.audio.transcriptions.create(
model="whisper-1", file=f).text, encoding="utf-8")
Satu jam video menjadi sekitar 25 MB audio mono, yang muat dalam satu permintaan. Rekaman yang lebih panjang dipotong — batasnya 25 MB per permintaan.
Kalau yang dibutuhkan takarir, bukan teks polos
Kalau tujuannya memasang takarir kembali ke video alih-alih membaca teksnya, minta format takarir secara langsung dan lewati langkah konversi:
srt = client.audio.transcriptions.create(
model="whisper-1", file=f, response_format="srt",
)
open("video.srt", "w", encoding="utf-8").write(srt)
Berkas SRT yang dihasilkan diunggah pada bagian takarir video dan menggantikan jalur otomatisnya. Bagi kebanyakan kanal, langkah ini saja sudah lompatan kualitas yang kentara, karena takarir Anda kini bertanda baca dan nama-nama tertulis benar.
Membuat teksnya layak diterbitkan
- Masukkan kosakatanya. Nama kanal, nama narasumber, nama produk, dan jargon yang berulang masuk ke parameter
prompt— di situlah galat pengenalan menumpuk. - Sebutkan bahasanya kalau videonya satu bahasa:
language="id"menghapus salah deteksi di bagian awal. - Simpan penanda waktunya. Format
verbose_jsonmengembalikan segmen dengan waktu mulai dan selesai — bahan mentah untuk bab, potongan, dan tautan lompat. - Baca sekali sebelum menerbitkan. Sepuluh menit membetulkan nama dan memecah paragraf adalah beda antara halaman yang dibaca orang dan dinding teks.
Pilihan mana untuk keadaan apa
| Keadaan | Pilihan terbaik |
|---|---|
| Satu video, butuh intinya sekarang | Panel transkrip bawaan |
| Video Anda sendiri, teksnya akan diterbitkan | Transkripsi audio sendiri |
| Arsip satu kanal penuh | Pipeline massal atas audionya |
| Butuh takarir pada videonya | Transkripsi sendiri dengan response_format=srt |
| Video milik orang lain | Panel transkrip, atau minta izin pembuatnya |
Coba dengan rekaman Anda sendiri. Pendaftaran memakan waktu satu menit, dan menit gratisnya cukup untuk menilai kualitasnya.
Ambil kunci API gratisPertanyaan yang sering diajukan
Bisakah saya menyalin transkrip YouTube begitu saja?
Untuk satu video, bisa — panel transkripnya gratis dan seketika. Tapi itu dibuat otomatis, jadi tanda baca dan nama diri tidak bisa diandalkan, dan menyalin manual tidak bisa diskalakan ke satu arsip.
Perlukah videonya diunduh untuk ditranskrip?
Hanya jalur audionya, dan hanya untuk video yang haknya Anda pegang. Audio puluhan kali lebih kecil daripada video, dan gambarnya sama sekali tidak dipakai dalam pengenalan.
Berapa lama video satu jam diproses?
Beberapa menit: pemrosesan berjalan lebih cepat daripada waktu nyata. Mengambil audionya dengan ffmpeg biasanya lebih lama daripada transkripsinya sendiri.
Apakah saya mendapat penanda waktu?
Ya, dengan response_format=verbose_json Anda mendapat segmen dengan waktu mulai dan selesai yang presisi, dan dengan srt atau vtt Anda mendapat berkas takarir siap pakai.
Apakah transkripsi sendiri lebih baik daripada takarir otomatis YouTube?
Pada audio yang sama, satu jalan transkripsi khusus memberi tanda baca, huruf kapital yang benar, dan penanganan nama serta istilah yang jauh lebih baik — terutama saat kosakatanya dikirim lewat parameter prompt.
Bacaan terkait
- Subtitle SRT dan VTT otomatis dari video dan webinar — Cara mendapatkan berkas subtitle bertanda waktu dari rekaman webinar atau video: ekstraksi audio, format SRT dan VTT, contoh kode, dan masalah yang sering muncul.
- Cara membangun pipeline transkripsi untuk arsip audio — Mentranskrip ribuan rekaman tanpa kehilangan satu pun: antrean kerja, konkurensi, percobaan ulang, melanjutkan setelah proses mati, dan menjaga tagihan tetap terkendali.
- Cara meningkatkan akurasi transkripsi: delapan langkah praktis — Delapan perubahan yang benar-benar menggerakkan kualitas transkripsi: menyiapkan audio, menyebut bahasa, parameter prompt, memotong di jeda, format, dan cara mengukur galat.