Beranda → Blog → Format audio mana yang sebaiknya dipakai untuk transkripsi
Format audio mana yang sebaiknya dipakai untuk transkripsi
Format terlihat sepele sampai berkas mentok di batas ukuran atau tagihan bandwidth mulai mengagetkan. Akurasi hampir tidak bergantung pada wadahnya; waktu unggah dan biaya sangat bergantung. Ini panduan singkatnya.
Apa yang diterima layanan
Semua wadah umum bisa: ogg, opus, mp3, wav, m4a, webm, flac. Batasnya 25 MB per berkas. Di dalam layanan audio tetap diubah ke 16 kHz mono, jadi kualitas di atas ambang itu tidak mengubah hasil.
Dari situ muncul aturan sederhana: jangan membayar megabita untuk data yang akan dibuang.
Berapa berat satu jam
| Format | Satu jam | Catatan |
|---|---|---|
| wav 44,1 kHz stereo | sekitar 600 MB | tanpa kompresi, tidak muat batas |
| mp3 128 kbps | sekitar 55 MB | biasa dipakai, berlebihan untuk suara |
| mp3 64 kbps mono | sekitar 28 MB | bisa diterima, masih berat |
| opus 24 kbps mono | sekitar 11 MB | paling pas untuk suara |
Opus dirancang untuk suara dan tetap jelas pada bitrate yang membuat mp3 berantakan. Satu jam percakapan muat dalam sepuluhan megabita dengan sisa ruang.
Satu perintah untuk menormalkan apa pun
Apa pun keluaran sistem telepon atau perekam Anda, perintah ini merapikannya:
ffmpeg -i input.wav -vn -ac 1 -ar 16000 -c:a libopus -b:a 24k output.ogg
Satu per satu: vn membuang jalur video, ac 1 menyatukan ke mono, ar 16000 menetapkan laju cuplik yang diharapkan model, b:a 24k bitrate yang lebih dari cukup untuk suara.
Pertahankan stereo hanya pada satu kasus: ketika pembicara direkam di kanal terpisah dan Anda ingin mentranskrip mereka sendiri-sendiri.
Yang sebaiknya tidak dilakukan
- Mengompres yang sudah terkompres. mp3 ke mp3 hanya menambah cacat tanpa menghemat — langsung dari sumber ke opus.
- Menaikkan laju cuplik. Mengubah telepon 8 kHz jadi 48 kHz tidak menambah informasi, hanya bita.
- Membuang keheningan berlebihan. Menghapus jeda merusak stempel waktu dan menempelkan ucapan orang berbeda.
- Mengirim video utuh. Jalur audionya dua puluh kali lebih kecil dan hasilnya sama.
Coba dengan rekaman Anda sendiri. Pendaftaran memakan waktu satu menit, dan menit gratisnya cukup untuk menilai kualitasnya.
Ambil kunci API gratisPertanyaan yang sering diajukan
Apakah format memengaruhi akurasi?
Sangat sedikit. Bedanya baru terasa pada bitrate sangat rendah — di bawah 16 kbps suara mulai hancur. Opus 24 kbps mono hasilnya sama dengan wav asli.
Bagaimana kalau berkas lebih dari 25 MB?
Kompres ke opus dulu; biasanya itu cukup. Kalau rekamannya memang panjang, potong di jeda lalu gabungkan teksnya.
Harus dikonversi sebelum dikirim?
Tidak, semua format umum diterima. Konversi menghemat bandwidth dan waktu unggah, dan pada rekaman panjang menjauhkan dari batas ukuran.
Rekaman telepon 8 kHz cukup bagus?
Ya, audio telepon terbaca andal. Jangan dinaikkan laju cupliknya, itu tidak menambah informasi apa pun.
Bacaan terkait
- Menyiapkan audio untuk transkripsi: resep ffmpeg — Perintah ffmpeg siap pakai untuk pengenalan suara: mengambil audio dari video, mono, membuang keheningan, memotong di jeda, dan memisahkan kanal stereo.
- Cara mentranskrip rekaman yang tidak muat satu permintaan — Menangani audio berjam-jam: kompresi, pemotongan di jeda, pemrosesan potongan secara paralel, dan penggabungan teks dengan stempel waktu berkelanjutan.
- Cara meningkatkan akurasi transkripsi: delapan langkah praktis — Delapan perubahan yang benar-benar menggerakkan kualitas transkripsi: menyiapkan audio, menyebut bahasa, parameter prompt, memotong di jeda, format, dan cara mengukur galat.