Beranda → Blog → Bahasa mana yang benar-benar ditangani dengan baik
Bahasa mana yang benar-benar ditangani dengan baik
Sembilan puluh sembilan bahasa terdengar seperti persoalan yang sudah selesai. Dalam praktiknya daftar itu adalah gradasi: selusin bahasa yang pengenalannya mendekati manusia, bagian tengah yang panjang di mana ia berguna asal diperiksa, dan ekor tempat keluarannya butuh lebih banyak kerja daripada yang dihematnya.
Daftarnya gradasi, bukan tanda centang
Dukungan berasal dari seberapa banyak bahasa itu ada di data pelatihan, dan itu terbagi sangat timpang. Pengelompokan praktis secara kasar:
| Tingkat | Bahasa | Yang bisa diharapkan |
|---|---|---|
| Kuat | Inggris, Spanyol, Jerman, Prancis, Italia, Portugis, Rusia, Jepang, Mandarin | Galat satu digit pada ucapan bersih; layak pakai dengan pemeriksaan ringan |
| Baik | Polandia, Belanda, Turki, Korea, Ukraina, Arab, Swedia, Ceko, dan sejenisnya | Isinya andal, lebih banyak keliru pada nama dan istilah |
| Bisa dipakai | Sebagian besar bahasa Eropa lain dan bahasa Asia besar, termasuk Indonesia | Intinya benar; siapkan penyuntingan sungguhan |
| Ekor lemah | Bahasa bersumber daya kecil di ujung daftar | Uji pada audio Anda sendiri sebelum membangun apa pun di atasnya |
Satu-satunya angka yang berarti adalah yang Anda ukur pada rekaman Anda sendiri — aksen, kualitas audio, dan topik menggeser hasilnya lebih jauh daripada tingkat pada tabel.
Cara deteksi bekerja, dan kapan ia gagal
Secara bawaan bahasa dikenali otomatis dari awal rekaman. Pada apa pun yang lebih panjang dari beberapa kalimat, ini andal. Ia gagal dalam dua situasi:
- Potongan yang sangat pendek. Tiga detik ucapan adalah bukti yang tipis, dan frasa pendek dalam satu bahasa bisa tampak seperti bahasa lain.
- Pembuka yang berisik. Kalau rekaman dimulai dengan musik, nada tunggu, atau suara saling tumpang tindih, deteksi bekerja dari situ.
Keduanya diperbaiki dengan menyebut bahasanya:
r = client.audio.transcriptions.create(
model="whisper-1", file=f, language="id",
)
Gunakan kode dua huruf. Menyebutkannya juga melewati tahap deteksi, jadi pemrosesannya sedikit lebih cepat.
Memeriksa apa yang terdeteksi
Kalau arusnya memang multibahasa, biarkan deteksi berjalan lalu baca hasilnya — ia dikembalikan bersama nilai keyakinan:
r = client.audio.transcriptions.create(
model="whisper-1", file=f, response_format="verbose_json",
)
print(r.language, r.language_probability)
if r.language_probability < 0.6:
antrekan_untuk_ditinjau(r) # keyakinan rendah — periksa manual
Ini juga cara termurah mengarahkan pesan masuk: kenali bahasanya, kirim percakapan ke agen yang menguasainya, dan tandai beberapa persen yang meragukan untuk manusia.
Rekaman yang berganti bahasa
Inilah keterbatasan yang sesungguhnya, dan layak dipahami dengan tepat: bahasa ditentukan sekali, dari awal rekaman, dan sisanya ditranskrip dalam mode itu. Orang yang mulai dalam bahasa Jerman lalu beralih ke Inggris di tengah kalimat akan mendapati bagian Inggrisnya ditranskrip seolah-olah Jerman — sering berupa omong kosong yang tampak masuk akal.
Dua cara menanganinya:
- Potong di titik peralihan dan transkrip tiap bagian dengan bahasanya sendiri, kalau peralihannya sedikit dan terduga (wawancara dwibahasa, konferensi dengan dua pembicara).
- Terima bahasa dominannya kalau bahasa kedua hanya muncul sebagai serapan dan istilah teknis sesekali — kasus itu biasanya berjalan baik, karena kata-kata seperti itu ditranskrip sebagaimana terdengar.
Yang tidak bisa diharapkan adalah satu permintaan yang mengikuti peralihannya. Tidak ada parameter yang mengubah itu.
Nama dan istilah adalah titik lemah di semua bahasa
Di sepanjang daftar itu, galat berkumpul di tempat yang sama: nama diri. Nama produk, nama keluarga, nama tempat, singkatan — kata-kata yang tidak punya alasan untuk diperkirakan model. Perbaikannya sama di mana-mana:
r = client.audio.transcriptions.create(
model="whisper-1", file=f, language="fr",
prompt="Intervenants : Amélie Roussel, Karim Benali. Produits : Kestrel, Hawknest.",
)
Tulis petunjuknya dalam bahasa audionya. Ia mencondongkan pengenalan ke ejaan tersebut dan, sebagai efek samping, ke gaya tanda baca petunjuk itu sendiri.
Apa yang perlu diuji sebelum berkomitmen
- Dua puluh rekaman nyata dalam bahasa sasaran, sesuai kondisi produksi Anda — bukan sampel studio yang bersih.
- Ukur tingkat galatnya pada hal yang Anda pedulikan: kalau bisnis butuh nomor pesanan, hitung galat angkanya terpisah.
- Coba dengan dan tanpa
languagedisetel — pada potongan pendek selisihnya sering lebih besar daripada perubahan apa pun. - Tambahkan daftar istilah lalu ukur lagi. Kalau masalah Anda nama diri, di sinilah ia terpecahkan.
Setengah hari mengerjakan ini memberi tahu lebih banyak daripada tolok ukur mana pun yang diterbitkan, karena diukur pada audio yang benar-benar akan Anda kirim.
Coba dengan rekaman Anda sendiri. Pendaftaran memakan waktu satu menit, dan menit gratisnya cukup untuk menilai kualitasnya.
Ambil kunci API gratisPertanyaan yang sering diajukan
Apakah 99 bahasa itu sama akuratnya?
Tidak. Selusin bahasa yang banyak dipakai mendekati akurasi manusia pada ucapan bersih; kualitasnya menurun bertahap ke bawah daftar. Selalu uji pada rekaman Anda sendiri alih-alih memercayai jumlahnya.
Sebaiknya menyetel bahasanya atau membiarkan terdeteksi?
Setel kalau audionya satu bahasa, terutama untuk potongan pendek yang membuat deteksi punya sedikit bahan. Biarkan deteksi menyala kalau rekaman memang datang dalam bahasa berbeda-beda.
Apa yang terjadi kalau pembicara berganti bahasa?
Bahasa ditentukan dari awal rekaman dan sisanya ditranskrip dalam mode itu. Potong audionya di titik peralihan dan transkrip tiap bagian terpisah.
Bagaimana saya tahu bahasa mana yang terdeteksi?
Minta verbose_json — responsnya memuat bahasa yang terdeteksi beserta probabilitasnya. Probabilitas rendah adalah sinyal yang andal untuk meninjau rekaman itu.
Apakah parameter prompt bekerja di semua bahasa?
Ya, dan sebaiknya ditulis dalam bahasa audionya. Ia perbaikan paling ampuh untuk nama dan istilah khusus, yang merupakan sumber galat utama di bahasa mana pun.
Bacaan terkait
- Transkripsi pesan suara: WhatsApp, Telegram, dan lainnya — Cara mengubah pesan suara menjadi teks secara otomatis: format ogg/opus, menangani rekaman pendek, dan contoh kode untuk bot layanan pelanggan.
- Cara meningkatkan akurasi transkripsi: delapan langkah praktis — Delapan perubahan yang benar-benar menggerakkan kualitas transkripsi: menyiapkan audio, menyebut bahasa, parameter prompt, memotong di jeda, format, dan cara mengukur galat.
- Cara mengubah rekaman telepon menjadi teks — Panduan langkah demi langkah mengubah rekaman percakapan telepon menjadi teks lewat API dalam hitungan menit. Lengkap dengan contoh Python, C#, dan daftar galat.