BerandaBlog → Bahasa mana yang benar-benar ditangani dengan baik

Bahasa mana yang benar-benar ditangani dengan baik

Diterbitkan 2026-08-18 · 5 menit baca

Sembilan puluh sembilan bahasa terdengar seperti persoalan yang sudah selesai. Dalam praktiknya daftar itu adalah gradasi: selusin bahasa yang pengenalannya mendekati manusia, bagian tengah yang panjang di mana ia berguna asal diperiksa, dan ekor tempat keluarannya butuh lebih banyak kerja daripada yang dihematnya.

Daftarnya gradasi, bukan tanda centang

Dukungan berasal dari seberapa banyak bahasa itu ada di data pelatihan, dan itu terbagi sangat timpang. Pengelompokan praktis secara kasar:

TingkatBahasaYang bisa diharapkan
KuatInggris, Spanyol, Jerman, Prancis, Italia, Portugis, Rusia, Jepang, MandarinGalat satu digit pada ucapan bersih; layak pakai dengan pemeriksaan ringan
BaikPolandia, Belanda, Turki, Korea, Ukraina, Arab, Swedia, Ceko, dan sejenisnyaIsinya andal, lebih banyak keliru pada nama dan istilah
Bisa dipakaiSebagian besar bahasa Eropa lain dan bahasa Asia besar, termasuk IndonesiaIntinya benar; siapkan penyuntingan sungguhan
Ekor lemahBahasa bersumber daya kecil di ujung daftarUji pada audio Anda sendiri sebelum membangun apa pun di atasnya

Satu-satunya angka yang berarti adalah yang Anda ukur pada rekaman Anda sendiri — aksen, kualitas audio, dan topik menggeser hasilnya lebih jauh daripada tingkat pada tabel.

Cara deteksi bekerja, dan kapan ia gagal

Secara bawaan bahasa dikenali otomatis dari awal rekaman. Pada apa pun yang lebih panjang dari beberapa kalimat, ini andal. Ia gagal dalam dua situasi:

Keduanya diperbaiki dengan menyebut bahasanya:

r = client.audio.transcriptions.create(
    model="whisper-1", file=f, language="id",
)

Gunakan kode dua huruf. Menyebutkannya juga melewati tahap deteksi, jadi pemrosesannya sedikit lebih cepat.

Memeriksa apa yang terdeteksi

Kalau arusnya memang multibahasa, biarkan deteksi berjalan lalu baca hasilnya — ia dikembalikan bersama nilai keyakinan:

r = client.audio.transcriptions.create(
    model="whisper-1", file=f, response_format="verbose_json",
)

print(r.language, r.language_probability)

if r.language_probability < 0.6:
    antrekan_untuk_ditinjau(r)   # keyakinan rendah — periksa manual

Ini juga cara termurah mengarahkan pesan masuk: kenali bahasanya, kirim percakapan ke agen yang menguasainya, dan tandai beberapa persen yang meragukan untuk manusia.

Rekaman yang berganti bahasa

Inilah keterbatasan yang sesungguhnya, dan layak dipahami dengan tepat: bahasa ditentukan sekali, dari awal rekaman, dan sisanya ditranskrip dalam mode itu. Orang yang mulai dalam bahasa Jerman lalu beralih ke Inggris di tengah kalimat akan mendapati bagian Inggrisnya ditranskrip seolah-olah Jerman — sering berupa omong kosong yang tampak masuk akal.

Dua cara menanganinya:

Yang tidak bisa diharapkan adalah satu permintaan yang mengikuti peralihannya. Tidak ada parameter yang mengubah itu.

Nama dan istilah adalah titik lemah di semua bahasa

Di sepanjang daftar itu, galat berkumpul di tempat yang sama: nama diri. Nama produk, nama keluarga, nama tempat, singkatan — kata-kata yang tidak punya alasan untuk diperkirakan model. Perbaikannya sama di mana-mana:

r = client.audio.transcriptions.create(
    model="whisper-1", file=f, language="fr",
    prompt="Intervenants : Amélie Roussel, Karim Benali. Produits : Kestrel, Hawknest.",
)

Tulis petunjuknya dalam bahasa audionya. Ia mencondongkan pengenalan ke ejaan tersebut dan, sebagai efek samping, ke gaya tanda baca petunjuk itu sendiri.

Apa yang perlu diuji sebelum berkomitmen

  1. Dua puluh rekaman nyata dalam bahasa sasaran, sesuai kondisi produksi Anda — bukan sampel studio yang bersih.
  2. Ukur tingkat galatnya pada hal yang Anda pedulikan: kalau bisnis butuh nomor pesanan, hitung galat angkanya terpisah.
  3. Coba dengan dan tanpa language disetel — pada potongan pendek selisihnya sering lebih besar daripada perubahan apa pun.
  4. Tambahkan daftar istilah lalu ukur lagi. Kalau masalah Anda nama diri, di sinilah ia terpecahkan.

Setengah hari mengerjakan ini memberi tahu lebih banyak daripada tolok ukur mana pun yang diterbitkan, karena diukur pada audio yang benar-benar akan Anda kirim.

Coba dengan rekaman Anda sendiri. Pendaftaran memakan waktu satu menit, dan menit gratisnya cukup untuk menilai kualitasnya.

Ambil kunci API gratis

Pertanyaan yang sering diajukan

Apakah 99 bahasa itu sama akuratnya?

Tidak. Selusin bahasa yang banyak dipakai mendekati akurasi manusia pada ucapan bersih; kualitasnya menurun bertahap ke bawah daftar. Selalu uji pada rekaman Anda sendiri alih-alih memercayai jumlahnya.

Sebaiknya menyetel bahasanya atau membiarkan terdeteksi?

Setel kalau audionya satu bahasa, terutama untuk potongan pendek yang membuat deteksi punya sedikit bahan. Biarkan deteksi menyala kalau rekaman memang datang dalam bahasa berbeda-beda.

Apa yang terjadi kalau pembicara berganti bahasa?

Bahasa ditentukan dari awal rekaman dan sisanya ditranskrip dalam mode itu. Potong audionya di titik peralihan dan transkrip tiap bagian terpisah.

Bagaimana saya tahu bahasa mana yang terdeteksi?

Minta verbose_json — responsnya memuat bahasa yang terdeteksi beserta probabilitasnya. Probabilitas rendah adalah sinyal yang andal untuk meninjau rekaman itu.

Apakah parameter prompt bekerja di semua bahasa?

Ya, dan sebaiknya ditulis dalam bahasa audionya. Ia perbaikan paling ampuh untuk nama dan istilah khusus, yang merupakan sumber galat utama di bahasa mana pun.

Bacaan terkait