Beranda → Blog → Model Whisper mana yang sebaiknya dipilih
Model Whisper mana yang sebaiknya dipilih
Whisper hadir dalam beberapa ukuran, dari tiny dengan 39 juta parameter sampai large dengan 1,5 miliar. Bedanya bukan cuma akurasi: ukuran menentukan kecepatan, VRAM, dan pada akhirnya biaya per menit audio. Ini cara memilihnya sesuai kebutuhan.
Daftar modelnya
| Model | Parameter | VRAM | Kecepatan | Cocok untuk |
|---|---|---|---|---|
| tiny | 39 juta | ~1 GB | sangat cepat | transkrip kasar, perintah suara |
| base | 74 juta | ~1 GB | cepat | klip pendek dengan audio bersih |
| small | 244 juta | ~2 GB | sedang | ucapan jelas, satu bahasa |
| medium | 769 juta | ~5 GB | lebih lambat | derau, aksen, bahasa campuran |
| large-v3 | 1,55 miliar | ~10 GB | lambat | akurasi maksimum, audio sulit |
Ada juga large-v3-turbo: model besar yang sama dengan dekoder dipangkas. Jalannya beberapa kali lebih cepat dan nyaris tidak kehilangan akurasi pada ucapan biasa.
Di mana model kecil jebol
Pada rekaman studio satu pembicara, semua ukuran nyaris sama. Jarak baru terbuka justru ketika audionya sulit:
- Nama diri dan jargon. Model kecil dengan percaya diri mengganti nama orang dengan kata sehari-hari yang mirip.
- Aksen dan bicara cepat. tiny dan base kehilangan potongan kalimat saat orang saling menimpali.
- Ganti bahasa di tengah. Model kecil buruk berpindah dan kadang menerjemahkan alih-alih menyalin.
- Derau. Jalanan, mobil, ruang kerja terbuka — di situ model kecil mulai mengarang.
Berapa harga pilihan ini
GPU sendiri untuk large-v3 berarti 10 GB VRAM dan satu mesin yang terus terpakai. Sewa GPU awan ditagih per jam, bukan per menit audio, jadi waktu menganggur dibayar sama mahalnya. Layanan per menit menghapus persoalan itu: model besar selalu jalan dan Anda membayar volume nyata.
Patokan praktis: di bawah sekitar sepuluh jam audio per hari, memelihara GPU sendiri lebih mahal daripada membayar per menit.
Pilihan praktisnya
Untuk pesan suara, panggilan, dan rapat, ambil model terbesar yang tersedia: tambahan akurasi sebanding dengan hilangnya kecepatan, dan membetulkan kesalahan manual jauh lebih mahal. Model kecil masuk akal pada dua hal — pengenalan di perangkat tanpa jaringan, dan penyisiran kasar arsip raksasa yang mementingkan volume, bukan tiap kata.
API kami memakai large-v3-turbo, jadi tidak ada yang perlu dipilih: permintaan cukup menyebut whisper-1 demi kompatibilitas dengan kode yang sudah ada.
Coba dengan rekaman Anda sendiri. Pendaftaran memakan waktu satu menit, dan menit gratisnya cukup untuk menilai kualitasnya.
Ambil kunci API gratisPertanyaan yang sering diajukan
Apa beda large-v3-turbo dengan large-v3?
Turbo punya dekoder yang dipangkas: beberapa kali lebih cepat dengan akurasi nyaris sama pada ucapan biasa. Pada audio sulit, large penuh masih unggul sepersekian persen.
Apakah model harus disebut di permintaan?
Cukup kirim whisper-1 — nama itu ada demi kompatibilitas. Model yang berjalan di sisi kami bukan sesuatu yang perlu Anda atur.
Benarkah model terbesar selalu lebih akurat?
Pada audio sulit, ya. Pada rekaman bersih satu pembicara, selisih small dan large hanya sepersekian persen dan tak terlihat.
Berapa VRAM untuk pemasangan sendiri?
Sekitar 10 GB dalam fp16 untuk large-v3. small dan base muat di 2 GB, dengan akurasi yang jelas turun.
Bacaan terkait
- Server Whisper sendiri atau API transkripsi: mana lebih murah — Perbandingan jujur antara memasang Whisper sendiri dan memakai API: biaya GPU, perawatan, waktu hingga hasil pertama, dan volume ketika self-hosting mulai untung.
- Cara meningkatkan akurasi transkripsi: delapan langkah praktis — Delapan perubahan yang benar-benar menggerakkan kualitas transkripsi: menyiapkan audio, menyebut bahasa, parameter prompt, memotong di jeda, format, dan cara mengukur galat.
- Bahasa mana yang benar-benar ditangani dengan baik — 99 bahasa yang didukung tidak setara: mana yang bisa diandalkan, di mana akurasinya turun, bagaimana deteksi bekerja, dan apa yang harus dilakukan saat bahasanya berganti.