BerandaBlog → Model Whisper mana yang sebaiknya dipilih

Model Whisper mana yang sebaiknya dipilih

Diterbitkan 2026-08-20 · 5 menit baca

Whisper hadir dalam beberapa ukuran, dari tiny dengan 39 juta parameter sampai large dengan 1,5 miliar. Bedanya bukan cuma akurasi: ukuran menentukan kecepatan, VRAM, dan pada akhirnya biaya per menit audio. Ini cara memilihnya sesuai kebutuhan.

Daftar modelnya

ModelParameterVRAMKecepatanCocok untuk
tiny39 juta~1 GBsangat cepattranskrip kasar, perintah suara
base74 juta~1 GBcepatklip pendek dengan audio bersih
small244 juta~2 GBsedangucapan jelas, satu bahasa
medium769 juta~5 GBlebih lambatderau, aksen, bahasa campuran
large-v31,55 miliar~10 GBlambatakurasi maksimum, audio sulit

Ada juga large-v3-turbo: model besar yang sama dengan dekoder dipangkas. Jalannya beberapa kali lebih cepat dan nyaris tidak kehilangan akurasi pada ucapan biasa.

Di mana model kecil jebol

Pada rekaman studio satu pembicara, semua ukuran nyaris sama. Jarak baru terbuka justru ketika audionya sulit:

Berapa harga pilihan ini

GPU sendiri untuk large-v3 berarti 10 GB VRAM dan satu mesin yang terus terpakai. Sewa GPU awan ditagih per jam, bukan per menit audio, jadi waktu menganggur dibayar sama mahalnya. Layanan per menit menghapus persoalan itu: model besar selalu jalan dan Anda membayar volume nyata.

Patokan praktis: di bawah sekitar sepuluh jam audio per hari, memelihara GPU sendiri lebih mahal daripada membayar per menit.

Pilihan praktisnya

Untuk pesan suara, panggilan, dan rapat, ambil model terbesar yang tersedia: tambahan akurasi sebanding dengan hilangnya kecepatan, dan membetulkan kesalahan manual jauh lebih mahal. Model kecil masuk akal pada dua hal — pengenalan di perangkat tanpa jaringan, dan penyisiran kasar arsip raksasa yang mementingkan volume, bukan tiap kata.

API kami memakai large-v3-turbo, jadi tidak ada yang perlu dipilih: permintaan cukup menyebut whisper-1 demi kompatibilitas dengan kode yang sudah ada.

Coba dengan rekaman Anda sendiri. Pendaftaran memakan waktu satu menit, dan menit gratisnya cukup untuk menilai kualitasnya.

Ambil kunci API gratis

Pertanyaan yang sering diajukan

Apa beda large-v3-turbo dengan large-v3?

Turbo punya dekoder yang dipangkas: beberapa kali lebih cepat dengan akurasi nyaris sama pada ucapan biasa. Pada audio sulit, large penuh masih unggul sepersekian persen.

Apakah model harus disebut di permintaan?

Cukup kirim whisper-1 — nama itu ada demi kompatibilitas. Model yang berjalan di sisi kami bukan sesuatu yang perlu Anda atur.

Benarkah model terbesar selalu lebih akurat?

Pada audio sulit, ya. Pada rekaman bersih satu pembicara, selisih small dan large hanya sepersekian persen dan tak terlihat.

Berapa VRAM untuk pemasangan sendiri?

Sekitar 10 GB dalam fp16 untuk large-v3. small dan base muat di 2 GB, dengan akurasi yang jelas turun.

Bacaan terkait