ГлавнаяБлог → Какую модель Whisper выбрать для распознавания речи

Какую модель Whisper выбрать для распознавания речи

Опубликовано 2026-08-20 · 5 мин чтения

Whisper выпущен в нескольких размерах — от tiny на 39 миллионов параметров до large на полтора миллиарда. Разница между ними не только в точности: она определяет скорость, объём видеопамяти и в конечном счёте стоимость минуты. Разберём, что выбирать под задачу.

Линейка моделей

МодельПараметровВидеопамятьСкоростьГде уместна
tiny39 млн~1 ГБочень высокаячерновая расшифровка, команды голосом
base74 млн~1 ГБвысокаякороткие голосовые на чистом звуке
small244 млн~2 ГБсредняяразборчивая речь, один язык
medium769 млн~5 ГБниже среднейшум, акценты, смешанные языки
large-v31550 млн~10 ГБнизкаямаксимальная точность, сложный звук

Отдельно стоит large-v3-turbo: та же большая модель с урезанным декодером, работает в разы быстрее обычной large и почти не уступает ей на обычной речи.

Где маленькая модель ломается

Разница между размерами почти не видна на студийной записи одного диктора и становится решающей там, где звук сложный:

Цена решения

Своя видеокарта под large-v3 — это 10 ГБ памяти и постоянно занятая машина. Аренда GPU в облаке считается по часам, а не по минутам аудио, поэтому простой оплачивается наравне с работой. Сервис с оплатой за минуты снимает этот вопрос: большая модель работает всегда, а платите вы за фактический объём.

Практический ориентир: если суточный поток меньше десятка часов записи, содержать свою видеокарту дороже, чем платить за минуты.

Что выбрать на практике

Для голосовых сообщений, звонков и встреч берите самую большую доступную модель: разница в точности окупает разницу в скорости, а исправлять ошибки руками дороже. Маленькие модели оправданы в двух случаях — распознавание на устройстве без сети и черновая обработка гигантских архивов, где важен объём, а не каждое слово.

В нашем API распознавание идёт на large-v3-turbo, выбирать модель не нужно: в запросе указывается whisper-1 ради совместимости с существующим кодом.

Попробуйте на своих записях. Регистрация занимает минуту, бесплатных минут хватает, чтобы оценить качество.

Получить ключ бесплатно

Частые вопросы

Чем large-v3-turbo отличается от large-v3?

У turbo сокращён декодер: скорость выше в несколько раз при почти той же точности на обычной речи. На сложном звуке полная large иногда выигрывает доли процента.

Нужно ли указывать модель в запросе?

В запросе передаётся whisper-1 — это имя ради совместимости с существующим кодом. Какая модель работает на стороне сервиса, менять не нужно.

Правда ли, что большая модель всегда точнее?

На сложном звуке — да. На чистой записи одного диктора разница между small и large измеряется долями процента и на глаз незаметна.

Сколько видеопамяти нужно для своей установки?

Ориентир для large-v3 — около 10 ГБ в fp16. Модели small и base помещаются в 2 ГБ, но точность заметно ниже.

Читайте также