Главная → Блог → Какую модель Whisper выбрать для распознавания речи
Какую модель Whisper выбрать для распознавания речи
Whisper выпущен в нескольких размерах — от tiny на 39 миллионов параметров до large на полтора миллиарда. Разница между ними не только в точности: она определяет скорость, объём видеопамяти и в конечном счёте стоимость минуты. Разберём, что выбирать под задачу.
Линейка моделей
| Модель | Параметров | Видеопамять | Скорость | Где уместна |
|---|---|---|---|---|
| tiny | 39 млн | ~1 ГБ | очень высокая | черновая расшифровка, команды голосом |
| base | 74 млн | ~1 ГБ | высокая | короткие голосовые на чистом звуке |
| small | 244 млн | ~2 ГБ | средняя | разборчивая речь, один язык |
| medium | 769 млн | ~5 ГБ | ниже средней | шум, акценты, смешанные языки |
| large-v3 | 1550 млн | ~10 ГБ | низкая | максимальная точность, сложный звук |
Отдельно стоит large-v3-turbo: та же большая модель с урезанным декодером, работает в разы быстрее обычной large и почти не уступает ей на обычной речи.
Где маленькая модель ломается
Разница между размерами почти не видна на студийной записи одного диктора и становится решающей там, где звук сложный:
- Имена собственные и термины. Маленькая модель уверенно превращает фамилию в похожее обычное слово.
- Акцент и быстрая речь. На перебивании и проглоченных окончаниях tiny и base теряют куски фраз.
- Смена языка внутри записи. Мелкие модели переключаются плохо и иногда переводят вместо распознавания.
- Шум. Улица, автомобиль, открытый офис — там небольшая модель начинает выдумывать текст.
Цена решения
Своя видеокарта под large-v3 — это 10 ГБ памяти и постоянно занятая машина. Аренда GPU в облаке считается по часам, а не по минутам аудио, поэтому простой оплачивается наравне с работой. Сервис с оплатой за минуты снимает этот вопрос: большая модель работает всегда, а платите вы за фактический объём.
Практический ориентир: если суточный поток меньше десятка часов записи, содержать свою видеокарту дороже, чем платить за минуты.
Что выбрать на практике
Для голосовых сообщений, звонков и встреч берите самую большую доступную модель: разница в точности окупает разницу в скорости, а исправлять ошибки руками дороже. Маленькие модели оправданы в двух случаях — распознавание на устройстве без сети и черновая обработка гигантских архивов, где важен объём, а не каждое слово.
В нашем API распознавание идёт на large-v3-turbo, выбирать модель не нужно: в запросе указывается whisper-1 ради совместимости с существующим кодом.
Попробуйте на своих записях. Регистрация занимает минуту, бесплатных минут хватает, чтобы оценить качество.
Получить ключ бесплатноЧастые вопросы
Чем large-v3-turbo отличается от large-v3?
У turbo сокращён декодер: скорость выше в несколько раз при почти той же точности на обычной речи. На сложном звуке полная large иногда выигрывает доли процента.
Нужно ли указывать модель в запросе?
В запросе передаётся whisper-1 — это имя ради совместимости с существующим кодом. Какая модель работает на стороне сервиса, менять не нужно.
Правда ли, что большая модель всегда точнее?
На сложном звуке — да. На чистой записи одного диктора разница между small и large измеряется долями процента и на глаз незаметна.
Сколько видеопамяти нужно для своей установки?
Ориентир для large-v3 — около 10 ГБ в fp16. Модели small и base помещаются в 2 ГБ, но точность заметно ниже.
Читайте также
- Свой сервер с Whisper или API: что выбрать и что дешевле — Сравнение своей установки Whisper и готового API: стоимость видеокарты, поддержка, скорость запуска и порог объёма, за которым свой сервер окупается.
- Как повысить точность распознавания речи: восемь рабочих приёмов — Восемь изменений, которые действительно двигают качество расшифровки: подготовка звука, подсказка языка, параметр prompt, нарезка по паузам, форматы и замер ошибок.
- Какие языки распознавание речи вытягивает, а какие нет — 99 поддерживаемых языков не равны между собой: где качество близко к человеческому, где падает, как устроено автоопределение и что делать со сменой языка внутри записи.