Главная → Блог → Свой сервер с Whisper или API: что выбрать и что дешевле
Свой сервер с Whisper или API: что выбрать и что дешевле
Whisper открыт, весит несколько гигабайт и запускается одной командой — соблазн поднять его у себя понятен. Но счёт за железо оплачивается помесячно, а не поминутно, и на малых объёмах своя установка проигрывает готовому API в разы. Считаем честно.
Что на самом деле входит в свою установку
Запуск модели — самая простая часть. Дальше начинается то, о чём вспоминают через месяц:
- Видеокарта. Для large-v3 нужно около 10 ГБ памяти, то есть карта уровня 3060 12 ГБ и выше.
- Очередь. Два одновременных запроса на одной карте не помещаются — нужен планировщик.
- Конвертация форматов. Клиенты присылают m4a, ogg, webm — придётся держать ffmpeg и следить за кодеками.
- Дежурство. Драйвер, обновление CUDA, перезапуск после сбоя — это работа живого человека.
Считаем деньги
Возьмём типовой поток: 500 минут аудио в месяц.
| Вариант | Расход в месяц | Что ещё нужно |
|---|---|---|
| Аренда GPU в облаке | от 100 долларов за самую скромную карту | настройка, обновления, мониторинг |
| Своя карта | единовременно 400–800 долларов плюс электричество | место, охлаждение, простой при поломке |
| API с оплатой за минуты | 500 минут по ставке за минуту | ничего |
Арендованная карта тарифицируется круглосуточно, даже когда очередь пуста. Именно на этом и ломается расчёт «своё дешевле»: 500 минут аудио — это меньше девяти часов работы карты в месяц из 720 доступных.
Где своя установка выигрывает
Есть два случая, когда собственный сервер оправдан.
Постоянный крупный поток. Если карта занята хотя бы половину суток, её стоимость размазывается по тысячам минут и цена одной минуты падает ниже любого API.
Запрет на выход данных наружу. Медицина, банки, гостайна — там вопрос решается не ценой. В остальных случаях достаточно проверить, как поставщик хранит записи: если они удаляются в течение суток и не идут на обучение моделей, риск сопоставим с любым облачным сервисом.
Разумный порядок действий
Начинать со своей установки почти всегда преждевременно: непонятно ни качество на ваших записях, ни реальный объём. Рабочая последовательность такая:
- Подключиться к API и прогнать реальные записи — это день работы.
- Собрать статистику минут за месяц и посчитать фактический счёт.
- Если объём вырос настолько, что карта была бы занята постоянно, — переносить к себе, оставив API как резерв на пиковые нагрузки.
Поскольку протокол одинаковый, переезд в обе стороны сводится к смене адреса и ключа — код при этом не меняется.
Попробуйте на своих записях. Регистрация занимает минуту, бесплатных минут хватает, чтобы оценить качество.
Получить ключ бесплатноЧастые вопросы
С какого объёма своя видеокарта окупается?
Ориентир — постоянная загрузка хотя бы на половину суток. При потоке в несколько сотен минут в месяц карта простаивает, и оплата за минуты выходит дешевле.
Можно ли обойтись без видеокарты?
Whisper работает и на процессоре, но в десятки раз медленнее: минута аудио разбирается минуты. Для потока это неприемлемо, для единичных файлов — терпимо.
Насколько сложно перенести нагрузку к себе позже?
Протокол тот же самый, поэтому в коде меняются адрес и ключ. Всё остальное — очередь, конвертация, мониторинг — придётся построить заново.
Что с приватностью при работе через API?
Смотрите на срок хранения. У нас записи и расшифровки удаляются в течение суток и не используются для обучения моделей.
Читайте также
- Какую модель Whisper выбрать для распознавания речи — Чем отличаются модели Whisper от tiny до large-v3: скорость, точность, требования к видеопамяти и когда маленькая модель выгоднее большой.
- Стоимость распознавания речи: за что вы платите на самом деле — Как устроена оплата транскрибации, какие минуты съедают бюджет незаметно, когда своя видеокарта дешевле API и как посчитать собственные расходы до первого счёта.
- Конфиденциальность расшифровок: что проверить у сервиса — Что спросить у поставщика распознавания речи: срок хранения записей, обучение на данных, шифрование канала, доступ сотрудников и удаление по требованию.