Главная → Блог → Какой формат аудио выбрать для распознавания речи
Какой формат аудио выбрать для распознавания речи
Вопрос формата кажется техническим пустяком, пока файл не упирается в лимит размера или счёт за трафик не начинает удивлять. На точность распознавания формат влияет слабо, а на скорость и стоимость передачи — очень заметно. Разберём, что выбирать и почему.
Что принимает сервис
Поддерживаются все распространённые контейнеры: ogg, opus, mp3, wav, m4a, webm, flac. Предельный размер одного файла — 25 МБ. Внутри сервиса запись всё равно приводится к 16 кГц моно, поэтому исходное качество выше этого порога на результат не влияет.
Из этого следует простое правило: платить мегабайтами за то, что будет отброшено, смысла нет.
Сколько весит час записи
| Формат | Час записи | Комментарий |
|---|---|---|
| wav 44,1 кГц стерео | около 600 МБ | без сжатия, в лимит не влезет |
| mp3 128 кбит/с | около 55 МБ | привычно, но избыточно для речи |
| mp3 64 кбит/с моно | около 28 МБ | приемлемо, всё ещё много |
| opus 24 кбит/с моно | около 11 МБ | оптимально для речи |
Opus придуман именно под голос и на низких битрейтах звучит разборчивее mp3. Час разговора в нём умещается в десяток мегабайт вместе с запасом.
Одна команда для приведения к норме
Что бы ни отдала телефония или диктофон, привести это к удобному виду можно одной строкой:
ffmpeg -i input.wav -vn -ac 1 -ar 16000 -c:a libopus -b:a 24k output.ogg
Разберём флаги: vn выбрасывает видеодорожку, ac 1 сводит в моно, ar 16000 задаёт частоту дискретизации, которую и ждёт модель, b:a 24k — битрейт, достаточный для речи.
Стерео нужно оставлять только в одном случае: когда собеседники записаны в разные каналы и вы собираетесь распознавать их по отдельности.
Чего делать не стоит
- Пережимать уже сжатое. Перекодирование mp3 в mp3 добавляет искажения без выигрыша в размере — идите сразу в opus из исходника.
- Поднимать частоту. Пересчёт 8 кГц телефонии в 48 кГц не добавит информации, только вес файла.
- Резать тишину агрессивно. Удаление пауз сбивает тайм-коды и склеивает реплики разных людей.
- Слать видео целиком. Дорожка со звуком в двадцать раз меньше и распознаётся так же.
Попробуйте на своих записях. Регистрация занимает минуту, бесплатных минут хватает, чтобы оценить качество.
Получить ключ бесплатноЧастые вопросы
Влияет ли формат на точность распознавания?
Слабо. Заметная разница появляется только на очень низких битрейтах — ниже 16 кбит/с речь начинает разваливаться. Opus 24 кбит/с моно неотличим по результату от исходного wav.
Что делать, если файл больше 25 МБ?
Сжать в opus — этого хватает в большинстве случаев. Если запись всё равно длинная, разрежьте её на части по паузам и склейте результат.
Нужно ли конвертировать перед отправкой?
Не обязательно: сервис принимает любой распространённый формат. Конвертация экономит трафик и время загрузки, а на длинных записях ещё и спасает от лимита.
Подойдёт ли запись с телефонного канала 8 кГц?
Да, телефонный звук распознаётся уверенно. Повышать частоту дискретизации не нужно, информации в записи от этого не прибавится.
Читайте также
- Подготовка аудио к распознаванию: рецепты ffmpeg — Готовые команды ffmpeg для распознавания речи: извлечь дорожку из видео, свести в моно, убрать тишину, разрезать по паузам и разложить каналы.
- Как расшифровать запись, которая не влезает в один запрос — Что делать с записью на несколько часов: сжатие, нарезка по паузам, параллельная обработка кусков и сборка единого текста со сквозными тайм-кодами.
- Как повысить точность распознавания речи: восемь рабочих приёмов — Восемь изменений, которые действительно двигают качество расшифровки: подготовка звука, подсказка языка, параметр prompt, нарезка по паузам, форматы и замер ошибок.