ГлавнаяБлог → Как расшифровать интервью, не набирая его руками

Как расшифровать интервью, не набирая его руками

Опубликовано 2026-08-18 · 6 мин чтения

Час интервью набирается руками за четыре-шесть часов. Автоматическая расшифровка сокращает это до нескольких минут машинного времени плюс двадцать минут проверки — но только если запись и проверка сделаны правильно, а именно там качество и решается.

Точность в основном решается до нажатия «запись»

Ни одна модель не восстановит информацию, которая не была записана. Три вещи важнее любого параметра, который вы зададите потом:

Запись на ноутбук через дешёвый внешний микрофон выигрывает у телефона в кармане с большим отрывом и не стоит ничего, кроме организации.

Сама расшифровка

Один запрос. Запрашивайте сегменты с таймкодами — для интервью именно они делают цитаты проверяемыми:

from openai import OpenAI

client = OpenAI(base_url="https://voicesscribe.com/v1", api_key="ваш ключ")

with open("interview.mp3", "rb") as f:
    r = client.audio.transcriptions.create(
        model="whisper-1", file=f,
        response_format="verbose_json",
        language="ru",
        prompt="Интервью с Еленой Маркетти, эпидемиологом, о мониторинге сточных вод.",
    )

for s in r.segments:
    m, sec = divmod(int(s.start), 60)
    print(f"[{m:02d}:{sec:02d}] {s.text.strip()}")

В prompt идут имя собеседника, его область и специальные термины. Интервью плотно набиты именами собственными, а именно на них распознавание и соскальзывает — строка подсказки снимает большую часть.

Два голоса в одном файле

Одна сведённая запись не возвращается размеченной по говорящим. Это настоящее ограничение, и у него есть практические обходы:

Для большинства интервью хватает второго и третьего вариантов. Не стройте конвейер разделения говорящих, пока не убедились, что он вам нужен.

Проверка результата

Автоматическая расшифровка точна на обычной речи и наименее надёжна ровно там, где для интервью важнее всего: имена, числа, организации и специальные термины. Двадцатиминутный проход по этим четырём категориям ловит почти всё.

Таймкоды делают это практичным: для любой сомнительной фразы перейдите к этой секунде записи и послушайте. Так же обходится и худший сценарий опубликованного интервью — гладко звучащая цитата, которой никто не произносил.

# находим места, которые стоит послушать самому
for s in r.segments:
    if any(c.isdigit() for c in s.text) or any(w[:1].isupper() for w in s.text.split()[1:]):
        print(f"{int(s.start)//60:02d}:{int(s.start)%60:02d}  {s.text.strip()}")

От расшифровки к тому, что действительно нужно

Расшифровка — сырьё. В дело идёт обычно одно из трёх:

Черновик всех трёх может сделать языковая модель, и одно правило удерживает её от вранья: явно потребовать цитаты дословно и ничего, чего нет в тексте. После этого сверьте цитаты по таймкодам.

Согласие и хранение

Две вещи стоит уладить до включения диктофона, а не после:

Для исследовательской работы с этической комиссией именно про этот срок хранения обычно и спрашивают.

Попробуйте на своих записях. Регистрация занимает минуту, бесплатных минут хватает, чтобы оценить качество.

Получить ключ бесплатно

Частые вопросы

Сколько расшифровывается часовое интервью?

Несколько минут машинного времени — обработка идёт быстрее реального времени. Реальные усилия закладывайте на последующую проверку имён, чисел и терминов.

Будет ли видно, кто говорит?

По одной сведённой записи — нет. Пишите каждого участника в отдельную дорожку или канал и расшифровывайте их по отдельности: так разделение получается точным и бесплатно.

Насколько точно распознаётся речь с акцентом?

Внятная речь на хорошо поддержанном языке распознаётся уверенно, включая многие акценты. Сильный акцент, перебивания и фоновый шум точность снижают — поэтому расположение микрофона важнее любой настройки.

Можно ли получить таймкоды для цитат?

Да, запросите verbose_json — каждый сегмент возвращается с точным временем начала и конца, и любую цитату можно сверить с записью за секунды.

Хранится ли запись где-нибудь?

Записи и расшифровки хранятся не дольше суток, чтобы вы успели забрать результат, затем удаляются автоматически.

Читайте также