Главная → Блог → Как расшифровать интервью, не набирая его руками
Как расшифровать интервью, не набирая его руками
Час интервью набирается руками за четыре-шесть часов. Автоматическая расшифровка сокращает это до нескольких минут машинного времени плюс двадцать минут проверки — но только если запись и проверка сделаны правильно, а именно там качество и решается.
Точность в основном решается до нажатия «запись»
Ни одна модель не восстановит информацию, которая не была записана. Три вещи важнее любого параметра, который вы зададите потом:
- Держите микрофон у губ. Телефон, лежащий между двумя людьми на столике в кафе, записывает в основном кафе. Тот же телефон на уровне груди записывает интервью.
- Уберите шум, который вам подконтролен. Кондиционер, открытое окно, фоновая музыка — каждый из них стоит вам точности в каждой фразе.
- Пишите две дорожки, если можете. Два телефона или звонок, записанный поканально, дают разделение по говорящим даром. Это самое ценное решение во всём процессе.
Запись на ноутбук через дешёвый внешний микрофон выигрывает у телефона в кармане с большим отрывом и не стоит ничего, кроме организации.
Сама расшифровка
Один запрос. Запрашивайте сегменты с таймкодами — для интервью именно они делают цитаты проверяемыми:
from openai import OpenAI
client = OpenAI(base_url="https://voicesscribe.com/v1", api_key="ваш ключ")
with open("interview.mp3", "rb") as f:
r = client.audio.transcriptions.create(
model="whisper-1", file=f,
response_format="verbose_json",
language="ru",
prompt="Интервью с Еленой Маркетти, эпидемиологом, о мониторинге сточных вод.",
)
for s in r.segments:
m, sec = divmod(int(s.start), 60)
print(f"[{m:02d}:{sec:02d}] {s.text.strip()}")
В prompt идут имя собеседника, его область и специальные термины. Интервью плотно набиты именами собственными, а именно на них распознавание и соскальзывает — строка подсказки снимает большую часть.
Два голоса в одном файле
Одна сведённая запись не возвращается размеченной по говорящим. Это настоящее ограничение, и у него есть практические обходы:
- Раздельные дорожки. Расшифруйте каждую отдельно — получите точное разделение и таймкоды, по которым их можно переплести.
- Раздельные каналы. Если диктофон развёл людей по каналам, сначала разделите файл:
ffmpeg -i in.wav -map_channel 0.0.0 a.wav -map_channel 0.0.1 b.wav - Разметка после. В интервью на двоих реплики чередуются предсказуемо, а вопросы задаёт журналист. Прочитать текст один раз и проставить имена — несколько минут на час записи.
Для большинства интервью хватает второго и третьего вариантов. Не стройте конвейер разделения говорящих, пока не убедились, что он вам нужен.
Проверка результата
Автоматическая расшифровка точна на обычной речи и наименее надёжна ровно там, где для интервью важнее всего: имена, числа, организации и специальные термины. Двадцатиминутный проход по этим четырём категориям ловит почти всё.
Таймкоды делают это практичным: для любой сомнительной фразы перейдите к этой секунде записи и послушайте. Так же обходится и худший сценарий опубликованного интервью — гладко звучащая цитата, которой никто не произносил.
# находим места, которые стоит послушать самому
for s in r.segments:
if any(c.isdigit() for c in s.text) or any(w[:1].isupper() for w in s.text.split()[1:]):
print(f"{int(s.start)//60:02d}:{int(s.start)%60:02d} {s.text.strip()}")От расшифровки к тому, что действительно нужно
Расшифровка — сырьё. В дело идёт обычно одно из трёх:
- Цитаты с таймкодами — для статьи, с возможностью сверить с записью.
- Темы по многим интервью — для исследования, где одни и те же вопросы заданы десять раз.
- Сводка для тех, кого не было — команде нужны выводы, а не расшифровка.
Черновик всех трёх может сделать языковая модель, и одно правило удерживает её от вранья: явно потребовать цитаты дословно и ничего, чего нет в тексте. После этого сверьте цитаты по таймкодам.
Согласие и хранение
Две вещи стоит уладить до включения диктофона, а не после:
- Скажите человеку, что идёт запись и что она будет расшифрована машиной. Во многих юрисдикциях первая часть — требование закона, вторая просто честна.
- Знайте, сколько живёт аудио. Здесь записи и расшифровки удаляются автоматически через сутки: достаточно, чтобы забрать результат, и слишком мало, чтобы образовался архив, который может утечь.
Для исследовательской работы с этической комиссией именно про этот срок хранения обычно и спрашивают.
Попробуйте на своих записях. Регистрация занимает минуту, бесплатных минут хватает, чтобы оценить качество.
Получить ключ бесплатноЧастые вопросы
Сколько расшифровывается часовое интервью?
Несколько минут машинного времени — обработка идёт быстрее реального времени. Реальные усилия закладывайте на последующую проверку имён, чисел и терминов.
Будет ли видно, кто говорит?
По одной сведённой записи — нет. Пишите каждого участника в отдельную дорожку или канал и расшифровывайте их по отдельности: так разделение получается точным и бесплатно.
Насколько точно распознаётся речь с акцентом?
Внятная речь на хорошо поддержанном языке распознаётся уверенно, включая многие акценты. Сильный акцент, перебивания и фоновый шум точность снижают — поэтому расположение микрофона важнее любой настройки.
Можно ли получить таймкоды для цитат?
Да, запросите verbose_json — каждый сегмент возвращается с точным временем начала и конца, и любую цитату можно сверить с записью за секунды.
Хранится ли запись где-нибудь?
Записи и расшифровки хранятся не дольше суток, чтобы вы успели забрать результат, затем удаляются автоматически.
Читайте также
- Как расшифровать запись встречи и получить готовые заметки — Как превратить запись Zoom, Teams или Google Meet в текст с таймкодами и вытащить из него решения и задачи: где лежит файл, что отправлять, как собрать протокол.
- Кто что сказал: разделение говорящих в расшифровке — Почему одна сведённая запись не возвращается с метками говорящих и четыре рабочих способа получить разделение — от многодорожечной записи до разделения каналов.
- Как повысить точность распознавания речи: восемь рабочих приёмов — Восемь изменений, которые действительно двигают качество расшифровки: подготовка звука, подсказка языка, параметр prompt, нарезка по паузам, форматы и замер ошибок.