ГлавнаяБлог → Как расшифровать запись встречи и получить готовые заметки

Как расшифровать запись встречи и получить готовые заметки

Опубликовано 2026-08-18 · 6 мин чтения

Запись совещания — это папка, которую никто не открывает. Все помнят, что решение принято, никто не помнит какое, а пересматривать сорок минут ради одной фразы не станет ни один человек. Расшифровка превращает запись в текст, по которому можно искать, цитировать и собирать протокол за секунды.

Что меняет текстовая версия встречи

Четыре вещи, которых запись сама по себе не даёт:

Где лежит сама запись

До всякого кода найдите файл. Каждая платформа хранит его по-своему:

ПлатформаГде искатьЧто получите
ZoomПапка локальных записей или облачные записи в веб-кабинетеmp4 и отдельная звуковая дорожка m4a
Microsoft TeamsOneDrive или SharePoint, ссылка в чате встречиmp4
Google MeetПапка Meet Recordings на Дискеmp4

Локальные записи Zoom — самый удобный случай: файл только со звуком уже лежит рядом, конвертировать ничего не нужно.

Шаг 1. Извлеките звук и уменьшите файл

Час видеовстречи — это гигабайты, тот же час речи в mp3 — около 25 МБ. На совещании звучит речь и почти ничего больше, поэтому моно на скромном битрейте не теряет ничего важного:

ffmpeg -i meeting.mp4 -vn -ac 1 -ar 16000 -b:a 48k meeting.mp3

Моно 16 кГц — ровно то, с чем модель работает внутри. Файл становится настолько компактным, что двухчасовая встреча укладывается в пару запросов.

Шаг 2. Расшифруйте с таймкодами

Для встреч запрашивайте verbose_json, а не обычный текст: в сегментах есть время начала и конца, и именно оно позволяет вернуться к нужному месту записи.

from openai import OpenAI

client = OpenAI(base_url="https://voicesscribe.com/v1", api_key="ваш ключ")

with open("meeting.mp3", "rb") as f:
    r = client.audio.transcriptions.create(
        model="whisper-1", file=f,
        response_format="verbose_json",
        prompt="Продуктовый синк: роадмап, релиз третьего квартала, переезд на Kubernetes",
    )

for s in r.segments:
    print(f"[{int(s.start)//60:02d}:{int(s.start)%60:02d}] {s.text.strip()}")

В prompt кладут внутренний словарь компании: названия проектов, аббревиатуры, фамилии. На совещаниях полно терминов, которых общая модель никогда не слышала, и одна строка подсказки снимает большую часть таких ошибок.

Шаг 3. Превратите расшифровку в протокол

Сама расшифровка — сырьё. Полезный результат — короткая сводка с решениями и ответственными, а это работа для языковой модели: на вход текст, на выходе структурированные заметки.

notes = llm(f"""Ниже расшифровка встречи. Верни:
1) сводку из пяти пунктов,
2) принятые решения,
3) задачи в формате «ответственный — задача — срок».
Опирайся только на текст, ничего не додумывай.

{transcript}""")

Результату можно доверять при двух условиях: явно потребовать «только то, что есть в тексте» и сохранить таймкоды, чтобы любое утверждение можно было проверить по записи.

Кто что сказал

Честный ответ: одна сведённая дорожка не возвращается с метками говорящих. Два рабочих обхода:

Для протокола точная атрибуция обычно важна меньше самих решений — не стройте сложную схему до того, как убедитесь, что она нужна.

Длинные встречи и расходы

Оплата идёт за минуты аудио, поэтому рычага два: не расшифровывать лишнее и не отправлять тишину.

# режем длинную встречу на получасовые куски
ffmpeg -i meeting.mp3 -f segment -segment_time 1800 -c copy part%03d.mp3

Регулярные статусы обычно стоит расшифровывать целиком, а двухчасовые воркшопы — только тот фрагмент, где принималось решение. Рабочее правило: месяц расшифровывайте всё, посмотрите, что люди на самом деле ищут, и сузьте охват.

Попробуйте на своих записях. Регистрация занимает минуту, бесплатных минут хватает, чтобы оценить качество.

Получить ключ бесплатно

Частые вопросы

Можно ли отправить файл mp4 напрямую?

Практичнее сначала извлечь звуковую дорожку через ffmpeg. Видео в десятки раз больше, а картинка при распознавании не используется — вы заплатите только временем загрузки.

Сколько обрабатывается часовая встреча?

Несколько минут: распознавание идёт быстрее реального времени, а разрезанную на части запись можно отправить параллельно.

Будет ли в расшифровке видно, кто говорит?

По одной сведённой дорожке — нет. Запишите участников в отдельные файлы и расшифруйте их по очереди: так разделение получится точным.

Как добиться правильного написания внутренних терминов?

Передайте их в параметре prompt: названия проектов, аббревиатуры и фамилии, перечисленные одной строкой, заметно улучшают их распознавание.

Где хранятся записи после обработки?

Записи и расшифровки лежат не дольше суток, чтобы вы успели забрать результат в кабинете, затем удаляются автоматически.

Читайте также