Главная → Блог → Как превращать голосовые заметки в текст автоматически
Как превращать голосовые заметки в текст автоматически
Идея приходит на прогулке, и проще наговорить её в диктофон, чем печатать на ходу. Проблема начинается потом: папка с сотней записей, в которых невозможно ничего найти. Расшифровка превращает этот архив в обычный текст, доступный поиску и ссылкам.
Схема без ручной работы
Рабочая связка состоит из трёх частей:
- Диктофон на телефоне пишет заметку в папку, которая синхронизируется с компьютером.
- Скрипт на компьютере замечает новый файл и отправляет его на распознавание.
- Готовый текст ложится в заметку рядом с исходной записью.
Никаких ручных действий: наговорили — через минуту заметка уже в базе знаний.
Скрипт-наблюдатель
Простейший вариант без зависимостей: обходим папку и обрабатываем то, для чего ещё нет текста.
import pathlib, datetime
from openai import OpenAI
client = OpenAI(base_url="https://voicesscribe.com/v1", api_key="ваш ключ")
vault = pathlib.Path.home() / "Vault" / "voice"
for audio in vault.glob("*.m4a"):
note = audio.with_suffix(".md")
if note.exists():
continue
with audio.open("rb") as f:
text = client.audio.transcriptions.create(model="whisper-1", file=f).text
stamp = datetime.datetime.fromtimestamp(audio.stat().st_mtime)
note.write_text(
f"---\ndate: {stamp:%Y-%m-%d %H:%M}\nsource: {audio.name}\n---\n\n{text}\n",
encoding="utf-8")
print("готово:", note.name)
Скрипт вешается на планировщик задач раз в пять минут — этого достаточно, чтобы заметка появлялась почти сразу.
Заголовок и структура заметки
Сырая расшифровка — это сплошной поток речи. Чтобы заметка была полезной, ей нужен заголовок и хотя бы грубая структура. Здесь помогает языковая модель: тот же текст отправляется на суммаризацию, а результат кладётся в начало файла как краткое содержание и список задач.
Важно сохранять и полную расшифровку: краткое содержание теряет детали, а искать по базе знаний вы будете именно по формулировкам, которые произнесли вслух.
Точность на бытовых записях
Заметки на ходу — сложный материал: ветер, шаги, проглоченные окончания. Три приёма, которые заметно улучшают результат:
- Держать телефон ближе ко рту — это важнее любых настроек.
- Передавать код языка, если вы всегда наговариваете на одном.
- Добавлять в подсказку постоянный словарь: названия проектов, имена коллег, профессиональные термины.
Попробуйте на своих записях. Регистрация занимает минуту, бесплатных минут хватает, чтобы оценить качество.
Получить ключ бесплатноЧастые вопросы
В каком формате пишет диктофон телефона?
Обычно m4a или ogg — оба принимаются без конвертации. Специально ничего перекодировать не нужно.
Как быть с заметками на двух языках?
Язык определяется автоматически по звуку, поэтому смешанный архив обрабатывается без настроек. Указывать язык стоит, только если поток заведомо одноязычный.
Можно ли обойтись без компьютера?
Да, если платформа автоматизации умеет читать облачную папку: тогда сценарий работает в облаке и компьютер не нужен.
Что происходит с записями после обработки?
Записи и расшифровки хранятся не дольше суток, затем удаляются автоматически.
Читайте также
- Транскрибация голосовых сообщений: Telegram, WhatsApp и другие мессенджеры — Как автоматически переводить голосовые сообщения в текст: работа с форматом ogg/opus, обработка коротких записей, примеры кода для чат-ботов.
- Как настроить транскрибацию без программирования — Как собрать расшифровку аудио в no-code сервисах: HTTP-запрос в n8n, Make и Zapier, передача файла, разбор ответа и запись результата в таблицу.
- Как сделать протокол встречи из расшифровки автоматически — Схема сборки протокола: расшифровка записи, промпт для языковой модели, извлечение решений и задач, проверка фактов и хранение исходного текста.