Beranda → Blog → Cara mengubah catatan suara menjadi teks secara otomatis
Cara mengubah catatan suara menjadi teks secara otomatis
Ide datang saat berjalan kaki, dan berbicara lebih cepat daripada mengetik sambil bergerak. Masalahnya muncul kemudian: satu folder berisi seratus rekaman yang isinya tak bisa dicari. Transkripsi mengubah tumpukan itu menjadi teks biasa yang bisa dicari dan ditautkan.
Alur tanpa langkah manual
Susunan yang bekerja terdiri dari tiga bagian:
- Aplikasi perekam di ponsel menulis ke folder yang tersinkron ke komputer.
- Skrip di komputer melihat berkas baru dan mengirimnya untuk ditranskrip.
- Teksnya mendarat sebagai catatan di sebelah audio aslinya.
Tidak ada yang perlu diklik: Anda bicara, semenit kemudian catatannya sudah ada di basis pengetahuan.
Skrip pemantau
Versi paling sederhana tanpa dependensi — telusuri folder dan proses yang belum punya teks.
import pathlib, datetime
from openai import OpenAI
client = OpenAI(base_url="https://voicesscribe.com/v1", api_key="kunci Anda")
vault = pathlib.Path.home() / "Vault" / "voice"
for audio in vault.glob("*.m4a"):
note = audio.with_suffix(".md")
if note.exists():
continue
with audio.open("rb") as f:
text = client.audio.transcriptions.create(model="whisper-1", file=f).text
stamp = datetime.datetime.fromtimestamp(audio.stat().st_mtime)
note.write_text(
f"---\ndate: {stamp:%Y-%m-%d %H:%M}\nsource: {audio.name}\n---\n\n{text}\n",
encoding="utf-8")
print("selesai:", note.name)
Jadwalkan tiap lima menit dan catatan muncul praktis seiring Anda merekam.
Beri judul dan struktur
Transkrip mentah adalah satu aliran ucapan panjang. Agar berguna, catatan perlu judul dan setidaknya struktur kasar — di sinilah model bahasa membantu: kirim teks yang sama untuk diringkas dan taruh hasilnya di atas sebagai ikhtisar plus daftar tugas.
Simpan juga transkrip lengkapnya. Ringkasan membuang detail, sedangkan Anda akan mencari di basis pengetahuan memakai frasa persis yang dulu Anda ucapkan.
Akurasi pada rekaman lapangan
Catatan sambil bergerak adalah bahan yang sulit: angin, langkah kaki, akhiran yang tertelan. Tiga kebiasaan yang jelas membantu:
- Dekatkan ponsel ke mulut — ini lebih penting dari pengaturan apa pun.
- Kirim kode bahasa kalau Anda selalu mendikte dalam bahasa yang sama.
- Pertahankan satu prompt tetap berisi nama proyek, rekan kerja, dan istilah bidang Anda.
Coba dengan rekaman Anda sendiri. Pendaftaran memakan waktu satu menit, dan menit gratisnya cukup untuk menilai kualitasnya.
Ambil kunci API gratisPertanyaan yang sering diajukan
Perekam ponsel menghasilkan format apa?
Biasanya m4a atau ogg, keduanya diterima apa adanya. Tidak perlu langkah konversi.
Bagaimana catatan dalam dua bahasa?
Bahasa dideteksi dari suaranya, jadi arsip campuran tidak butuh pengaturan. Sebut bahasanya hanya bila alirannya pasti satu bahasa.
Bisa jalan tanpa komputer?
Bisa, kalau platform otomasi Anda mampu memantau folder awan — seluruh alurnya lalu hidup di awan.
Rekamannya diapakan setelah diproses?
Rekaman dan transkrip disimpan tidak lebih dari 24 jam, lalu dihapus otomatis.
Bacaan terkait
- Transkripsi pesan suara: WhatsApp, Telegram, dan lainnya — Cara mengubah pesan suara menjadi teks secara otomatis: format ogg/opus, menangani rekaman pendek, dan contoh kode untuk bot layanan pelanggan.
- Cara menyiapkan transkripsi tanpa menulis kode — Membangun alur audio ke teks di alat no-code: permintaan HTTP di n8n, Make, dan Zapier, cara mengirim berkas dengan benar, dan menyimpan hasilnya.
- Cara menyusun notulen rapat dari transkrip secara otomatis — Alur dua langkah untuk notulen: transkrip rekaman lebih dulu, lalu ekstraksi keputusan, penanggung jawab, dan tenggat dengan prompt yang tak mengarang.