Audio ke Teks — transkripsi dalam paragraf dengan label pembicara

Alat online untuk mentranskripsi rekaman audio dan video — rapat, wawancara, kuliah, podcast, dan catatan suara — menjadi teks. Hasilnya berupa paragraf dengan label pembicara dan penanda waktu; Anda bisa menyuntingnya langsung di halaman, menyalin, atau mengunduhnya sebagai DOCX, PDF, TXT, atau subtitle SRT/VTT. Berkas pendek dikenali di browser; berkas berjam-jam diproses di server kami dan Anda menerima email saat teks siap.

Cara mentranskripsi audio ke teks

1
Unggah rekaman

MP3, WAV, M4A, FLAC, OGG, WebM, atau video — seret berkas ke halaman atau pilih dari perangkat.

2
Atur pengenalan

Pilih bahasa dan kualitas, centang "Beri label pembicara", dan masukkan jumlah peserta jika Anda tahu.

3
Ambil teksnya

Perbaiki kata dan nama pembicara langsung di halaman, lalu salin teks atau unduh DOCX, PDF, TXT, SRT, atau VTT.

Ubah percakapan yang direkam menjadi dokumen yang mudah dibaca: siapa mengatakan apa, dan kapan

Ingin mendikte langsung? 🎤 Mengetik dengan suara

Seret file audio ke sini
MP4, WEBM, MOV, MP3, WAV, M4A, OGG, FLAC, AAC, M4B, WMA, AIFF, OPUS, CAF, MKV, AVI, WMV, FLV, M4V, 3GP, TS, MTS, M2TS, VOB, MPG, MPEG, OGV

Teks hasil transkripsi akan muncul di sini.

00:00

Model mana yang dipilih dan berapa biayanya

Pengenalan berjalan di peramban Anda, jadi model diunduh sekali lalu tersimpan di cache. Model yang lebih besar lebih baik menangkap aksen dan derau, tetapi lebih lama pada mesin yang sama.

Model Unduhan sekali Waktu per menit audio Kapan dipilih
Cepat ~75 MB sekitar 1 mnt Draf cepat, ucapan jernih, satu suara
Akurat ~150 MB sekitar 3 mnt Rekaman sehari-hari — kompromi biasa
Akurasi Tinggi (small) ~250 MB sekitar 6 mnt Aksen, derau latar, beberapa pembicara
Premium (Large v3 Turbo) ~600 MB tergantung GPU Audio tersulit; perlu GPU atau CPU modern

Dari video, jalur audionya diambil lebih dulu: satu jam rekaman ponsel berukuran 2–3 GB, suaranya sekitar 30 MB.

Diterbitkan Diperbarui Penulis: