Аудіо в текст — розшифровка запису за абзацами та мовцями

Онлайн-інструмент для розшифровки аудіо- та відеозаписів у текст: нарад, інтерв’ю, лекцій, подкастів і голосових нотаток. Результат виходить абзацами, з мітками мовців і таймкодами; його можна правити просто на сторінці, копіювати та завантажити у DOCX, PDF, TXT або субтитрами SRT/VTT. Короткі файли розпізнаються у браузері, багатогодинні — на нашому сервері, а про готовність надходить лист.

Як розшифрувати аудіо в текст

1
Завантажте запис

MP3, WAV, M4A, FLAC, OGG, WebM або відео — перетягніть файл на сторінку або виберіть на пристрої.

2
Налаштуйте розпізнавання

Виберіть мову та якість, увімкніть «Позначати мовців» і вкажіть кількість учасників, якщо знаєте її.

3
Заберіть текст

Виправте слова та імена мовців просто на сторінці, потім скопіюйте текст або завантажте DOCX, PDF, TXT, SRT чи VTT.

Перетворіть запис розмови на читабельний документ: хто що сказав і коли

00:00
0:00
0:00 / 0:00
Формат
Перетягніть аудіофайл сюди
MP4, WEBM, MOV, MP3, WAV, M4A, OGG, FLAC, AAC, M4B, WMA, AIFF, OPUS, CAF, MKV, AVI, WMV, FLV, M4V, 3GP, TS, MTS, M2TS, VOB, MPG, MPEG, OGV

Тут з’явиться розпізнаний текст.

00:00

Яку модель обрати і що це вам коштує

Розпізнавання працює у вашому браузері, тому модель завантажується один раз і кешується. Більші моделі краще розпізнають акценти й шум, але потребують більше часу на тому ж пристрої.

Модель Разове завантаження Час на хвилину аудіо Коли обирати
Швидко ~75 MB близько 1 хв Швидкий чернетковий варіант, чітке мовлення, один мовець
Точно ~150 MB близько 3 хв Повсякденні записи — звичний компроміс
Висока точність (small) ~250 MB близько 6 хв Акценти, фоновий шум, кілька мовців
Преміум (Large v3 Turbo) ~600 MB залежить від GPU Найскладніше аудіо; потрібен GPU або сучасний CPU

Відеофайл спершу розбирається на аудіодоріжку: година телефонного відео — 2–3 ГБ, з яких звук займає близько 30 МБ.

Опубліковано Автор: