Аудіо в текст — розшифровка запису за абзацами та мовцями
Онлайн-інструмент для розшифровки аудіо- та відеозаписів у текст: нарад, інтерв’ю, лекцій, подкастів і голосових нотаток. Результат виходить абзацами, з мітками мовців і таймкодами; його можна правити просто на сторінці, копіювати та завантажити у DOCX, PDF, TXT або субтитрами SRT/VTT. Короткі файли розпізнаються у браузері, багатогодинні — на нашому сервері, а про готовність надходить лист.
Як розшифрувати аудіо в текст
MP3, WAV, M4A, FLAC, OGG, WebM або відео — перетягніть файл на сторінку або виберіть на пристрої.
Виберіть мову та якість, увімкніть «Позначати мовців» і вкажіть кількість учасників, якщо знаєте її.
Виправте слова та імена мовців просто на сторінці, потім скопіюйте текст або завантажте DOCX, PDF, TXT, SRT чи VTT.
Перетворіть запис розмови на читабельний документ: хто що сказав і коли
Файли розшифровуються по одному; кожен готовий текст зберігається в історію нижче. Кожен файл — окремий прогін.
📝 Власні назви та терміни (необов’язково)
Тут з’явиться розпізнаний текст.
Транскрипція
Протокол складає мовна модель. Для аналізу текст передається до стороннього провайдера ШІ (Anthropic, США). Перед надсиланням ми замінюємо номери паспортів, ідентифікаційні та страхові коди, номери рахунків і карток, телефони та e-mail на заглушки; імена, назви компаній та адреси залишаються в тексті — не завантажуйте розмову, якою ви не маєте права ділитися з третіми сторонами. Кожен пункт протоколу перевіряється: він відображається лише якщо його цитату знайдено дослівно у вашому тексті. Це виключає вигадані висновки, але не робить аналіз безпомилковим — перевіряйте важливе за записом.
📖 Історія
☁ Хмара слів
Візуальна карта найуживаніших слів — чим більше слово, тим частіше ви його вживали.
🔖 Закладки
⌨ Комбінації клавіш
Яку модель обрати і що це вам коштує
Розпізнавання працює у вашому браузері, тому модель завантажується один раз і кешується. Більші моделі краще розпізнають акценти й шум, але потребують більше часу на тому ж пристрої.
| Модель | Разове завантаження | Час на хвилину аудіо | Коли обирати |
|---|---|---|---|
| Швидко | ~75 MB | близько 1 хв | Швидкий чернетковий варіант, чітке мовлення, один мовець |
| Точно | ~150 MB | близько 3 хв | Повсякденні записи — звичний компроміс |
| Висока точність (small) | ~250 MB | близько 6 хв | Акценти, фоновий шум, кілька мовців |
| Преміум (Large v3 Turbo) | ~600 MB | залежить від GPU | Найскладніше аудіо; потрібен GPU або сучасний CPU |
Відеофайл спершу розбирається на аудіодоріжку: година телефонного відео — 2–3 ГБ, з яких звук займає близько 30 МБ.