Транскрипція аудіо в текст за допомогою ШІ
Інструмент для перетворення аудіозапису у текст. Завантажте MP3, WAV, M4A, FLAC, OGG або WebM — лекцію, інтерв’ю, запис наради, епізод подкасту або голосову нотатку — і Whisper AI транскрибує його в чистий документ із таймкодами, який можна читати, редагувати та зберігати. Оскільки кожна фраза зберігає таймкод, той самий транскрипт можна відразу експортувати як субтитри SRT або VTT. Транскрипція виконується у вашому браузері через WebAssembly.
Як транскрибувати аудіо в текст
Перетягніть аудіофайл на сторінку або натисніть, щоб обрати його з пристрою.
Оберіть модель — «Швидка» для чернетки або більшу для точної транскрипції довгого чи шумного файлу.
Запустіть транскрипцію і спостерігайте за прогресом, поки Whisper обробляє файл у вашому браузері.
Прочитайте текст, виправте імена та власні назви, потім експортуйте як TXT для документа або SRT/VTT для субтитрів.
Завантажте готовий запис і отримайте транскрипт із таймкодами та субтитри
📝 Власні назви та терміни (необов’язково)
Транскрипція
Протокол складає мовна модель. Для аналізу текст передається до стороннього провайдера ШІ (Anthropic, США). Перед надсиланням ми замінюємо номери паспортів, ідентифікаційні та страхові коди, номери рахунків і карток, телефони та e-mail на заглушки; імена, назви компаній та адреси залишаються в тексті — не завантажуйте розмову, якою ви не маєте права ділитися з третіми сторонами. Кожен пункт протоколу перевіряється: він відображається лише якщо його цитату знайдено дослівно у вашому тексті. Це виключає вигадані висновки, але не робить аналіз безпомилковим — перевіряйте важливе за записом.
📖 Історія
☁ Хмара слів
Візуальна карта найуживаніших слів — чим більше слово, тим частіше ви його вживали.
🔖 Закладки
⌨ Комбінації клавіш
Яку модель обрати і що це вам коштує
Розпізнавання працює у вашому браузері, тому модель завантажується один раз і кешується. Більші моделі краще розпізнають акценти й шум, але потребують більше часу на тому ж пристрої.
| Модель | Разове завантаження | Час на хвилину аудіо | Коли обирати |
|---|---|---|---|
| Швидко | ~75 MB | близько 1 хв | Швидкий чернетковий варіант, чітке мовлення, один мовець |
| Точно | ~150 MB | близько 3 хв | Повсякденні записи — звичний компроміс |
| Висока точність (small) | ~250 MB | близько 6 хв | Акценти, фоновий шум, кілька мовців |
| Преміум (Large v3 Turbo) | ~600 MB | залежить від GPU | Найскладніше аудіо; потрібен GPU або сучасний CPU |
Відеофайл спершу розбирається на аудіодоріжку: година телефонного відео — 2–3 ГБ, з яких звук займає близько 30 МБ.