Транскрипція аудіо в текст за допомогою ШІ

Інструмент для перетворення аудіозапису у текст. Завантажте MP3, WAV, M4A, FLAC, OGG або WebM — лекцію, інтерв’ю, запис наради, епізод подкасту або голосову нотатку — і Whisper AI транскрибує його в чистий документ із таймкодами, який можна читати, редагувати та зберігати. Оскільки кожна фраза зберігає таймкод, той самий транскрипт можна відразу експортувати як субтитри SRT або VTT. Транскрипція виконується у вашому браузері через WebAssembly.

Як транскрибувати аудіо в текст

1

Перетягніть аудіофайл на сторінку або натисніть, щоб обрати його з пристрою.

2

Оберіть модель — «Швидка» для чернетки або більшу для точної транскрипції довгого чи шумного файлу.

3

Запустіть транскрипцію і спостерігайте за прогресом, поки Whisper обробляє файл у вашому браузері.

4

Прочитайте текст, виправте імена та власні назви, потім експортуйте як TXT для документа або SRT/VTT для субтитрів.

Завантажте готовий запис і отримайте транскрипт із таймкодами та субтитри

Якщо потрібно навпаки — перетворити текст на голос, скористайтеся Текст у мовлення →
00:00
0:00
0:00 / 0:00
Формат
Перетягніть аудіофайл сюди
MP4, WEBM, MOV, MP3, WAV, M4A, OGG, FLAC, AAC, M4B, WMA, AIFF, OPUS, CAF, MKV, AVI, WMV, FLV, M4V, 3GP, TS, MTS, M2TS, VOB, MPG, MPEG, OGV
⌨ Комбінації клавіш
Почати/зупинити запис CtrlShiftR
Пауза/продовжити CtrlShiftP
Копіювати транскрипцію CtrlShiftC
Скачати TXT CtrlS
Знайти та замінити CtrlF
Додати закладку CtrlShiftB
Увімкнути/вимкнути режим фокусу CtrlShiftD
Закрити панелі Esc
00:00

Яку модель обрати і що це вам коштує

Розпізнавання працює у вашому браузері, тому модель завантажується один раз і кешується. Більші моделі краще розпізнають акценти й шум, але потребують більше часу на тому ж пристрої.

Модель Разове завантаження Час на хвилину аудіо Коли обирати
Швидко ~75 MB близько 1 хв Швидкий чернетковий варіант, чітке мовлення, один мовець
Точно ~150 MB близько 3 хв Повсякденні записи — звичний компроміс
Висока точність (small) ~250 MB близько 6 хв Акценти, фоновий шум, кілька мовців
Преміум (Large v3 Turbo) ~600 MB залежить від GPU Найскладніше аудіо; потрібен GPU або сучасний CPU

Відеофайл спершу розбирається на аудіодоріжку: година телефонного відео — 2–3 ГБ, з яких звук займає близько 30 МБ.

Опубліковано Автор: