오디오 텍스트 변환 — 문단과 화자 표시가 있는 녹취록

회의, 인터뷰, 강의, 팟캐스트, 음성 메모 등 오디오·비디오 녹음을 텍스트로 옮기는 온라인 도구입니다. 결과는 화자 표시와 타임코드가 붙은 문단으로 나오며, 페이지에서 바로 고치고 복사하거나 DOCX, PDF, TXT 또는 SRT/VTT 자막으로 내려받을 수 있습니다. 짧은 파일은 브라우저에서, 몇 시간짜리 파일은 저희 서버에서 처리되고 완료되면 이메일이 옵니다.

오디오를 텍스트로 변환하는 방법

1
녹음 올리기

MP3, WAV, M4A, FLAC, OGG, WebM 또는 영상 — 파일을 페이지로 끌어오거나 기기에서 선택합니다.

2
인식 설정

언어와 품질을 고르고 “화자 표시”를 켠 뒤, 알고 있다면 참가자 수를 입력합니다.

3
텍스트 받기

단어와 화자 이름을 페이지에서 바로 고친 다음 복사하거나 DOCX, PDF, TXT, SRT, VTT로 내려받습니다.

녹음된 대화를 읽기 좋은 문서로 바꾸세요: 누가, 언제, 무엇을 말했는지

실시간으로 받아쓰고 싶나요? 🎤 음성으로 문서 작성

오디오 파일을 여기에 드롭하세요
MP4, WEBM, MOV, MP3, WAV, M4A, OGG, FLAC, AAC, M4B, WMA, AIFF, OPUS, CAF, MKV, AVI, WMV, FLV, M4V, 3GP, TS, MTS, M2TS, VOB, MPG, MPEG, OGV

변환된 텍스트가 여기에 표시됩니다.

00:00

어떤 모델을 고를지, 그 대가는 무엇인지

인식은 브라우저에서 실행되므로 모델은 한 번만 내려받아 캐시에 남습니다. 큰 모델일수록 억양과 잡음을 잘 알아듣지만 같은 기기에서 더 오래 걸립니다.

모델 최초 1회 내려받기 오디오 1분당 시간 이럴 때 선택
빠르게 ~75 MB 약 1분 빠른 초안, 또렷한 음성, 한 사람
정확하게 ~150 MB 약 3분 일상적인 녹음 — 무난한 절충
고정밀 (small) ~250 MB 약 6분 억양, 배경 소음, 여러 화자
프리미엄 (Large v3 Turbo) ~600 MB GPU에 따라 다름 가장 어려운 오디오. GPU나 최신 CPU 필요

영상은 먼저 오디오 트랙만 추출합니다. 휴대폰으로 찍은 1시간 영상은 2–3GB지만 소리는 약 30MB입니다.

게시일 업데이트 제작자: