오디오 텍스트 변환 — 문단과 화자 표시가 있는 녹취록
회의, 인터뷰, 강의, 팟캐스트, 음성 메모 등 오디오·비디오 녹음을 텍스트로 옮기는 온라인 도구입니다. 결과는 화자 표시와 타임코드가 붙은 문단으로 나오며, 페이지에서 바로 고치고 복사하거나 DOCX, PDF, TXT 또는 SRT/VTT 자막으로 내려받을 수 있습니다. 짧은 파일은 브라우저에서, 몇 시간짜리 파일은 저희 서버에서 처리되고 완료되면 이메일이 옵니다.
오디오를 텍스트로 변환하는 방법
MP3, WAV, M4A, FLAC, OGG, WebM 또는 영상 — 파일을 페이지로 끌어오거나 기기에서 선택합니다.
언어와 품질을 고르고 “화자 표시”를 켠 뒤, 알고 있다면 참가자 수를 입력합니다.
단어와 화자 이름을 페이지에서 바로 고친 다음 복사하거나 DOCX, PDF, TXT, SRT, VTT로 내려받습니다.
녹음된 대화를 읽기 좋은 문서로 바꾸세요: 누가, 언제, 무엇을 말했는지
실시간으로 받아쓰고 싶나요? 🎤 음성으로 문서 작성
파일은 하나씩 변환되며, 완성된 텍스트는 아래 기록에 저장됩니다. 파일마다 별도의 실행입니다.
📝 이름 및 용어 (선택)
변환된 텍스트가 여기에 표시됩니다.
전사 결과
회의록은 언어 모델이 작성합니다. 분석을 위해 텍스트는 외부 AI 제공업체(Anthropic, 미국)로 전달됩니다. 전송 전에 여권번호, 납세·사회보장 번호, 계좌·카드 번호, 전화번호, 이메일은 자리표시자로 바꿉니다. 이름, 회사명, 주소는 본문에 그대로 남으니 제3자에게 내용을 전달할 권한이 없는 대화는 올리지 마세요. 모든 항목은 검증합니다. 인용문이 본문에 그대로 있을 때만 표시되므로 지어낸 결론은 걸러집니다. 다만 분석이 완벽하다는 뜻은 아니므로 중요한 내용은 녹음과 대조하세요.
📖 기록
어떤 모델을 고를지, 그 대가는 무엇인지
인식은 브라우저에서 실행되므로 모델은 한 번만 내려받아 캐시에 남습니다. 큰 모델일수록 억양과 잡음을 잘 알아듣지만 같은 기기에서 더 오래 걸립니다.
| 모델 | 최초 1회 내려받기 | 오디오 1분당 시간 | 이럴 때 선택 |
|---|---|---|---|
| 빠르게 | ~75 MB | 약 1분 | 빠른 초안, 또렷한 음성, 한 사람 |
| 정확하게 | ~150 MB | 약 3분 | 일상적인 녹음 — 무난한 절충 |
| 고정밀 (small) | ~250 MB | 약 6분 | 억양, 배경 소음, 여러 화자 |
| 프리미엄 (Large v3 Turbo) | ~600 MB | GPU에 따라 다름 | 가장 어려운 오디오. GPU나 최신 CPU 필요 |
영상은 먼저 오디오 트랙만 추출합니다. 휴대폰으로 찍은 1시간 영상은 2–3GB지만 소리는 약 30MB입니다.