Audio a texto — transcripción en párrafos con etiquetas de hablante
Herramienta en línea para transcribir grabaciones de audio y video — reuniones, entrevistas, clases, pódcast y notas de voz — a texto. El resultado llega en párrafos con etiquetas de hablante y marcas de tiempo; se puede editar en la página, copiar o descargar como DOCX, PDF, TXT o subtítulos SRT/VTT. Los archivos cortos se reconocen en el navegador; los de varias horas se procesan en nuestro servidor y recibe un correo cuando el texto está listo.
Cómo transcribir audio a texto
MP3, WAV, M4A, FLAC, OGG, WebM o un video: arrastre el archivo a la página o elíjalo en su dispositivo.
Elija idioma y calidad, marque «Etiquetar hablantes» e indique el número de participantes si lo conoce.
Corrija palabras y nombres de hablantes en la propia página; luego copie el texto o descargue DOCX, PDF, TXT, SRT o VTT.
Convierta una conversación grabada en un documento legible: quién dijo qué y cuándo
¿Prefiere dictar en vivo? 🎤 Escribir con la voz
Los archivos se transcriben uno a uno; cada texto terminado se guarda en el historial de abajo. Cada archivo es una ejecución aparte.
📝 Nombres y términos (opcional)
Tu texto transcrito aparecerá aquí.
Transcripción
El acta la redacta un modelo de lenguaje. Para el análisis el texto se envía a un proveedor de IA externo (Anthropic, EE. UU.). Antes de enviar sustituimos por marcadores los números de pasaporte, identificadores fiscales y de seguridad social, números de cuenta y tarjeta, teléfonos y correos; los nombres, las empresas y las direcciones permanecen en el texto: no subas una conversación cuyo contenido no tengas derecho a compartir con terceros. Cada punto se verifica: solo aparece si su cita está literalmente en tu texto. Eso descarta conclusiones inventadas, pero no vuelve infalible el análisis: contrasta lo importante con la grabación.
📖 Historial
Qué modelo elegir y qué cuesta
El reconocimiento se ejecuta en tu navegador, así que el modelo se descarga una vez y queda en caché. Los modelos grandes oyen mejor los acentos y el ruido, pero tardan más en la misma máquina.
| Modelo | Descarga única | Tiempo por minuto de audio | Cuándo elegirlo |
|---|---|---|---|
| Rápido | ~75 MB | unos 1 min | Borrador rápido, habla clara, una sola voz |
| Preciso | ~150 MB | unos 3 min | Grabaciones cotidianas: el compromiso habitual |
| Alta Precisión (small) | ~250 MB | unos 6 min | Acentos, ruido de fondo, varios hablantes |
| Premium (Large v3 Turbo) | ~600 MB | depende de la GPU | El audio más difícil; requiere GPU o CPU moderna |
De un video se extrae primero la pista de audio: una hora grabada con el celular pesa 2–3 GB, y su sonido unos 30 MB.