Eliminador de voces de canciones online

Separación de stems con IA — extrae instrumentales, aísla a capela o crea versiones karaoke de cualquier canción. Quita las voces con aprendizaje automático para producción musical, ensayo y remix.

Cómo quitar la voz de una canción

1

Sube tu archivo de audio (MP3, WAV, FLAC o cualquier otro formato)

2

Espera unos segundos mientras la herramienta separa la voz de la música

3

Previsualiza el resultado — escucha la música, la voz o ambas a la vez

4

Ajusta el deslizador de Intensidad de separación para obtener mejores resultados

5

Elige el formato de salida (MP3, WAV o FLAC)

6

Descarga la pista instrumental (Música) o la pista vocal por separado

Obtén pistas instrumentales y vocales de cualquier canción en segundos

Suelta aquí tu archivo de audio
MP3, WAV, OGG, FLAC, AAC, M4A, WEBM, AIFF, OPUS, WMA, M4B, CAF
Cómo separar
Variantes de procesamiento
Este archivo es mono — Agresivo y Dos pases necesitan un archivo estéreo (los algoritmos de separación dependen de la imagen estéreo para aislar la voz). Estándar seguirá funcionando.

Escuchar y ajustar

Música
Voz
0:00 0:00
Mezcla rápida:
Intensidad de separación 90%

Guardar

Opciones de exportación avanzadas — formatos por stem, fundidos, normalización LUFS
Normalización de loudness Aplica filtro EBU R128 loudnorm para coincidir con objetivos LUFS de streaming/broadcast. Añade ~3-8 s a la codificación.

Cada pista se puede guardar por separado con el botón de su fila. «Mezcla» guarda lo que oyes: los volúmenes actuales y la pista seleccionada.

💡 Cómo funciona: En «Ultra» la separación la hace un modelo neuronal: reconoce la voz por su timbre y no depende de dónde esté situada en la imagen estéreo. «Rápido» funciona de otro modo: resta lo que suena igual en los canales izquierdo y derecho — casi instantáneo, pero más tosco. El control Fuerza de separación equilibra ambas pistas.

Qué funciona por dentro

Los modos no son «niveles de calidad» de un mismo algoritmo, sino motores distintos. Dos los eliges tú y otros dos se activan solos. «Ultra» descarga antes un modelo, algo a tener en cuenta con datos móviles.

Modo Qué funciona Descarga
Rápido · menor calidad Separación por imagen estéreo: lo que está en el centro se resta espectralmente (ventana de 4096, banda de voz 100 Hz – 12 kHz). Nada: empieza al instante
IA Un modelo neuronal de separación (ONNX). No se puede elegir: se activa solo en archivos mono, donde «Ultra» no funciona. Unos 56 MB, una sola vez
Ultra · mejor calidad MDX-Net Kim Vocal 2: el más preciso disponible y el más lento. Necesita estéreo. Unos 64 MB, una sola vez
Coros UVR MDX-Net Karaoke 2: una segunda pasada sobre la voz ya extraída que separa la principal de los coros. Unos 50 MB, una sola vez

Qué esperar

  • «Rápido» necesita estéreo: una grabación mono no tiene imagen estéreo que restar, así que ambas pistas vuelven iguales. «Ultra» también necesita estéreo y no funciona en mono: allí toma el relevo otro motor neuronal de forma automática.
  • El modelo se descarga una vez y queda en la caché del navegador: la siguiente canción en el mismo navegador arranca de inmediato.
  • La separación perfecta no existe: cuanto más densa la mezcla, más a menudo queda rastro de la voz en la pista instrumental. La herramienta mide ese resto y propone una variante más fuerte.
Publicada Actualizada Autor: