Vocal-Remover für Songs online

KI-basierte Stem-Trennung — Instrumentale extrahieren, Acapella isolieren oder Karaoke-Versionen aus beliebigen Songs erstellen. Gesang per Machine Learning entfernen — für Musikproduktion, Übung und Remix.

So entfernen Sie Gesang aus einem Song

1

Audiodatei hochladen (MP3, WAV, FLAC oder beliebiges anderes Format)

2

Ein paar Sekunden warten, während das Tool Gesang und Musik trennt

3

Ergebnis vorhören — Musik, Gesang oder beides zusammen anhören

4

Trennstärke-Schieberegler für optimale Ergebnisse anpassen

5

Ausgabeformat wählen (MP3, WAV oder FLAC)

6

Instrumental (Musik) oder Gesangsspur separat herunterladen

Instrumental- und Gesangsspuren aus jedem Song in Sekunden

Audiodatei hier ablegen
MP3, WAV, OGG, FLAC, AAC, M4A, WEBM, AIFF, OPUS, WMA, M4B, CAF
Wie getrennt wird
Verarbeitungsvarianten
Diese Datei ist Mono — Aggressiv und Zwei Durchgänge benötigen eine Stereo-Datei (die Trennungsalgorithmen verlassen sich auf das Stereo-Bild, um den Gesang zu isolieren). Standard funktioniert weiterhin.

Anhören und anpassen

Musik
Gesang
0:00 0:00
Schnell-Mix:
Trennstärke 90%

Speichern

Erweiterte Export-Optionen — Formate pro Stem, Fades, LUFS-Normalisierung
Lautstärke-Normalisierung EBU R128 loudnorm-Filter anwenden, um Streaming/Broadcast LUFS-Ziele zu erfüllen. Fügt ~3-8 s zum Encoding hinzu.

Jede Spur lässt sich einzeln speichern — über die Schaltfläche in ihrer Zeile. „Mix“ speichert, was Sie hören: aktuelle Lautstärken und die gewählte Spur.

💡 So funktioniert es: In „Ultra“ trennt ein neuronales Modell — es erkennt die Stimme am Klang und hängt nicht davon ab, wo der Gesang im Stereobild sitzt. „Schnell“ arbeitet anders: Es zieht ab, was in linkem und rechtem Kanal gleich klingt — nahezu sofort, aber gröber. Der Regler Trennstärke balanciert beide Spuren.

Was unter der Haube läuft

Die Modi sind keine „Qualitätsstufen“ eines Verfahrens, sondern verschiedene Maschinen. Zwei wählen Sie selbst, zwei schalten sich automatisch zu. „Ultra“ lädt zuerst ein Modell — gut zu wissen im Mobilnetz.

Modus Was arbeitet Download
Schnell · geringere Qualität Trennung über das Stereobild: was in der Mitte sitzt, wird spektral abgezogen (Fenster 4096, Stimmband 100 Hz – 12 kHz). Nichts — startet sofort
KI Ein neuronales Trennmodell (ONNX). Nicht wählbar — es springt bei Mono-Dateien ein, wo „Ultra“ nicht läuft. Etwa 56 MB, einmalig
Ultra · beste Qualität MDX-Net Kim Vocal 2 — das genaueste verfügbare und das langsamste. Braucht Stereo. Etwa 64 MB, einmalig
Backing-Gesang UVR MDX-Net Karaoke 2: ein zweiter Durchgang über die fertige Gesangsspur, der Lead von Backing trennt. Etwa 50 MB, einmalig

Was zu erwarten ist

  • „Schnell“ braucht Stereo: eine Monoaufnahme hat kein Stereobild, von dem sich etwas abziehen ließe — beide Spuren kommen identisch zurück. Auch „Ultra“ braucht Stereo und läuft bei Mono nicht; dort übernimmt automatisch eine andere neuronale Maschine.
  • Ein Modell wird einmal geladen und bleibt im Browser-Cache — das nächste Lied im selben Browser startet sofort.
  • Perfekte Trennung gibt es nicht: je dichter die Mischung, desto öfter bleibt eine Spur der Stimme im Playback. Das Werkzeug misst diesen Rest selbst und schlägt eine stärkere Variante vor.
Veröffentlicht Aktualisiert Autor: