Audio in Text — Transkription in Absätzen mit Sprechermarken
Online-Werkzeug zum Transkribieren von Audio- und Videoaufnahmen — Besprechungen, Interviews, Vorlesungen, Podcasts und Sprachnotizen — in Text. Das Ergebnis kommt in Absätzen mit Sprecher- und Zeitmarken; es lässt sich direkt auf der Seite bearbeiten, kopieren oder als DOCX, PDF, TXT oder Untertitel (SRT/VTT) herunterladen. Kurze Dateien werden im Browser erkannt, stundenlange auf unserem Server, mit einer E-Mail, sobald der Text fertig ist.
So transkribieren Sie Audio in Text
MP3, WAV, M4A, FLAC, OGG, WebM oder ein Video — Datei auf die Seite ziehen oder auf dem Gerät auswählen.
Sprache und Qualität wählen, „Sprecher markieren“ anhaken und die Teilnehmerzahl eintragen, falls bekannt.
Wörter und Sprechernamen direkt auf der Seite korrigieren, dann kopieren oder als DOCX, PDF, TXT, SRT oder VTT laden.
Machen Sie aus einer aufgezeichneten Unterhaltung ein lesbares Dokument: wer hat wann was gesagt
Lieber live diktieren? 🎤 Mit der Stimme schreiben
Dateien werden nacheinander transkribiert; jeder fertige Text landet im Verlauf unten. Jede Datei ist ein eigener Lauf.
📝 Namen & Begriffe (optional)
Ihr transkribierter Text erscheint hier.
Transkription
Das Protokoll schreibt ein Sprachmodell. Für die Analyse geht der Text an einen externen KI-Anbieter (Anthropic, USA). Vor dem Senden ersetzen wir Ausweis-, Steuer- und Versicherungsnummern, Konto- und Kartennummern, Telefonnummern und E-Mail-Adressen durch Platzhalter; Namen, Firmennamen und Adressen bleiben im Text — laden Sie kein Gespräch hoch, dessen Inhalt Sie nicht an Dritte weitergeben dürfen. Jeder Punkt wird geprüft: Er erscheint nur, wenn sein Zitat wörtlich in Ihrem Text steht. Das schließt erfundene Schlüsse aus, macht die Analyse aber nicht unfehlbar — prüfen Sie Wichtiges an der Aufnahme nach.
📖 Verlauf
Welches Modell wählen und was es kostet
Die Erkennung läuft im Browser, das Modell wird einmal geladen und bleibt im Cache. Größere Modelle hören Akzente und Störgeräusche besser, brauchen auf derselben Maschine aber länger.
| Modell | Einmaliger Download | Zeit pro Minute Audio | Wann wählen |
|---|---|---|---|
| Schnell | ~75 MB | etwa 1 Min. | Schneller Entwurf, klare Sprache, eine Stimme |
| Genau | ~150 MB | etwa 3 Min. | Alltägliche Aufnahmen — der übliche Kompromiss |
| Hohe Genauigkeit (small) | ~250 MB | etwa 6 Min. | Akzente, Hintergrundgeräusche, mehrere Sprecher |
| Premium (Large v3 Turbo) | ~600 MB | hängt von der GPU ab | Schwierigstes Material; braucht GPU oder aktuelle CPU |
Aus einem Video wird zuerst die Tonspur extrahiert: eine Stunde Handyvideo wiegt 2–3 GB, der Ton davon etwa 30 MB.