Sprach-Eingabe — Online-Diktat mit Mikrofon

Ein Spracheingabe-Tool, das Sprache live in Text verwandelt, während Sie sprechen. Drücken Sie das Mikrofon, fangen Sie an zu reden, und Ihre Wörter landen in dem Moment auf der Seite, in dem Sie sie aussprechen — sagen Sie „Komma" oder „neuer Absatz", um zu interpunktieren, ohne eine Hand zu heben. Es ist für freihändiges Schreiben gemacht: einen Gedanken festhalten, eine E-Mail entwerfen, in einer Besprechung mitschreiben oder schreiben, wenn Tippen unangenehm ist. Die Erkennung nutzt die im Browser eingebaute Sprach-Engine.

So tippen Sie mit Ihrer Stimme

1
Schalten Sie das Mikrofon ein

Drücken Sie die Mikrofon-Taste und erlauben Sie Ihrem Browser, das Mikrofon zu nutzen, wenn er fragt.

2
Fangen Sie einfach an zu reden

Sprechen Sie natürlich, und Ihre Wörter erscheinen in Echtzeit; sagen Sie „Komma", „Punkt" oder „neuer Absatz", um nebenbei zu interpunktieren.

3
Nutzen Sie den Fokus-Modus für eine lange Session

Aktivieren Sie die Dauer-Aufnahme und den Fokus-Modus, um ausführlich zu diktieren, und setzen Sie ein Lesezeichen, wann immer etwas wichtig ist.

4
TXT, SRT, VTT, JSON, PDF oder DOCX

Bringen Sie den Text von Hand in Form, kopieren Sie ihn dann oder speichern Sie ihn als TXT, SRT, VTT, JSON, PDF oder DOCX.

Diktieren Sie mit Ihrer Stimme und sehen Sie die Wörter erscheinen, während Sie reden

Wenn Sie umgekehrt Text in Stimme verwandeln möchten, nutzen Sie Text-to-Speech →

Sie haben schon eine Aufnahme? 📁 Audiodatei transkribieren

00:00
0:00
0:00 / 0:00
Format

Ihr transkribierter Text erscheint hier.

⌨ Tastaturkürzel
Aufnahme starten/stoppen CtrlShiftR
Pause/Fortsetzen CtrlShiftP
Transkript kopieren CtrlShiftC
TXT herunterladen CtrlS
Suchen & Ersetzen CtrlF
Lesezeichen hinzufügen CtrlShiftB
Fokus-Modus umschalten CtrlShiftD
Panels schließen Esc
00:00

Welches Modell wählen und was es kostet

Die Erkennung läuft im Browser, das Modell wird einmal geladen und bleibt im Cache. Größere Modelle hören Akzente und Störgeräusche besser, brauchen auf derselben Maschine aber länger.

Modell Einmaliger Download Zeit pro Minute Audio Wann wählen
Schnell ~75 MB etwa 1 Min. Schneller Entwurf, klare Sprache, eine Stimme
Genau ~150 MB etwa 3 Min. Alltägliche Aufnahmen — der übliche Kompromiss
Hohe Genauigkeit (small) ~250 MB etwa 6 Min. Akzente, Hintergrundgeräusche, mehrere Sprecher
Premium (Large v3 Turbo) ~600 MB hängt von der GPU ab Schwierigstes Material; braucht GPU oder aktuelle CPU

Aus einem Video wird zuerst die Tonspur extrahiert: eine Stunde Handyvideo wiegt 2–3 GB, der Ton davon etwa 30 MB.

Veröffentlicht Aktualisiert Autor: