Sprache zu Text (Whisper)
Kostenlose, private Spracherkennung im Browser: Transkribiere oder übersetze Audio und Video mit OpenAI Whisper direkt auf deinem Gerät – per Mikrofon aufnehmen und als TXT oder SRT exportieren.
🔒 Läuft vollständig in Ihrem Browser — nichts wird hochgeladenWhisper-Spracherkennung, die auf deinem Gerät läuft
Dieses Tool verwandelt gesprochene Worte mit Whisper in Text – dem offenen Spracherkennungsmodell, das OpenAI veröffentlicht hat. Anders als bei den meisten Online-Transkriptionsdiensten wird nichts an einen Server gesendet: Dein Browser dekodiert die Audiodatei, rechnet sie auf 16 kHz Mono um und übergibt sie in einem Web Worker im Hintergrund an das Modell. Die Seite wählt automatisch die schnellste verfügbare Engine – WebGPU auf Grafikkarten und in Browsern, die es unterstützen, sonst überall WebAssembly auf der CPU. Beim ersten Durchlauf werden die Modellgewichte von Hugging Face heruntergeladen; danach bleiben sie im Browser-Cache, sodass spätere Sitzungen deutlich schneller starten.
Du kannst Interviews, Vorlesungen, Podcasts, Sprachnotizen und Besprechungsaufnahmen transkribieren oder die Tonspur einer Videodatei. Kurze Clips lassen sich direkt über dein Mikrofon aufnehmen. Lange Aufnahmen werden in überlappenden 30-Sekunden-Fenstern verarbeitet, und der Fortschrittsbalken zeigt, wie viele Fenster bereits fertig sind. Da die Verarbeitung lokal erfolgt, eignet sich das Tool auch für vertrauliche Aufnahmen, die du keinem Cloud-Dienst anvertrauen möchtest.
Transkripte, Übersetzungen und Untertitel
Wähle Transcribe, um Text in der Originalsprache zu erhalten, oder Translate to English, damit Whisper eine englische Fassung von Sprache in einer anderen Sprache schreibt. „Auto-detect“ hört sich die ersten 30 Sekunden an, um die Sprache zu erkennen; beginnt deine Aufnahme mit Musik oder Stille, erzielst du bessere Ergebnisse, wenn du die Sprache selbst auswählst. Schalte Zeitstempel ein, um zu sehen, wann welcher Satz gesprochen wurde, und lade eine SRT-Untertiteldatei herunter, die du in Videoeditoren, auf YouTube oder in Mediaplayern verwenden kannst.
Tipps für genaue Ergebnisse
Klarer Ton ist wichtiger als alles andere. Nimm nah am Mikrofon auf, vermeide Hintergrundmusik und lass immer nur eine Person gleichzeitig sprechen. Whisper base ist ein kompaktes Modell, daher müssen Namen, Fachbegriffe und starke Akzente eventuell kurz von Hand korrigiert werden – lies den Text vor der Veröffentlichung immer Korrektur. Wenn dein Gerät wenig Arbeitsspeicher hat, schließe andere rechenintensive Tabs, bevor du lange Dateien transkribierst, und lass diesen Tab geöffnet, bis das Transkript vollständig ist. In Räumen mit Hall hilft außerdem ein externes Mikrofon oder ein Headset.
So verwenden Sie
- Audio hinzufügenZiehe eine Audio- oder Videodatei in das Feld oder drücke „Record from microphone“ und sprich los.
- Sprache und Aufgabe wählenLass die Sprache auf „Auto-detect“ oder wähle sie aus und entscheide dich dann für „Transcribe“ oder „Translate to English“.
- Whisper startenDrücke „Transcribe“. Das Modell wird einmalig heruntergeladen und läuft dann auf deinem Gerät, während sich der Fortschrittsbalken füllt.
- Text exportierenAktiviere bei Bedarf Zeitstempel und kopiere dann das Transkript oder lade es als .txt-Datei oder als .srt-Untertitel herunter.