Zum Inhalt springen

Audio transkribieren

Nimm direkt über dein Mikrofon auf oder zieh vorhandene Dateien hinein — gern mehrere auf einmal — und bekomm den Text zurück, mit Zeitstempeln zum Export als Untertitel. Die Spracherkennung läuft auf deinem eigenen Gerät, es wird nichts hochgeladen. Genau darauf kommt es bei Interviews, Vorlesungen und allem Vertraulichen an.

Audiodateien hinzufügen

oder hierher ziehen

Füge eine oder mehrere Audiodateien hinzu — oder nimm direkt über dein Mikrofon auf.

Als Nächstes

SRT ↔ VTT Konverter
Untertitel zwischen SRT und WebVTT konvertieren
Text-Tools

Your files are processed locally in your browser. They are not uploaded to our servers.

So funktioniert's

  1. Füge deine Audiodateien hinzu — MP3, WAV, M4A, OGG, FLAC und die meisten anderen Formate funktionieren — oder klicke auf „Jetzt aufnehmen“ und sprich direkt ins Mikrofon.
  2. Wähle ein Modell: schnell für einen groben Entwurf, genau für das beste Ergebnis. Stelle die gesprochene Sprache ein, wenn du sie kennst, oder lass sie erkennen.
  3. Transkription starten. Jede Datei bekommt ihr eigenes Transkript zum Kopieren oder Herunterladen als TXT, SRT oder VTT — oder alles auf einmal als ZIP.

Was ist dieses Tool?

Audio transkribieren führt OpenAIs Spracherkennungsmodell Whisper direkt in deinem Browser aus — über WebAssembly und WebGPU. Das Modell wird einmal von einem öffentlichen CDN geladen und danach zwischengespeichert; deine Aufnahme selbst wird nirgendwohin geschickt. Das ist der entscheidende Punkt: Transkription ist genau die Aufgabe, bei der die Datei heikel ist — Bewerbungsgespräche, Therapiesitzungen, Arztnotizen, juristische Aufnahmen, unveröffentlichte Recherche — und jede verbreitete Alternative verlangt zuerst einen Upload auf einen Server. Weil alles lokal passiert, gibt es außerdem kein Minutenkontingent, kein Wasserzeichen und kein Konto. Whisper ist mehrsprachig, transkribiert Dutzende Sprachen und kann das Gehörte im selben Durchgang ins Englische übersetzen. Mehrere Dateien werden nacheinander verarbeitet, das Modell wird dabei nur einmal geladen — ein Stapel kostet also kaum mehr als eine einzelne Aufnahme.

Typische Anwendungen

  • Ein Interview oder eine Besprechung in durchsuchbaren Text verwandeln
  • SRT- oder VTT-Untertitel aus der Tonspur eines Videos erzeugen
  • Eine Vorlesung oder Podcast-Folge verschriftlichen, ohne sie abzutippen
  • Ein englisches Transkript einer fremdsprachigen Aufnahme bekommen

Häufige Fragen

Wird meine Aufnahme irgendwohin hochgeladen?

Nein. Das Sprachmodell läuft in deinem Browser, das Audio verlässt dein Gerät also nie. Heruntergeladen wird nur das Modell selbst (je nach Auswahl etwa 40–250 MB), das dein Browser danach für spätere Läufe zwischenspeichert.

Wie lange dauert das?

Das hängt vom Browser ab. Chrome und Edge am Desktop nutzen WebGPU und schaffen einen Bruchteil der Aufnahmelänge. Safari und ältere Browser fallen auf einen langsameren Modus zurück, in dem die Transkription etwa so lange dauert wie die Aufnahme selbst. Das kleinere Modell ist deutlich schneller, wenn ein grober Entwurf reicht.

Wird angezeigt, wer gerade spricht?

Nein. Das Transkript ist ein durchgehender Text und wird nicht nach Sprechern getrennt. Stimmen auseinanderzuhalten braucht ein zweites, anderes Modell und ist nicht Teil dieses Tools — gut zu wissen, bevor du es auf ein Interview mit mehreren Personen loslässt.

Wie genau ist die Erkennung?

Nicht direkt — dieses Tool nimmt Audiodateien. Zieh die Tonspur vorher mit dem Video-zu-MP3-Konverter heraus und transkribiere die. Die Zeitstempel passen weiterhin zum Originalvideo, die Untertitel sitzen also richtig.