Was ist Speech-to-Text (STT)?
Speech-to-Text (STT), auch automatische Spracherkennung (ASR) genannt, ist eine Technologie, die gesprochene Sprache in geschriebenen Text umwandelt. Sie steckt hinter Transkription, automatischen Untertiteln, Diktierfunktionen und Sprachassistenten. Die Genauigkeit hängt vor allem von Audioqualität, Akzenten und Wortschatz ab. Auf wawie treibt Speech-to-Text die automatischen Untertitel an, die du bearbeiten, übersetzen und für YouTube, TikTok oder Instagram exportieren kannst.
Kostenloses Konto erstellen 5.000 Gratis-Credits. Keine Karte nötig.
Aktualisiert am 27. September 2026
Wie funktioniert Speech-to-Text?
Speech-to-Text verwandelt das Audio zuerst in ein kompaktes Bild seiner Frequenzen über die Zeit, meist ein Spektrogramm. Ein neuronales Netz, trainiert auf großen Mengen transkribierter Sprache, ordnet diese Merkmale wahrscheinlichen Lauten, Wortteilen oder Buchstaben zu. Ein Sprachmodell, im Netz eingebaut oder nachgeschaltet, nutzt den Kontext, um die wahrscheinlichsten Wörter zu wählen, sodass das System etwa das und dass oder Rad und Rat auseinanderhalten kann. Die Nachbearbeitung ergänzt dann Satzzeichen, Großschreibung und Zahlenformate und versieht Wörter oder Phrasen mit Zeitstempeln. Für Untertitel wird der Text in kurze, auf die Sprache abgestimmte Zeilen geteilt und in Formaten wie SRT oder VTT exportiert.
Wofür wird Speech-to-Text genutzt?
Speech-to-Text wird überall genutzt, wo gesprochene Worte zu durchsuchbarem, lesbarem Text werden sollen. Video-Creator erzeugen damit Untertitel, die Zuschauern ohne Ton helfen und Inhalte für gehörlose und schwerhörige Menschen zugänglich machen. Teams transkribieren Meetings, Interviews und Vorlesungen, um sie durchsuchen und zitieren zu können. Autoren und Berufstätige diktieren, statt zu tippen. Speech-to-Text ist auch der erste Schritt der KI-Synchronisation, bei der das Transkript übersetzt wird, bevor es neu vertont wird. Ein Transkript gibt außerdem Suchmaschinen und KI-Assistenten Text, den sie indexieren können.
- Untertitel für YouTube, TikTok und Instagram
- Transkripte von Meetings, Interviews und Vorlesungen
- Diktieren und Spracheingabe
- Der erste Schritt der KI-Synchronisation
Was beeinflusst die Genauigkeit von Speech-to-Text?
Die Genauigkeit von Speech-to-Text wird meist mit der Wortfehlerrate gemessen (WER, Word Error Rate), dem Anteil der Wörter, die im Vergleich zu einem korrekten Transkript falsch sind, fehlen oder hinzugefügt wurden. Sauberes Audio einer einzelnen Person nah am Mikrofon liefert die besten Ergebnisse. Die Genauigkeit sinkt bei Hintergrundgeräuschen, Musik, Hall, Menschen, die durcheinanderreden, Akzenten oder Dialekten, die das Modell selten gehört hat, und Fachwortschatz wie Markennamen, medizinischen Begriffen oder Jargon. Schnelles Sprechen und Aufnahmen in schlechter Qualität verursachen ebenfalls Fehler. Prüfe bei allem, was du veröffentlichst, das Transkript und korrigiere Namen und Schlüsselbegriffe, bevor du Untertitel exportierst.
Beispiele für Speech-to-Text
- Ein YouTuber erzeugt Untertitel für ein Tutorial, korrigiert zwei Produktnamen und exportiert eine SRT-Datei.
- Eine TikTok-Creatorin brennt gestaltete Untertitel in ein Kurzvideo ein, für alle, die ohne Ton schauen.
- Eine Forscherin transkribiert aufgezeichnete Interviews, um sie in einem Bericht zu durchsuchen und zu zitieren.
- Die Diktierfunktion eines Smartphones tippt eine Nachricht, während du sprichst.
Häufige Fragen
Was ist der Unterschied zwischen Speech-to-Text und Text-to-Speech?
Sie arbeiten in entgegengesetzte Richtungen. Speech-to-Text (STT) hört gesprochenes Audio und schreibt es auf, als Transkript oder Untertitel. Text-to-Speech (TTS) nimmt geschriebenen Text und liest ihn mit einer synthetischen Stimme vor. Bei Speech-to-Text geht es darum, Sprache zu verstehen, bei Text-to-Speech darum, sie zu erzeugen. Beides wird oft kombiniert, etwa bei der KI-Synchronisation, bei der ein Video transkribiert, übersetzt und dann in einer anderen Sprache neu vertont wird.
Wie genau ist Speech-to-Text?
Bei deutlicher Sprache in gut unterstützten Sprachen ist modernes Speech-to-Text sehr genau, und die meisten verbleibenden Fehler betreffen Namen, Fachjargon, Zahlen und überlappende Sprecher. Die Genauigkeit sinkt bei Hintergrundgeräuschen, Musik, Hall, schnellem Sprechen und ungewohnten Akzenten. Gemessen wird sie mit der Wortfehlerrate (WER): Je niedriger, desto besser. Untertitel für veröffentlichte Videos sollten immer geprüft werden. Auf wawie ist jeder Untertitel vor dem Export bearbeitbar, und du kannst es kostenlos mit 5.000 Credits testen, ohne Karte.
Was sind SRT- und VTT-Untertiteldateien?
SRT (SubRip) und VTT (WebVTT) gehören zu den gängigsten Untertitelformaten. Beide sind reine Textdateien mit einer Liste von Untertiteleinträgen, jeweils mit Startzeit, Endzeit und dem anzuzeigenden Text. SRT wird von fast jeder Videoplattform und jedem Editor unterstützt. WebVTT ist der Webstandard für HTML5-Video und unterstützt zusätzliche Gestaltung und Positionierung. Du lädst eine der beiden Dateien zusammen mit deinem Video hoch, sodass Zuschauer die Untertitel ein- oder ausschalten können.
Was ist der Unterschied zwischen Captions und Untertiteln?
Im Englischen meinen Captions meist Text in derselben Sprache für Menschen, die den Ton nicht hören können; sie beschreiben deshalb auch wichtige Geräusche wie Musik oder Lachen und nennen mitunter die Sprecher. Subtitles meinen meist nur ein Transkript oder eine Übersetzung der Dialoge für Menschen, die hören können. Im Deutschen heißt beides Untertitel, die erste Variante nennt man Untertitel für Hörgeschädigte. Closed Captions lassen sich ausschalten, während offene oder eingebrannte Untertitel Teil des Videobilds und immer sichtbar sind.
Verwandte Begriffe
- Text-to-Speech (TTS): Text-to-Speech wandelt geschriebenen Text in natürlich klingende Sprache um, genutzt für Voice-overs, Vertonungen, Barrierefreiheit und Sprachassistenten.
- KI-Synchronisation: KI-Synchronisation übersetzt die Sprache in einem Video und vertont sie in einer anderen Sprache neu, zeitlich passend zum Original und auf Wunsch mit der Originalstimme.
- Stimmisolierung: Stimmisolierung trennt eine Stimme von Hintergrundgeräuschen, Musik und Raumhall und hinterlässt saubere Sprache, die du veröffentlichen, transkribieren oder synchronisieren kannst.
Kostenloses Konto erstellen 5.000 Gratis-Credits. Keine Karte nötig.