Qu’est-ce que la reconnaissance vocale (STT) ?

La reconnaissance vocale (STT, pour speech to text), aussi appelée reconnaissance automatique de la parole (ASR), est une technologie qui convertit le langage parlé en texte écrit. Elle alimente la transcription, les sous-titres automatiques, la dictée et les assistants vocaux. Sa précision dépend surtout de la qualité audio, des accents et du vocabulaire. Sur wawie, elle produit des sous-titres automatiques que vous modifiez, traduisez et exportez pour YouTube, TikTok ou Instagram.

Créer un compte gratuit 5 000 crédits offerts. Sans carte bancaire.

Mis à jour le 27 septembre 2026

Comment fonctionne la reconnaissance vocale ?

La reconnaissance vocale transforme d’abord l’audio en une image compacte de ses fréquences dans le temps, généralement un spectrogramme. Un réseau de neurones, entraîné sur de grandes quantités de parole transcrite, associe ces caractéristiques à des sons, des fragments de mots ou des caractères probables. Un modèle de langage, intégré au réseau ou ajouté après, s’appuie sur le contexte pour choisir les mots les plus probables, ce qui permet de distinguer des homophones comme vert, verre et vers. Un post-traitement ajoute ensuite la ponctuation, les majuscules et le format des nombres, et associe des horodatages aux mots ou aux phrases. Pour les sous-titres, le texte est découpé en courtes lignes calées sur la parole et exporté dans des formats comme SRT ou VTT.

À quoi sert la reconnaissance vocale ?

La reconnaissance vocale sert chaque fois que des paroles doivent devenir un texte lisible et consultable. Les créateurs vidéo l’utilisent pour générer des sous-titres, qui aident ceux qui regardent sans le son et rendent les contenus accessibles aux personnes sourdes et malentendantes. Les équipes transcrivent réunions, interviews et cours pour pouvoir les rechercher et les citer. Rédacteurs et professionnels utilisent la dictée pour écrire à la voix. La reconnaissance vocale est aussi la première étape du doublage IA, où la transcription est traduite avant d’être redite. Une transcription donne enfin aux moteurs de recherche et aux assistants IA du texte à indexer.

Qu’est-ce qui influence la précision de la reconnaissance vocale ?

La précision de la reconnaissance vocale se mesure généralement par le taux d’erreur sur les mots (WER, pour word error rate), c’est-à-dire la part des mots faux, manquants ou ajoutés par rapport à une transcription correcte. Un audio propre, avec une seule personne proche du micro, donne les meilleurs résultats. La précision baisse avec le bruit de fond, la musique, l’écho, les personnes qui parlent en même temps, les accents que le modèle a rarement entendus et le vocabulaire spécialisé, comme les noms de marques, les termes médicaux ou le jargon. Un débit rapide et des enregistrements de mauvaise qualité ajoutent aussi des erreurs. Pour tout ce que vous publiez, relisez la transcription et corrigez les noms et les termes clés avant d’exporter les sous-titres.

Exemples de reconnaissance vocale

Questions fréquentes

Quelle différence entre reconnaissance vocale et synthèse vocale ?

Elles fonctionnent en sens inverse. La reconnaissance vocale (STT) écoute un audio parlé et le met par écrit, pour produire une transcription ou des sous-titres. La synthèse vocale (TTS) prend un texte écrit et le lit à voix haute avec une voix de synthèse. La reconnaissance vocale sert à comprendre la parole, la synthèse vocale à la produire. Les deux sont souvent combinées, par exemple dans le doublage IA, où une vidéo est transcrite, traduite puis redite dans une autre langue.

La reconnaissance vocale est-elle précise ?

Sur une parole claire, dans les langues bien prises en charge, la reconnaissance vocale moderne est très précise, et la plupart des erreurs restantes concernent les noms, le jargon, les nombres et les voix qui se chevauchent. La précision baisse avec le bruit de fond, la musique, l’écho, un débit rapide et des accents peu familiers. Elle se mesure par le taux d’erreur sur les mots (WER) : plus il est bas, mieux c’est. Les sous-titres des vidéos publiées doivent toujours être relus. Sur wawie, chaque sous-titre est modifiable avant l’export, et vous pouvez tester gratuitement avec 5 000 crédits, sans carte bancaire.

Que sont les fichiers de sous-titres SRT et VTT ?

SRT (SubRip) et VTT (WebVTT) sont deux des formats de fichiers de sous-titres les plus courants. Ce sont des fichiers texte simples qui contiennent une liste de sous-titres, chacun avec un temps de début, un temps de fin et le texte à afficher. Le SRT est pris en charge par presque toutes les plateformes et tous les logiciels de montage vidéo. Le WebVTT est le standard du web pour la vidéo HTML5 et gère des options de style et de positionnement supplémentaires. Vous importez l’un ou l’autre avec votre vidéo, pour que les spectateurs puissent activer ou désactiver les sous-titres.

Quelle différence entre sous-titres classiques et sous-titres pour sourds et malentendants ?

En anglais, on distingue les captions, destinées aux personnes qui ne peuvent pas entendre l’audio, et les subtitles, qui ne transcrivent ou ne traduisent que les dialogues. En français, on parle de sous-titres dans les deux cas, et de sous-titres pour sourds et malentendants (SME) quand ils décrivent aussi les sons utiles, comme la musique ou les rires, et identifient les personnes qui parlent. Par ailleurs, les sous-titres fermés peuvent être activés ou désactivés par le spectateur, alors que les sous-titres incrustés font partie de l’image et restent toujours visibles.

Termes associés

Créer un compte gratuit 5 000 crédits offerts. Sans carte bancaire.