¿Qué es la conversión de voz a texto (STT)?
La conversión de voz a texto (STT), también llamada reconocimiento automático del habla (ASR), es una tecnología que convierte el lenguaje hablado en texto escrito. Hace posibles la transcripción, los subtítulos automáticos, el dictado y los asistentes de voz. Su precisión depende sobre todo de la calidad del audio, los acentos y el vocabulario. En wawie impulsa unos subtítulos automáticos que puedes editar, traducir y exportar para YouTube, TikTok o Instagram.
Crear una cuenta gratis 5.000 créditos gratis. Sin tarjeta.
Actualizado el 27 de septiembre de 2026
¿Cómo funciona la conversión de voz a texto?
La conversión de voz a texto transforma primero el audio en una imagen compacta de sus frecuencias a lo largo del tiempo, normalmente un espectrograma. Una red neuronal, entrenada con grandes cantidades de voz transcrita, relaciona esas características con los sonidos, fragmentos de palabras o caracteres más probables. Un modelo de lenguaje, integrado en la red o añadido después, usa el contexto para elegir las palabras más probables, de modo que el sistema puede distinguir entre vaya, valla y baya. Después, el posprocesamiento añade la puntuación, las mayúsculas y el formato de los números, y asocia marcas de tiempo a palabras o frases. Para los subtítulos, el texto se divide en líneas cortas sincronizadas con la voz y se exporta en formatos como SRT o VTT.
¿Para qué se usa la conversión de voz a texto?
La conversión de voz a texto se usa siempre que las palabras habladas tienen que convertirse en un texto que se pueda buscar y leer. Los creadores de vídeo la usan para generar subtítulos, que ayudan a quien ve sin sonido y hacen el contenido accesible para personas sordas o con dificultades auditivas. Los equipos transcriben reuniones, entrevistas y clases para poder buscarlas y citarlas. Escritores y profesionales usan el dictado para escribir con la voz. La conversión de voz a texto también es el primer paso del doblaje con IA, en el que la transcripción se traduce antes de volver a ponerle voz. Además, una transcripción da a los buscadores y a los asistentes de IA un texto que pueden indexar.
- Subtítulos para YouTube, TikTok e Instagram
- Transcripciones de reuniones, entrevistas y clases
- Dictado y escritura por voz
- El primer paso del doblaje con IA
¿Qué afecta a la precisión de la conversión de voz a texto?
La precisión de la conversión de voz a texto suele medirse con la tasa de error de palabras (WER, por sus siglas en inglés), el porcentaje de palabras erróneas, omitidas o añadidas en comparación con una transcripción correcta. Un audio limpio de una sola persona cerca del micrófono da los mejores resultados. La precisión baja con el ruido de fondo, la música, el eco, las personas que hablan a la vez, los acentos que el modelo apenas ha oído y el vocabulario especializado, como nombres de marca, términos médicos o jerga. El habla rápida y las grabaciones de baja calidad también añaden errores. En todo lo que publiques, revisa la transcripción y corrige los nombres y los términos clave antes de exportar los subtítulos.
Ejemplos de voz a texto
- Un youtuber genera los subtítulos de un tutorial, corrige dos nombres de producto y exporta un archivo SRT.
- Una creadora de TikTok incrusta subtítulos con estilo en un vídeo corto para quienes lo ven sin sonido.
- Un investigador transcribe entrevistas grabadas para buscarlas y citarlas en un informe.
- La función de dictado de un móvil escribe un mensaje mientras hablas.
Preguntas frecuentes
¿Qué diferencia hay entre voz a texto y texto a voz?
Funcionan en direcciones opuestas. La voz a texto (STT) escucha el audio hablado y lo pone por escrito, produciendo una transcripción o unos subtítulos. El texto a voz (TTS) toma un texto escrito y lo lee en voz alta con una voz sintética. La voz a texto consiste en entender el habla, mientras que el texto a voz consiste en producirla. Ambos se combinan a menudo, por ejemplo en el doblaje con IA, donde un vídeo se transcribe, se traduce y luego se vuelve a locutar en otro idioma.
¿Qué precisión tiene la conversión de voz a texto?
Con una voz clara en los idiomas más extendidos, la conversión de voz a texto moderna es muy precisa, y la mayoría de los errores que quedan afectan a nombres, jerga, números y voces que se solapan. La precisión baja con el ruido de fondo, la música, el eco, el habla rápida y los acentos poco habituales. Se mide con la tasa de error de palabras (WER): cuanto más baja, mejor. Los subtítulos de los vídeos que se publican siempre deben revisarse. En wawie, cada subtítulo se puede editar antes de exportar, y puedes probarlo gratis con 5.000 créditos, sin tarjeta.
¿Qué son los archivos de subtítulos SRT y VTT?
SRT (SubRip) y VTT (WebVTT) son dos de los formatos de archivo de subtítulos más comunes. Ambos son archivos de texto plano que contienen una lista de subtítulos, cada uno con un tiempo de inicio, un tiempo de fin y el texto que se muestra. SRT es compatible con casi todas las plataformas y editores de vídeo. WebVTT es el estándar web para el vídeo HTML5 y admite estilos y posiciones adicionales. Subes cualquiera de los dos archivos junto con tu vídeo, para que el público pueda activar o desactivar los subtítulos.
¿Qué diferencia hay entre los subtítulos y los subtítulos para personas sordas?
Los subtítulos convencionales transcriben o traducen solo los diálogos, para un público que puede oír el audio. Los subtítulos para personas sordas, también llamados SPS o SDH, están pensados para quien no puede oírlo: además del diálogo, describen sonidos relevantes como la música o las risas, y pueden identificar a quien habla. En inglés, esta diferencia es la que separa captions de subtitles. Los subtítulos cerrados se pueden desactivar, mientras que los subtítulos abiertos o incrustados forman parte de la imagen del vídeo y siempre están visibles.
Términos relacionados
- Texto a voz (TTS): El texto a voz convierte texto escrito en una voz natural, y se usa en voces en off, narraciones, accesibilidad y asistentes de voz.
- Doblaje con IA: El doblaje con IA traduce un vídeo y le pone voz en otro idioma, sincronizada con el original y, si quieres, con la misma voz.
- Aislamiento de voz: El aislamiento de voz separa una voz del ruido, la música y el eco, y deja una voz limpia para publicar, transcribir o doblar.
Crear una cuenta gratis 5.000 créditos gratis. Sin tarjeta.