O que é fala para texto (STT)?
Fala para texto (STT), também chamada de reconhecimento automático de fala (ASR), é uma tecnologia que converte a linguagem falada em texto escrito. Ela está por trás de transcrições, legendas automáticas, ditado e assistentes de voz. A precisão depende principalmente da qualidade do áudio, dos sotaques e do vocabulário. Na wawie, a fala para texto gera legendas automáticas que você pode editar, traduzir e exportar para YouTube, TikTok ou Instagram.
Criar uma conta grátis 5.000 créditos grátis. Sem precisar de cartão.
Atualizado em 27 de setembro de 2026
Como funciona a fala para texto?
A fala para texto primeiro transforma o áudio em uma imagem compacta das suas frequências ao longo do tempo, geralmente um espectrograma. Uma rede neural, treinada com grandes quantidades de fala transcrita, associa essas características a sons, pedaços de palavras ou caracteres prováveis. Um modelo de linguagem, integrado à rede ou adicionado depois dela, usa o contexto para escolher as palavras mais prováveis, de modo que o sistema consegue distinguir sessão, seção e cessão. O pós-processamento então acrescenta pontuação, letras maiúsculas e formatação de números, e associa marcações de tempo a palavras ou frases. Para legendas, o texto é dividido em linhas curtas sincronizadas com a fala e exportado em formatos como SRT ou VTT.
Para que serve a fala para texto?
A fala para texto é usada sempre que palavras faladas precisam virar um texto pesquisável e legível. Criadores de vídeo a usam para gerar legendas, que ajudam quem assiste sem som e tornam o conteúdo acessível a pessoas surdas ou com deficiência auditiva. Equipes transcrevem reuniões, entrevistas e aulas para poder pesquisá-las e citá-las. Escritores e profissionais usam o ditado para digitar com a voz. A fala para texto também é a primeira etapa da dublagem com IA, em que a transcrição é traduzida antes de ganhar uma nova voz. Uma transcrição também dá aos mecanismos de busca e aos assistentes de IA um texto que eles podem indexar.
- Legendas para YouTube, TikTok e Instagram
- Transcrições de reuniões, entrevistas e aulas
- Ditado e digitação por voz
- A primeira etapa da dublagem com IA
O que afeta a precisão da fala para texto?
A precisão da fala para texto costuma ser medida pela taxa de erro de palavras (WER), a proporção de palavras erradas, ausentes ou acrescentadas em comparação com uma transcrição correta. Um áudio limpo, de um só locutor perto do microfone, dá os melhores resultados. A precisão cai com ruído de fundo, música, eco, pessoas falando ao mesmo tempo, sotaques que o modelo raramente ouviu e vocabulário especializado, como nomes de marcas, termos médicos ou jargões. Fala rápida e gravações de baixa qualidade também acrescentam erros. Para qualquer coisa que você publique, revise a transcrição e corrija nomes e termos importantes antes de exportar as legendas.
Exemplos de fala para texto
- Um youtuber gera legendas para um tutorial, corrige dois nomes de produtos e exporta um arquivo SRT.
- Um criador do TikTok embute legendas estilizadas em um vídeo curto para quem assiste sem som.
- Um pesquisador transcreve entrevistas gravadas para pesquisá-las e citá-las em um relatório.
- O recurso de ditado do celular digita uma mensagem enquanto você fala.
Perguntas frequentes
Qual é a diferença entre fala para texto e texto para fala?
Elas funcionam em sentidos opostos. A fala para texto (STT) escuta um áudio falado e o escreve, produzindo uma transcrição ou legendas. O texto para fala (TTS) recebe um texto escrito e o lê em voz alta com uma voz sintética. A fala para texto trata de entender a fala, enquanto o texto para fala trata de produzi-la. As duas costumam ser combinadas, por exemplo na dublagem com IA, em que um vídeo é transcrito, traduzido e depois ganha uma nova voz em outro idioma.
Qual é a precisão da fala para texto?
Com fala clara em idiomas bem suportados, a fala para texto moderna é muito precisa, e a maioria dos erros restantes envolve nomes, jargões, números e locutores falando ao mesmo tempo. A precisão cai com ruído de fundo, música, eco, fala rápida e sotaques pouco comuns. Ela é medida pela taxa de erro de palavras (WER): quanto menor, melhor. As legendas de vídeos publicados devem sempre ser revisadas. Na wawie, cada legenda é editável antes da exportação, e você pode testar grátis com 5.000 créditos, sem precisar de cartão.
O que são arquivos de legenda SRT e VTT?
SRT (SubRip) e VTT (WebVTT) são dois dos formatos de arquivo de legenda mais comuns. Os dois são arquivos de texto simples com uma lista de trechos de legenda, cada um com um tempo de início, um tempo de fim e o texto a exibir. O SRT é suportado por quase todas as plataformas e editores de vídeo. O WebVTT é o padrão da web para vídeo em HTML5 e aceita estilos e posicionamento extras. Você envia qualquer um dos dois junto com o vídeo, para que o público possa ativar ou desativar as legendas.
Qual é a diferença entre closed caption e legenda?
Nos Estados Unidos, captions costumam ser um texto no mesmo idioma do áudio, para quem não consegue ouvi-lo, por isso também descrevem sons relevantes, como música ou risadas, e podem identificar quem fala. Subtitles costumam ser apenas a transcrição ou a tradução dos diálogos, para quem consegue ouvir. No Brasil, a palavra legenda costuma cobrir os dois casos, e a closed caption também é chamada de legenda oculta. A legenda oculta pode ser desligada, enquanto as legendas abertas ou embutidas fazem parte da imagem do vídeo e estão sempre visíveis.
Termos relacionados
- Texto para fala (TTS): O texto para fala converte texto escrito em áudio falado com som natural, usado em locuções, narrações, acessibilidade e assistentes de voz.
- Dublagem com IA: A dublagem com IA traduz a fala de um vídeo e gera uma nova voz em outro idioma, sincronizada com o original e, se você quiser, com a voz original.
- Isolamento de voz: O isolamento de voz separa uma voz do ruído de fundo, da música e do eco da sala, deixando uma fala limpa para publicar, transcrever ou dublar.
Criar uma conta grátis 5.000 créditos grátis. Sem precisar de cartão.