Che cos'è la trascrizione automatica (speech to text)?
La trascrizione automatica, o speech to text (STT), detta anche riconoscimento automatico del parlato (ASR), è una tecnologia che converte il linguaggio parlato in testo scritto. Alimenta trascrizioni, sottotitoli automatici, dettatura e assistenti vocali. La precisione dipende soprattutto dalla qualità dell'audio, dagli accenti e dal lessico. Su wawie, lo speech to text genera sottotitoli automatici che puoi modificare, tradurre ed esportare per YouTube, TikTok o Instagram.
Crea un account gratuito 5.000 crediti gratuiti. Nessuna carta richiesta.
Aggiornato il 27 settembre 2026
Come funziona la trascrizione automatica?
La trascrizione automatica trasforma prima l'audio in un'immagine compatta delle sue frequenze nel tempo, di solito uno spettrogramma. Una rete neurale, addestrata su grandi quantità di parlato trascritto, associa queste caratteristiche a suoni, frammenti di parola o caratteri probabili. Un modello linguistico, integrato nella rete o aggiunto dopo, usa il contesto per scegliere le parole più probabili, così il sistema sa distinguere parole che suonano uguali, come anno e hanno. La post-elaborazione aggiunge poi punteggiatura, maiuscole e formattazione dei numeri, e associa marche temporali a parole o frasi. Per i sottotitoli, il testo viene diviso in brevi righe sincronizzate con il parlato ed esportato in formati come SRT o VTT.
A cosa serve la trascrizione automatica?
La trascrizione automatica si usa ogni volta che le parole pronunciate devono diventare testo leggibile e ricercabile. Chi crea video la usa per generare sottotitoli, che aiutano chi guarda senza audio e rendono i contenuti accessibili alle persone sorde o con problemi di udito. I team trascrivono riunioni, interviste e lezioni per poterle cercare e citare. Scrittori e professionisti usano la dettatura per scrivere con la voce. La trascrizione automatica è anche il primo passaggio del doppiaggio IA, in cui la trascrizione viene tradotta prima di ricevere una nuova voce. Una trascrizione dà inoltre ai motori di ricerca e agli assistenti IA un testo da indicizzare.
- Sottotitoli per YouTube, TikTok e Instagram
- Trascrizioni di riunioni, interviste e lezioni
- Dettatura e scrittura vocale
- Il primo passaggio del doppiaggio IA
Cosa influisce sulla precisione della trascrizione automatica?
La precisione della trascrizione automatica si misura di solito con il word error rate (WER), la percentuale di parole sbagliate, mancanti o aggiunte rispetto a una trascrizione corretta. Un audio pulito di una sola persona vicina al microfono dà i risultati migliori. La precisione cala con rumore di fondo, musica, eco, persone che si parlano sopra, accenti che il modello ha sentito di rado e lessico specialistico come nomi di marchi, termini medici o gergo. Anche il parlato veloce e le registrazioni di bassa qualità aggiungono errori. Per tutto ciò che pubblichi, rivedi la trascrizione e correggi nomi e termini chiave prima di esportare i sottotitoli.
Esempi di trascrizione automatica
- Uno youtuber genera i sottotitoli di un tutorial, corregge due nomi di prodotto ed esporta un file SRT.
- Una creator di TikTok incorpora sottotitoli con stile in un video breve per chi guarda senza audio.
- Un ricercatore trascrive interviste registrate per cercarle e citarle in un rapporto.
- La funzione di dettatura di uno smartphone scrive un messaggio mentre parli.
Domande frequenti
Che differenza c'è tra speech to text e sintesi vocale?
Funzionano in direzioni opposte. Lo speech to text (STT) ascolta l'audio parlato e lo trascrive, producendo una trascrizione o dei sottotitoli. La sintesi vocale (TTS) prende un testo scritto e lo legge ad alta voce con una voce sintetica. Lo speech to text serve a comprendere il parlato, la sintesi vocale a produrlo. Le due tecnologie vengono spesso combinate, per esempio nel doppiaggio IA, dove un video viene trascritto, tradotto e poi ridoppiato in un'altra lingua.
Quanto è precisa la trascrizione automatica?
Sul parlato chiaro nelle lingue più supportate, la trascrizione automatica moderna è molto precisa, e la maggior parte degli errori residui riguarda nomi, gergo, numeri e voci sovrapposte. La precisione cala con rumore di fondo, musica, eco, parlato veloce e accenti poco familiari. Si misura con il word error rate (WER): più è basso, meglio è. I sottotitoli dei video pubblicati vanno sempre rivisti. Su wawie ogni sottotitolo è modificabile prima dell'esportazione, e puoi provarlo gratis con 5.000 crediti, senza carta.
Cosa sono i file di sottotitoli SRT e VTT?
SRT (SubRip) e VTT (WebVTT) sono due dei formati di file di sottotitoli più diffusi. Entrambi sono file di testo semplice che contengono un elenco di sottotitoli, ciascuno con un tempo di inizio, un tempo di fine e il testo da mostrare. SRT è supportato da quasi tutte le piattaforme e gli editor video. WebVTT è lo standard web per i video HTML5 e supporta stili e posizionamenti aggiuntivi. Carichi uno dei due file insieme al video, così gli spettatori possono attivare o disattivare i sottotitoli.
Che differenza c'è tra sottotitoli per non udenti e sottotitoli normali?
In inglese si distingue tra captions, cioè testo nella stessa lingua per chi non può sentire l'audio, che descrive anche suoni rilevanti come musica o risate e può indicare chi parla, e subtitles, cioè la sola trascrizione o traduzione dei dialoghi per chi sente. In italiano si parla in genere di sottotitoli in entrambi i casi, e di sottotitoli per non udenti per il primo tipo. I sottotitoli chiusi si possono disattivare, mentre quelli aperti o incorporati fanno parte dell'immagine del video e sono sempre visibili.
Termini correlati
- Sintesi vocale (TTS): La sintesi vocale converte un testo scritto in audio parlato dal suono naturale, usato per voci fuori campo, narrazioni, accessibilità e assistenti vocali.
- Doppiaggio IA: Il doppiaggio IA traduce il parlato di un video e lo ridoppia in un'altra lingua, rispettando i tempi originali e, se vuoi, con la voce originale.
- Isolamento della voce: L'isolamento della voce separa una voce da rumore di fondo, musica ed eco dell'ambiente, lasciando un parlato pulito da pubblicare, trascrivere o doppiare.
Crea un account gratuito 5.000 crediti gratuiti. Nessuna carta richiesta.