Che cos'è la sintesi vocale (TTS)?
La sintesi vocale (TTS, dall'inglese text to speech) è una tecnologia che converte un testo scritto in audio parlato. La sintesi vocale moderna usa reti neurali addestrate su parlato registrato, così le voci seguono ritmo e intonazione naturali. Alimenta lettori di schermo, assistenti vocali, voci fuori campo e narrazioni. Su wawie puoi trasformare un copione in parlato con oltre 1.000 voci in una trentina di lingue.
Crea un account gratuito 5.000 crediti gratuiti. Nessuna carta richiesta.
Aggiornato il 27 settembre 2026
Come funziona la sintesi vocale?
La sintesi vocale funziona per fasi. Prima la normalizzazione del testo riscrive numeri, date e abbreviazioni in parole, così 10 km diventa dieci chilometri. Poi il sistema converte le parole in fonemi, le unità sonore di una lingua, e prevede la prosodia: dove fare le pause, quali sillabe accentare e come deve salire e scendere l'intonazione. Un modello acustico neurale genera quindi una rappresentazione del suono, spesso uno spettrogramma, e un vocoder la trasforma in una forma d'onda audio. I modelli end-to-end più recenti svolgono diverse di queste fasi in un'unica rete. I sistemi più vecchi univano frammenti di parlato registrato, che potevano suonare disomogenei nei punti di giunzione.
A cosa serve la sintesi vocale?
La sintesi vocale si usa ovunque un contenuto scritto abbia bisogno di una voce senza una sessione di registrazione. Dà alle persone cieche e ipovedenti accesso agli schermi e permette a chi fatica a leggere di ascoltare. I creator la usano per le voci fuori campo dei video, la narrazione dei corsi e i segmenti dei podcast. Le aziende la usano per menu telefonici, demo di prodotto e annunci che cambiano spesso, perché una frase si può modificare e rigenerare in pochi secondi invece di registrarla di nuovo. Gli editori la usano per offrire versioni audio di articoli e libri. Con un'ampia libreria di voci puoi anche provare più voci sullo stesso copione prima di sceglierne una.
- Accessibilità e lettori di schermo
- Voci fuori campo per video e social
- Narrazione per e-learning e formazione
- Audiolibri e articoli audio
- Menu telefonici e annunci
Cosa influisce sulla qualità della sintesi vocale?
La qualità della sintesi vocale dipende dalla voce, dalla lingua e dal testo stesso. Alcune voci suonano naturali in una lingua e piatte in un'altra, quindi ascolta l'anteprima prima di decidere. Nomi, marchi, sigle e parole rare causano gli errori più comuni; un dizionario di pronuncia o una grafia fonetica di solito li risolvono. La punteggiatura controlla il ritmo: virgole e frasi brevi creano pause naturali. I passaggi molto lunghi possono perdere coerenza nel tono, quindi generare paragrafo per paragrafo ti dà più controllo. Infine, controlla la licenza: i diritti commerciali sull'audio generato dipendono dalle condizioni di ogni fornitore, e clonare la voce di una persona reale richiede il suo consenso.
Esempi di sintesi vocale
- Un lettore di schermo legge ad alta voce una pagina web, così un utente cieco può navigarla.
- Uno youtuber incolla un copione, sceglie una voce ed esporta la narrazione in MP3 per il montaggio.
- Un team di e-learning cambia una frase di un corso e rigenera solo quella riga invece di prenotare una nuova sessione di registrazione.
- Un'app di navigazione annuncia ogni svolta nella lingua scelta dal conducente.
Domande frequenti
Che differenza c'è tra sintesi vocale e trascrizione (speech to text)?
Sintesi vocale e trascrizione sono processi opposti. La sintesi vocale (TTS) prende un testo scritto e produce audio parlato, per esempio una voce fuori campo da un copione. La trascrizione (speech to text, STT), detta anche riconoscimento vocale, prende audio parlato e produce testo scritto, per esempio una trascrizione o i sottotitoli di un video. Molti flussi di lavoro usano entrambe: il doppiaggio IA trascrive il parlato con la STT, traduce il testo e poi dà voce alla traduzione con la TTS.
La sintesi vocale può sembrare una persona vera?
Sì. La sintesi vocale neurale moderna può avvicinarsi molto a una voce umana, con pause, respiri e intonazione naturali, soprattutto nei passaggi brevi e di media lunghezza. È più facile accorgersi di una voce sintetica nei contenuti lunghi, emotivi o molto espressivi, dove un interprete umano aggiunge ancora sfumature. La qualità varia anche per voce e per lingua, quindi vale la pena ascoltare diverse voci in anteprima. Riprodurre la voce di una specifica persona reale richiede la clonazione vocale e il consenso esplicito di quella persona.
Posso usare l'audio della sintesi vocale a scopo commerciale?
Dipende dal servizio. Le condizioni di licenza variano da un fornitore all'altro, quindi leggile prima di pubblicare. Su wawie, i contenuti che generi dal tuo testo sono tuoi e puoi usarli nei limiti dei termini dei fornitori dei modelli sottostanti, come ElevenLabs, MiniMax e Fish Audio. Resti responsabile dei diritti sul testo che fornisci, e ti serve il consenso esplicito prima di usare la voce di chiunque altro tramite la clonazione. L'uso commerciale è incluso dal piano Wawie Start a 4,99 € al mese.
Come posso provare gratis la sintesi vocale?
Molti servizi di sintesi vocale offrono un piano gratuito. Su wawie puoi creare un account gratuito con 5.000 crediti una tantum, senza carta. Incolla un copione, scegli tra oltre 1.000 voci in una trentina di lingue, ascoltale in anteprima e scarica il risultato in MP3 o WAV. I crediti si consumano in base all'uso effettivo, per carattere letto o per secondo di audio prodotto. Quando ti serve di più, i piani a pagamento partono da 4,99 € al mese.
Termini correlati
- Voce fuori campo (voice over): La voce fuori campo è una narrazione registrata a parte e riprodotta su video, film, spot o presentazioni, da uno speaker che di solito non si vede.
- Clonazione vocale: La clonazione vocale crea una copia sintetica della voce di una persona specifica a partire da registrazioni, così da generare nuovo parlato con quella voce.
- Trascrizione automatica (STT): La trascrizione automatica converte l'audio parlato in testo scritto e alimenta trascrizioni, sottotitoli automatici, dettatura e assistenti vocali.
Crea un account gratuito 5.000 crediti gratuiti. Nessuna carta richiesta.