Cos'è il TTS neurale? Come funzionano le voci neurali

Rene, Kabir Goel 
Cos'è il TTS neurale? Come funzionano le voci neurali

La sintesi vocale neurale (TTS neurale) è una sintesi vocale in cui una rete neurale, addestrata su ore di persone che parlano, genera l’audio. Prima, i computer incollavano frammenti di parlato registrato o calcolavano una voce a partire da regole scritte a mano. Il TTS neurale impara pronuncia, ritmo e intonazione dai dati, ed è per questo che suona come una persona e non come un navigatore che annuncia “ricalcolo del percorso”.

Se sei arrivato qui perché un menu delle impostazioni o una console cloud ti proponeva una voce “neurale”: sceglila. Suonerà molto più naturale. In una fattura cloud di solito costa circa quattro volte una voce standard; ne parla la sezione sui prezzi più sotto.

Se stai scegliendo un modello vocale per un prodotto, la domanda utile nel 2026 è quale TTS neurale vuoi. Quasi tutte le voci che confronterai sono neurali. Si differenziano per come generano l’audio, per quanto velocemente iniziano a parlare e per come gestiscono il testo che il tuo prodotto invia davvero.

Cosa c’era prima del TTS neurale

Due approcci più vecchi alimentano ancora le voci “standard” della maggior parte delle piattaforme cloud.

La sintesi concatenativa taglia le registrazioni di un parlante reale in piccole unità e le ricuce. La documentazione di Amazon Polly descrive così il suo motore standard: “concatena fonemi di parlato registrato”, e le giunture tra le unità limitano quanto può suonare naturale.

La sintesi parametrica non usa registrazioni in riproduzione. Un modello prevede parametri acustici e un vocoder di elaborazione del segnale li trasforma in suono. La pagina dei tipi di voce di Google Cloud dice che molte delle sue voci standard usano una variante di questo metodo. È flessibile e compatta, ed è all’origine di quel timbro un po’ ronzante e robotico che associamo alla vecchia sintesi vocale.

Come funziona il TTS neurale

Un tipico sistema di TTS neurale ha tre fasi.

  1. Un modulo iniziale normalizza il testo. “Dr. Lee, 221B Baker St., 4,50 $” deve diventare parole che un parlante direbbe, e il modello deve sapere come leggere ogni abbreviazione e ogni numero nel contesto.
  2. Un modello acustico prevede come dovrebbe suonare la voce, di solito come spettrogramma mel, un’immagine di come l’energia si distribuisce tra le frequenze nel tempo. È qui che la rete decide ritmo, accento e intonazione.
  3. Un vocoder neurale trasforma lo spettrogramma in una forma d’onda riproducibile.

Vale la pena conoscere le tappe principali, perché i fornitori danno ancora i loro nomi ai prodotti. WaveNet (2016) di DeepMind generava l’audio un campione alla volta, e gli ascoltatori lo giudicarono più naturale dei migliori sistemi parametrici e concatenativi dell’epoca. Tacotron 2 (2017) di Google abbinava un predittore di spettrogrammi a un vocoder WaveNet e otteneva un punteggio medio di opinione di 4,53, contro 4,58 delle registrazioni professionali. HiFi-GAN (2020) ha reso il vocoding di alta qualità abbastanza veloce da costare poco. Il motore neurale di Amazon segue lo stesso schema in due parti: una rete sequenza-sequenza che produce spettrogrammi, seguita da un vocoder neurale.

La nuova generazione: la voce come token

Dal 2023 circa, molti sistemi hanno abbandonato lo spettrogramma. Un codec audio neurale, come EnCodec di Meta, comprime l’audio in una sequenza di token discreti. Un modello prevede questi token come un modello linguistico prevede parole, e il codec li ritrasforma in suono. VALL-E di Microsoft ne ha mostrato il vantaggio: addestrato su 60.000 ore di inglese, poteva imitare un nuovo parlante da una registrazione di tre secondi.

È questo che i fornitori cloud vendono oggi come voci “generative” o “HD”. Amazon descrive il suo motore generativo come un transformer da un miliardo di parametri che trasforma il testo in codici vocali, seguito da un decoder che li trasmette come audio. Questi modelli leggono meglio una frase con l’intenzione giusta, ridono al momento giusto e suonano come una conversazione. C’è un rovescio. Microsoft dice che le sue voci HD variano leggermente a ogni output, e Amazon avverte che un aggiornamento del modello può cambiare il suono di una voce. Per una stagione di podcast conta. Per rispondere al telefono, quasi mai.

Dove si collocano i modelli a spazio degli stati

Generare voce in tempo reale è un problema di sequenze lunghe: pochi secondi di audio sono migliaia di passi. L’attenzione di un transformer riguarda tutto ciò che è stato generato finora, quindi ogni nuovo passo costa di più man mano che l’audio cresce. Un modello a spazio degli stati porta avanti invece un riassunto di dimensione fissa del passato, quindi ogni passo costa uguale.

I fondatori di Cartesia hanno lavorato su questa idea prima che Cartesia esistesse. Albert Gu e Karan Goel sono coautori di S4, e Gu è coautore di Mamba con Tri Dao. Sonic, il modello di TTS di Cartesia, si basa su questa famiglia di architetture. Trasmette l’audio mentre lo genera con una latenza del modello inferiore a 90 ms, parla 44 lingue, e Sonic 3.6 si è classificato primo in entrambe le classifiche di sintesi vocale di Artificial Analysis al lancio, ad agosto 2026. L’abbiamo costruito per gli agenti vocali, dove chi chiama sente ogni millisecondo di ritardo.

Cosa significa “neurale” in una pagina dei prezzi

I fornitori cloud usano la parola come fascia di prezzo. Ecco cosa indicavano Amazon e Google il 3 ottobre 2026, per milione di caratteri:

FornitoreVoci più vecchieNeuraleFascia più recente
Amazon PollyStandard: 4 $Neural: 16 $Generative: 30 $; Long-Form: 100 $
Google CloudStandard: 4 $Neural2: 16 $Chirp 3: HD: 30 $

Saltano all’occhio due cose. Primo, i nomi non coincidono tra fornitori, quindi confronta per architettura e ascoltando, non per etichetta. Google ora fa pagare le sue voci WaveNet, la svolta neurale del 2016, gli stessi 4 $ delle voci standard. Secondo, la fascia più recente costa circa il doppio di quella neurale. Se ne valga la pena dipende dal tuo testo e dai tuoi ascoltatori, e lo scopri solo provando.

Come capire se una voce neurale è buona

Ogni fornitore ti dirà che le sue voci suonano umane. I test utili sono quelli che somigliano al tuo prodotto:

  • Invia le stringhe che sentiranno i tuoi utenti: numeri d’ordine, indirizzi email, date, prezzi e nomi. I modelli neurali sbagliano su queste in modo diverso rispetto alle frasi normali.
  • Ascolta nel contesto. Una frase che suona bene da sola può avere il tono sbagliato dopo delle scuse.
  • Misura il percorso che vive l’utente. In una conversazione dal vivo è il tempo al primo audio su una connessione in streaming, non quanto ci mette a generarsi un file completo.
  • Prova passaggi lunghi e ogni lingua che pensi di lanciare. Il ritmo deriva e gli accenti scivolano in modi che le demo brevi nascondono.

Il nostro team di ricerca ha scritto un articolo più lungo sul tema, Is this TTS model good?, che spiega perché nessun punteggio singolo chiude la questione.

TTS neurale open source

Puoi eseguire TTS neurale gratis sul tuo hardware. Piper è un motore locale veloce molto usato nella domotica. Kokoro è un modello da 82 milioni di parametri con licenza Apache. Entrambi sono buone scelte per leggere testo ad alta voce su un dispositivo senza connessione di rete. Non sono pensati per lo streaming a bassa latenza ai volumi di un call center, che è il lavoro di Sonic.

Per sentire la differenza, incolla una frase che dice il tuo prodotto nel playground di Cartesia. Il piano gratuito include crediti sufficienti per provarlo con il tuo testo.

Domande frequenti

Cos'è il TTS neurale?

La sintesi vocale neurale (TTS neurale) è una sintesi vocale in cui una rete neurale, addestrata su registrazioni di persone che parlano, genera l'audio. I sistemi precedenti univano frammenti di parlato registrato o usavano un'elaborazione del segnale progettata a mano. Il TTS neurale impara pronuncia, ritmo e intonazione dai dati, ed è per questo che suona molto più simile a una persona.

Che differenza c'è tra voci TTS neurali e standard?

Nei servizi cloud, "standard" indica di solito una vecchia voce concatenativa o parametrica, e "neurale" una voce generata da una rete neurale. La documentazione di Amazon Polly, per esempio, dice che le sue voci standard concatenano fonemi di parlato registrato, mentre il motore neurale prevede spettrogrammi con una rete neurale e li trasforma in audio con un vocoder neurale. Le voci neurali suonano più naturali e costano di più: il 3 ottobre 2026 Polly indicava 4 $ per milione di caratteri per le voci standard e 16 $ per quelle neurali.

Il TTS neurale è la stessa cosa di una voce IA?

In pratica sì. Tutti i generatori di voce IA moderni sono modelli di TTS neurale. I sistemi più recenti, a volte chiamati voci generative, sono comunque reti neurali: prevedono token audio compressi come un modello linguistico prevede parole, invece di prevedere uno spettrogramma.

Il TTS neurale può funzionare in tempo reale?

Sì, se il modello lavora in streaming. Un modello in streaming inizia a inviare audio prima di aver finito di generare la frase, quindi la riproduzione può partire quasi subito. Sonic di Cartesia, per esempio, ha una latenza del modello inferiore a 90 ms e trasmette l'audio mentre lo genera, che è ciò che serve agli agenti vocali al telefono.

Quanto costa il TTS neurale?

Dipende dal fornitore e dal livello. Il 3 ottobre 2026 Amazon Polly indicava 16 $ per milione di caratteri per le voci neurali e 30 $ per quelle generative, e Google Cloud 16 $ per milione di caratteri per Neural2 e 30 $ per Chirp 3 HD. I modelli open source come Piper e Kokoro sono gratuiti sul proprio hardware. I prezzi di Cartesia sono sulla sua pagina dei prezzi, con un piano gratuito per iniziare.