Un modello di sintesi vocale, TTS, genera parlato. Ma il modello e la voce con cui parla non sono la stessa cosa.
Se conosci gli LLM, una voce è vagamente paragonabile a un prompt di sistema: il modello fornisce la capacità generale e l’input orienta ciò che genera.
Nel TTS la voce è spesso un input separato dal modello e ne determina la risposta. Questa risposta, l’audio, è molto più complessa del “semplice” testo. I modelli che generano parlato devono sapere cosa dire, come dirlo, a quale ritmo e volume, con quale intonazione, prosodia ed enfasi: tutte le numerose caratteristiche e metriche di una “buona voce”. Sono istruzioni che normalmente vorresti dare al modello, ma la maggior parte dei modelli TTS permette di specificare solo uno o due input: il testo e una voce selezionata.
Gli input di un modello vocale
Un modello a parlante fisso riceve un solo input: il testo. È addestrato a parlare con un’unica voce, codificata nei pesi appresi dal modello. Non riceve una voce come input.
Quindi, per qualsiasi testo fornito, restituisce audio che sembra pronunciato sempre dallo stesso parlante.
Modello a parlante fisso + testo = parlato con una sola voce
Quando l’unica voce che senti è quella inclusa nel modello, modello e voce sembrano la stessa cosa: non puoi separarli chiaramente nell’uso normale. Per produrre un altro parlante occorre adattare o riaddestrare il modello.
Un modello a più parlanti, invece, accetta la scelta della voce come ulteriore input. Fornisci il testo e selezioni una voce da un elenco fisso supportato dal modello.
Modello a più parlanti + testo + parlante selezionato = parlato con quella voce
Il modello di sintesi vocale rimane uguale, mentre la voce selezionata cambia le caratteristiche del parlato che produce.
Mantieni lo stesso testo ma cambia voce: il parlato sembrerà provenire da un’altra persona. Le registrazioni e la trascrizione seguente mantengono la lingua originale.
Same words, different voice, same model.
Voce A
Voce B
La clonazione zero-shot accetta un nuovo parlante
Un modello di clonazione vocale zero-shot può condizionare la sintesi perché suoni come un parlante non presente nel catalogo predefinito. Accetta un testo e una clip audio di riferimento come “prompt”.
Modello di clonazione + testo + clip audio del parlante = voce clonata
Poiché l’audio contiene più informazioni del testo, la clip usata come prompt offre il controllo più preciso sulla voce sintetizzata. È questo che lo rende “zero-shot”: il sistema può gestire un parlante su cui non è mai stato addestrato o adattato tramite fine-tuning.
Durante la generazione vocale generalizza dalla clip audio di riferimento.
È così che funziona Instant Voice Cloning, IVC, di Cartesia.
Fornisci una breve registrazione della tua voce come prompt: bastano da 10 a 60 secondi di audio per condizionare il modello. Sonic di Cartesia, un modello TTS end-to-end che gestisce anche la clonazione, estrae dalla registrazione le caratteristiche della voce e le usa per guidare il modello TTS a generare parlato che ti somigli.
La clonazione vocale professionale, PVC, usa un dataset di registrazioni più ampio per eseguire il fine-tuning. Non si limita a condizionare il modello durante l’esecuzione con un campione vocale: aggiorna e adatta effettivamente il modello ai campioni. A differenza di IVC, richiede più tempo, fino a un paio d’ore. Abbiamo osservato che i PVC di Cartesia possono copiare anche elementi indesiderati dell’audio: plosive sul microfono, artefatti dell’apparecchiatura, rumore di fondo e così via. In molti casi d’uso questo è proprio ciò che si preferisce.
Una registrazione contiene più dell’identità
I clienti chiedono voci “più ruvide”, “più calde” o “più sicure”. Una clip di riferimento contiene anche ritmo, pause, rumore della stanza, suoni della bocca e dettagli di quella specifica interpretazione. Il sistema deve distinguere i tratti del parlante da quelli della registrazione.
Pause lunghe possono influenzare il ritmo generato. Il rumore di fondo può essere ridotto, ignorato o riprodotto. Due modelli possono reagire diversamente allo stesso materiale di partenza.
Le indicazioni per la clonazione vocale di Cartesia consigliano audio pulito, pause brevi e un’interpretazione coerente con il caso d’uso previsto.
Una voce concentrata e misurata è utile nell’assistenza clienti, ma può sembrare sbrigativa o poco empatica in una contestazione di fatturazione. Una voce vivace può dare energia alla presentazione di un prodotto o a un assistente di onboarding. Queste voci hanno caratteristiche del parlato diverse, pur essendo generate da un solo modello.
“Come scegliere una voce?” e “Questo modello TTS è buono?” sono domande diverse. Confonderle significa cercare il problema nel posto sbagliato quando il tuo agente vocale suona strano.
