Un modèle de synthèse vocale, ou TTS, génère de la parole. Mais le modèle et la voix avec laquelle il parle sont deux choses différentes.
Si vous connaissez les LLM, une voix ressemble, par analogie, à un prompt système : le modèle fournit la capacité générale et l’entrée façonne ce qu’il génère.
En synthèse vocale, la voix est souvent une entrée distincte du modèle et elle façonne sa réponse. Cette réponse, l’audio, est bien plus complexe que du texte seul. Un modèle vocal doit savoir quoi dire, comment le dire, à quel rythme, à quel volume, avec quelles intonations, prosodie et accentuations. Il doit gérer les nombreuses caractéristiques et mesures d’une “bonne voix”. Ce sont des instructions que vous voudriez normalement lui donner, mais la plupart des modèles TTS ne permettent de spécifier qu’une ou deux entrées : le texte et une voix choisie.
Les entrées d’un modèle vocal
Un modèle à locuteur fixe prend une seule entrée, le texte. Il est entraîné à parler avec une seule voix, encodée dans ses poids appris. Il ne reçoit pas de voix en entrée.
Quel que soit le texte fourni, il renvoie donc un audio qui ressemble toujours au même locuteur.
Modèle à locuteur fixe + texte = parole avec une seule voix
Quand la seule voix entendue est celle fournie avec le modèle, voix et modèle semblent se confondre. On ne peut pas les séparer clairement dans l’usage normal. Produire un autre locuteur nécessite d’adapter ou de réentraîner le modèle.
Un modèle multilocuteur accepte en revanche une sélection de voix comme entrée supplémentaire. Vous fournissez le texte et choisissez une voix dans la liste fixe prise en charge par le modèle.
Modèle multilocuteur + texte + locuteur choisi = parole avec cette voix
Le modèle de synthèse vocale reste le même, tandis que la voix choisie change les caractéristiques de la parole produite.
Gardez le même texte, mais changez de voix : la parole ressemble alors à celle d’un autre locuteur. Les exemples suivants conservent leur enregistrement et leur transcription en langue originale.
Same words, different voice, same model.
Voix A
Voix B
Le clonage sans entraînement spécifique accepte un nouveau locuteur
Un modèle de clonage vocal zero-shot peut conditionner la synthèse pour imiter un locuteur absent de son catalogue prédéfini. Il accepte un texte et un clip audio du locuteur de référence comme “prompt”.
Modèle de clonage + texte + clip du locuteur = voix clonée
Comme l’audio contient plus d’information que le texte, ce clip permet un contrôle particulièrement fin de la voix synthétisée. C’est ce qui rend le clonage “zero-shot” : le système traite un locuteur sur lequel il n’a jamais été entraîné ni ajusté.
Pendant la génération, il généralise à partir du clip audio de référence.
C’est ainsi que fonctionne le clonage vocal instantané, ou IVC, de Cartesia.
Vous fournissez un court clip de votre voix comme “prompt”. Dix à 60 secondes suffisent pour conditionner le modèle. Sonic de Cartesia, un modèle TTS de bout en bout qui gère aussi le clonage, extrait les caractéristiques de votre voix et les utilise pour orienter la génération vers une parole qui vous ressemble.
Le clonage vocal professionnel, ou PVC, utilise davantage d’enregistrements pour ajuster un modèle. Il ne se contente pas de conditionner le modèle à l’exécution avec un échantillon vocal : il met à jour et adapte le modèle aux échantillons fournis. Contrairement à l’IVC, il prend plus de temps, jusqu’à quelques heures. Nous avons observé que les PVC de Cartesia sont si fidèles qu’ils peuvent reproduire des éléments indésirables : plosives du micro, artefacts du matériel d’enregistrement, bruit de fond, etc. C’est même préférable dans de nombreux usages.
Un enregistrement contient plus qu’une identité
Les clients demandent des voix “plus rauques”, “plus chaleureuses” ou “plus assurées”. Un clip de référence contient aussi un rythme, des pauses, le bruit de la pièce, des bruits de bouche et des détails propres à cette interprétation. Le système doit distinguer les traits du locuteur de ceux de l’enregistrement.
De longues pauses peuvent influencer le rythme généré. Le bruit de fond peut être réduit, ignoré ou reproduit. Deux modèles peuvent réagir différemment au même matériau source.
Les conseils de clonage vocal de Cartesia recommandent un audio propre, des pauses courtes et une interprétation source adaptée à l’usage visé.
Une voix concentrée et mesurée convient au support client, mais peut paraître distante ou peu empathique lors d’un litige de facturation. Une voix enjouée peut dynamiser une démonstration produit ou un assistant d’accueil. Ces voix présentent des caractéristiques de parole différentes tout en étant générées par le même modèle.
“Comment choisir une voix ?” et “Ce modèle TTS est-il bon ?” sont deux questions distinctes. Les confondre conduit à chercher le problème au mauvais endroit lorsque votre agent vocal sonne mal.
