Qu'est-ce que le TTS neuronal ? Le fonctionnement

Rene, Kabir Goel 
Qu'est-ce que le TTS neuronal ? Le fonctionnement

La synthèse vocale neuronale (TTS neuronal) est une synthèse vocale dans laquelle un réseau de neurones, entraîné sur des heures de personnes qui parlent, génère l’audio. Avant, les ordinateurs recollaient des bouts de parole enregistrée ou calculaient une voix à partir de règles écrites à la main. Le TTS neuronal apprend la prononciation, le rythme et l’intonation à partir de données, et c’est pour cela qu’il sonne comme une personne et non comme un GPS qui annonce « recalcul de l’itinéraire ».

Si vous arrivez ici parce qu’un menu de réglages ou une console cloud vous proposait une voix « neuronale » : choisissez-la. Elle sonnera nettement plus naturel. Sur une facture cloud, elle coûte en général environ quatre fois plus qu’une voix standard ; la section sur les tarifs en parle plus bas.

Si vous choisissez un modèle vocal pour un produit, la question utile en 2026 est de savoir quel TTS neuronal vous voulez. Presque toutes les voix que vous comparerez sont neuronales. Elles diffèrent par leur façon de générer l’audio, la vitesse à laquelle elles commencent à parler et la manière dont elles gèrent le texte que votre produit envoie réellement.

Ce qui existait avant le TTS neuronal

Deux approches plus anciennes alimentent encore les voix « standard » de la plupart des plateformes cloud.

La synthèse concaténative découpe des enregistrements d’un vrai locuteur en petites unités et les réassemble. La documentation d’Amazon Polly décrit ainsi son moteur standard : il « concatène des phonèmes de parole enregistrée », et les raccords entre unités limitent son naturel.

La synthèse paramétrique se passe d’enregistrements à la lecture. Un modèle prédit des paramètres acoustiques et un vocodeur de traitement du signal les transforme en son. La page des types de voix de Google Cloud indique que beaucoup de ses voix standard utilisent une variante de cette méthode. Elle est souple et compacte, et c’est d’elle que vient ce timbre un peu bourdonnant et robotique qu’on associe à l’ancienne synthèse vocale.

Comment fonctionne le TTS neuronal

Un système de TTS neuronal classique comporte trois étapes.

  1. Un module d’entrée normalise le texte. « Dr Lee, 221B Baker St., 4,50 $ » doit devenir des mots qu’un locuteur prononcerait, et le modèle doit savoir comment lire chaque abréviation et chaque nombre selon le contexte.
  2. Un modèle acoustique prédit le son de la parole, généralement sous forme de spectrogramme mel, une image de la répartition de l’énergie entre les fréquences au fil du temps. C’est là que le réseau décide du rythme, de l’accentuation et de la hauteur.
  3. Un vocodeur neuronal transforme ce spectrogramme en une forme d’onde que l’on peut écouter.

Les grandes étapes valent la peine d’être connues, car les fournisseurs nomment encore leurs produits d’après elles. WaveNet (2016), de DeepMind, générait l’audio échantillon par échantillon, et les auditeurs le jugeaient plus naturel que les meilleurs systèmes paramétriques et concaténatifs de l’époque. Tacotron 2 (2017), de Google, associait un prédicteur de spectrogrammes à un vocodeur WaveNet et obtenait une note moyenne d’opinion de 4,53, contre 4,58 pour des enregistrements professionnels. HiFi-GAN (2020) a rendu le vocodage de haute qualité assez rapide pour être bon marché. Le moteur neuronal d’Amazon suit la même architecture en deux parties : un réseau séquence à séquence qui produit des spectrogrammes, suivi d’un vocodeur neuronal.

La nouvelle génération : la parole en tokens

Depuis 2023 environ, beaucoup de systèmes ont abandonné le spectrogramme. Un codec audio neuronal, comme EnCodec de Meta, compresse l’audio en une suite de tokens discrets. Un modèle prédit ensuite ces tokens comme un modèle de langage prédit des mots, et le codec les retransforme en son. VALL-E, de Microsoft, en a montré l’intérêt : entraîné sur 60 000 heures d’anglais, il pouvait imiter un nouveau locuteur à partir d’un enregistrement de trois secondes.

C’est ce que les fournisseurs cloud vendent aujourd’hui sous le nom de voix « génératives » ou « HD ». Amazon décrit son moteur génératif comme un transformer d’un milliard de paramètres qui convertit le texte en codes vocaux, suivi d’un décodeur qui les diffuse en audio. Ces modèles lisent mieux une phrase avec la bonne intention, rient au bon moment et sonnent comme une conversation. Il y a une contrepartie. Microsoft indique que ses voix HD varient légèrement à chaque sortie, et Amazon prévient qu’une mise à jour du modèle peut changer le son d’une voix. Pour une saison de podcast, c’est important. Pour répondre au téléphone, rarement.

La place des modèles à espace d’états

Générer de la parole en temps réel est un problème de longues séquences : quelques secondes d’audio représentent des milliers d’étapes. L’attention d’un transformer revoit tout ce qui a été généré, donc chaque nouvelle étape coûte plus cher à mesure que l’audio s’allonge. Un modèle à espace d’états transporte plutôt un résumé de taille fixe du passé, donc chaque étape coûte la même chose.

Les fondateurs de Cartesia ont travaillé sur cette idée avant que Cartesia n’existe. Albert Gu et Karan Goel sont coauteurs de S4, et Gu est coauteur de Mamba avec Tri Dao. Sonic, le modèle de TTS de Cartesia, repose sur cette famille d’architectures. Il diffuse l’audio pendant qu’il le génère, avec une latence de modèle inférieure à 90 ms, parle 44 langues, et Sonic 3.6 s’est classé premier des deux classements de synthèse vocale d’Artificial Analysis à son lancement en août 2026. Nous l’avons conçu pour les agents vocaux, où l’appelant entend chaque milliseconde de délai.

Ce que « neuronal » veut dire sur une page de tarifs

Les fournisseurs cloud utilisent le mot comme niveau de prix. Voici ce qu’affichaient Amazon et Google le 3 octobre 2026, par million de caractères :

FournisseurAnciennes voixNeuronalNiveau le plus récent
Amazon PollyStandard : 4 $Neural : 16 $Generative : 30 $ ; Long-Form : 100 $
Google CloudStandard : 4 $Neural2 : 16 $Chirp 3: HD : 30 $

Deux choses ressortent. D’abord, les noms ne correspondent pas d’un fournisseur à l’autre : comparez donc par architecture et à l’écoute, pas par étiquette. Google facture désormais ses voix WaveNet, la percée neuronale de 2016, au même prix de 4 $ que ses voix standard. Ensuite, le niveau le plus récent coûte environ deux fois le niveau neuronal. Qu’il en vaille la peine dépend de votre texte et de vos auditeurs, et seul un test vous le dira.

Comment savoir si une voix neuronale est bonne

Tous les fournisseurs vous diront que leurs voix sonnent humain. Les tests utiles sont ceux qui ressemblent à votre produit :

  • Envoyez les chaînes que vos utilisateurs entendront : numéros de commande, adresses e-mail, dates, prix et noms. Les modèles neuronaux échouent sur ces chaînes autrement que sur des phrases ordinaires.
  • Écoutez en contexte. Une phrase qui sonne bien seule peut avoir le mauvais ton après des excuses.
  • Mesurez le chemin que vit votre utilisateur. Pour une conversation en direct, c’est le délai jusqu’au premier son sur une connexion en streaming, pas le temps de rendu d’un fichier complet.
  • Essayez de longs passages et chaque langue que vous comptez lancer. Le rythme dérive et des accents apparaissent d’une manière que les démos courtes cachent.

Notre équipe de recherche a écrit un article plus long sur le sujet, Is this TTS model good?, qui explique pourquoi aucun score unique ne tranche la question.

TTS neuronal open source

Vous pouvez faire tourner du TTS neuronal gratuitement sur votre propre matériel. Piper est un moteur local rapide très utilisé en domotique. Kokoro est un modèle de 82 millions de paramètres sous licence Apache. Tous deux conviennent bien pour lire du texte à voix haute sur un appareil sans connexion réseau. Ils ne sont pas conçus pour le streaming à faible latence au volume d’un centre d’appels, qui est le travail de Sonic.

Pour entendre la différence, collez une phrase que dit votre produit dans le playground Cartesia. Le forfait gratuit inclut assez de crédits pour l’essayer sur votre propre texte.

FAQ

Qu'est-ce que le TTS neuronal ?

La synthèse vocale neuronale (TTS neuronal) est une synthèse vocale dans laquelle un réseau de neurones, entraîné sur des enregistrements de personnes qui parlent, génère l'audio. Les anciens systèmes assemblaient des fragments de parole enregistrée ou utilisaient un traitement du signal conçu à la main. Le TTS neuronal apprend la prononciation, le rythme et l'intonation à partir de données, d'où un rendu beaucoup plus proche d'une vraie voix.

Quelle différence entre les voix TTS neuronales et standard ?

Chez les fournisseurs cloud, « standard » désigne généralement une ancienne voix concaténative ou paramétrique, et « neuronal » une voix générée par un réseau de neurones. La documentation d'Amazon Polly, par exemple, indique que ses voix standard concatènent des phonèmes de parole enregistrée, tandis que son moteur neuronal prédit des spectrogrammes avec un réseau de neurones puis les transforme en audio avec un vocodeur neuronal. Les voix neuronales sonnent plus naturel et coûtent plus cher : le 3 octobre 2026, Polly affichait 4 $ par million de caractères pour les voix standard et 16 $ pour les voix neuronales.

Le TTS neuronal, c'est la même chose qu'une voix IA ?

En pratique, oui. Tous les générateurs de voix IA modernes sont des modèles de TTS neuronal. Les systèmes les plus récents, parfois appelés voix génératives, restent des réseaux de neurones : ils prédisent simplement des tokens audio compressés, comme un modèle de langage prédit des mots, au lieu de prédire un spectrogramme.

Le TTS neuronal peut-il fonctionner en temps réel ?

Oui, si le modèle fonctionne en streaming. Un modèle en streaming commence à envoyer l'audio avant d'avoir fini de générer la phrase, donc la lecture peut démarrer presque immédiatement. Sonic de Cartesia, par exemple, a une latence de modèle inférieure à 90 ms et diffuse l'audio pendant qu'il le génère, ce dont les agents vocaux téléphoniques ont besoin.

Combien coûte le TTS neuronal ?

Cela dépend du fournisseur et du niveau. Le 3 octobre 2026, Amazon Polly affichait 16 $ par million de caractères pour les voix neuronales et 30 $ pour les voix génératives, et Google Cloud 16 $ par million de caractères pour Neural2 et 30 $ pour Chirp 3 HD. Les modèles open source comme Piper et Kokoro sont gratuits sur votre propre matériel. Les tarifs de Cartesia figurent sur sa page de tarifs, avec un forfait gratuit pour commencer.