Les concepts d’IA vocale à connaître
Quand votre agent vocal interrompt l’utilisateur au mauvais moment, est-ce un problème de transcription audio (STT) ? De détection d’activité vocale (VAD) ? Ou votre modèle de synthèse vocale n’a-t-il pas été arrêté en cours de génération ?
Ce sont trois problèmes différents, qui demandent chacun une correction différente. Ils se situent même dans des parties distinctes de votre chaîne de traitement.
C’est pourquoi créer des agents IA réellement conversationnels est bien plus difficile que choisir un modèle STT ou TTS.
Chez Cartesia, nous créons une IA qui permet aux humains de s’exprimer et d’être compris.
La compréhension commence par un vocabulaire commun.
Cet article vous donne les mots nécessaires pour comprendre, explorer et analyser les agents IA conversationnels. Il vous aidera aussi à interpréter les résultats de benchmarks qui semblent sortir tous les quelques jours !
J’ai regroupé les termes par section pour faciliter leur mise en contexte. Comme on le dit souvent, le contexte fait tout, surtout en IA !
La chaîne vocale de base
-
STT, transcription audio. Le Speech-to-Text convertit une entrée vocale en texte. En pratique, STT et ASR, reconnaissance vocale automatique, sont souvent employés de façon interchangeable.
Chaque fois que vous dictez un message à votre téléphone, vous utilisez le STT ou l’ASR.
Pour l’IA vocale conversationnelle, c’est-à-dire une conversation naturelle à double sens entre un humain et une IA, c’est le seul canal par lequel l’humain communique avec le système. Mais ce n’est qu’une partie de celui-ci.
Vous pouvez essayer gratuitement les modèles STT de Cartesia, appelés Ink, ici. Mettez-les à l’épreuve avec des numéros de téléphone, des dates ou des adresses e-mail épelées !
-
VAD, détection d’activité vocale. Les modèles VAD sont des classificateurs spécialisés, distincts du modèle de transcription STT. Ils distinguent :
-
le silence du son dans un signal d’entrée ;
-
la parole des sons de fond.
Ils filtrent le signal audio qui entre dans le système pour isoler la parole, puis la transmettent au modèle ASR pour transcription.
Le dernier modèle STT Ink-2 de Cartesia gère lui-même la détection des tours de parole. Cela simplifie la chaîne de l’agent, car il n’est plus nécessaire d’évaluer, d’intégrer et de maintenir un modèle VAD séparé simplement pour détecter quand l’utilisateur parle.
-
-
Détection des tours de parole. Elle est souvent appelée « endpointing » en anglais, un terme qui peut malheureusement être confondu avec les points de terminaison API. Nous parlerons donc ici de détection des tours de parole.
C’est la capacité du système à déterminer précisément si l’appelant a commencé, terminé ou repris son tour. La tâche est plus difficile qu’elle n’en a l’air : une personne peut faire une pause, réfléchir, être momentanément distraite ou prendre une longue inspiration.
Cette détection est essentielle à l’expérience utilisateur. Un modèle trop pressé de conclure que l’humain a terminé provoque des interruptions agaçantes. À l’inverse, une détection tardive et imprécise ajoute de précieuses millisecondes de latence, créant une conversation peu naturelle et pleine de silences gênants.
On comprend qu’une VAD peu fiable, combinée à une détection trop impatiente de fin de tour, puisse donner l’impression de parler à une IA qui interrompt sans laisser placer un mot !
Une mauvaise détection détruit donc la fluidité des conversations. Elle peut aussi provoquer des erreurs de transcription qui s’accumulent et dégradent les actions en aval de la chaîne vocale.
Historiquement, les modèles VAD et les systèmes de détection utilisaient des indices indirects, comme la durée d’une pause, pour déterminer si l’utilisateur avait terminé. Des modèles avancés plus récents, comme Ink-2 de Cartesia, intègrent directement cette détection.
-
TTS, synthèse vocale. Le Text-to-Speech réalise l’opération inverse du STT : il convertit du texte en parole synthétique. Il comporte souvent davantage d’aspects subjectifs que le STT, comme nous le verrons plus loin.
La synthèse vocale existe depuis des décennies. Ses voix étaient autrefois robotiques, mais les bons modèles actuels paraissent très naturels. Vous pouvez essayer gratuitement nos modèles TTS avancés, appelés Sonic, ici !
Les fonctions de l’IA vocale conversationnelle
-
Barge-in, gestion des interruptions. Cette capacité est essentielle à l’IA vocale conversationnelle.
Une IA conversationnelle destinée aux entreprises ne se résume pas à relier un modèle STT et un modèle TTS à un chatbot. Les agents doivent gérer des conversations humaines désordonnées, avec beaucoup d’imprévisibilité et de variations d’environnement, de région et de qualité.
Le barge-in permet à l’utilisateur d’interrompre l’IA et de la faire cesser de parler. Le modèle TTS doit donc savoir que l’utilisateur a commencé ou repris la parole. Cet événement doit être détecté et traité en amont par le modèle STT ou VAD.
La gestion des interruptions demande davantage que la détection des tours. Elle exige une conception attentive des modèles et de l’environnement qui les orchestre.
Le détecteur du modèle STT émet un événement indiquant que l’utilisateur commence ou reprend la parole. La couche d’orchestration doit immédiatement couper le flux TTS. Ce n’est pas trivial, mais des modèles et une orchestration bien conçus le permettent.
Chez Cartesia, nous utilisons une architecture événementielle pour orchestrer les agents vocaux, afin que le système puisse observer chaque événement et y répondre correctement.
-
Isolation de la voix et réduction du bruit. Certains modèles réduisent le bruit ambiant ou isolent la conversation active des conversations en arrière-plan. C’est important pour les agents utilisés dans des bureaux, cafés, aéroports, centres d’appels, hôpitaux et autres lieux fréquentés. Le problème est difficile et les modèles ne le résolvent pas tous aussi bien. Cet aspect a reçu une attention particulière pour le modèle ASR Ink-2 de Cartesia, car les usages professionnels ont souvent lieu dans des environnements bruyants, loin des conditions d’un studio.
Les caractéristiques d’une voix
Les caractéristiques vocales comptent, mais leur appréciation peut être très subjective. Si votre meilleur ami et vous n’êtes pas d’accord sur le charme de la voix d’un acteur, c’est justement à cause de cette subjectivité.
Voici quelques exemples de voix plus ou moins réussies selon leur ton, l’émotion ressentie et d’autres attributs. Les enregistrements conservent leur langue d’origine.
Bonne prosodie
Prosodie monotone
Expression émotionnelle naturelle
Expression émotionnelle exagérée
Les caractéristiques indésirables sont souvent plus faciles à identifier que les qualités recherchées. En prêtant attention à ces attributs, nous percevons leurs excès ou leurs insuffisances. Cela aide à déterminer si une voix convient à son usage.
-
Prosodie. Elle recouvre la hauteur de la voix, ou intonation, son volume, sa durée et son rythme : la manière de parler. C’est un ensemble d’attributs et de caractéristiques techniques utilisés pour analyser une voix.
Le volume et le rythme sont assez intuitifs, mais l’intonation mérite une précision.
Elle désigne les montées et les descentes de la voix. Elle indique souvent si l’on pose une question ou énonce un fait, si l’on poursuit ou termine une idée, si l’on insiste ou reste neutre. Une hauteur qui monte en fin de phrase signale généralement une question.
La prosodie enrichit le sens et l’effet des mots. Imaginez les réactions différentes que provoqueraient « C’est Johnny qui a mordu le chien ? » et « Johnny a mordu le chien ! » lors d’une enquête à l’école.
-
Expression émotionnelle. Elle est liée à la prosodie car elle en est un effet. La prosodie transmet des émotions et du sens. Les humains savent très bien détecter et classer les émotions dans la voix. Dans un système d’IA vocale, l’expressivité doit être cohérente avec l’usage prévu.
-
Timbre. C’est la qualité sonore d’une voix, que l’on décrit souvent par des adjectifs. Une voix de radio peut être chaleureuse et riche, ou sombre et veloutée. Certains chanteurs ont une voix nasale, d’autres rauque. Le timbre peut donner à une voix une identité, une résonance émotionnelle, de la gravité, de la confiance et d’autres qualités.
-
Vitesse et rythme. Il ne s’agit pas seulement du nombre de mots qu’Eminem peut rapper par minute. La vitesse a un second aspect essentiel, le rythme : la cadence globale, ainsi que la place et la durée des pauses. Un bon rythme rend l’audio facile à suivre, avec des pauses qui s’accordent naturellement à la ponctuation.
-
Voix craquée, ou vocal fry. Cette vibration grave et grinçante apparaît lorsque l’air passe lentement par impulsions à travers les cordes vocales. Elle contribue au réalisme, car les humains produisent naturellement ce son en fin de phrase.
Elle crée cependant un équilibre technique délicat pour l’IA. Les modèles ASR peuvent parfois l’interpréter comme du bruit de fond ou du silence. À l’inverse, un excès de voix craquée dans l’entraînement TTS agit comme du bruit et produit des modèles avec des artefacts.
L’objectif est un équilibre naturel : assez pour éviter une voix robotique, sans brouiller la parole ni nuire à son intelligibilité.
-
Localisation, dialectes et prononciation. Une synthèse vocale efficace doit produire une voix qui paraît locale pour inspirer confiance. Cela va au-delà d’un accent général et repose sur la normalisation, c’est-à-dire la capacité de l’IA à interpréter les abréviations, dates et devises selon la région. Elle doit par exemple savoir si « 12/01 » signifie le 12 janvier ou le 1er décembre, ou si « Sr. » signifie « Senior » ou « Señor ».
La normalisation constitue la couche sémantique. Il existe aussi une couche phonétique : accent, prononciation et clarté. Un modèle peut normaliser correctement et néanmoins sonner faux pour une personne à Mumbai ou à Dublin. Des noms propres, marques ou termes techniques mal prononcés nuisent à la personnalité de la marque et à la confiance de l’auditeur.
Un bon agent doit réussir les deux, le contenu et la sonorité, pour le public auquel il s’adresse. Par exemple :
-
Signaux d’écoute, ou backchanneling. Ce sont les petits signes verbaux qui montrent que l’on suit une conversation : « hum hum », « d’accord », « compris », « oui ».
Ce ne sont pas des tours de parole, mais des acquiescements et de brefs indices.
En IA conversationnelle, ils fonctionnent dans les deux sens. Le modèle TTS doit les produire au bon moment pour éviter de paraître robotique et distant. Le modèle ASR doit les reconnaître comme des signes d’écoute, et non comme des interruptions.
Un agent qui prend « hum hum » pour une interruption, ou qui ne montre jamais qu’il écoute, donne l’impression de mal fonctionner même si le système fonctionne techniquement.
Les mesures de performance
-
Fidélité au texte. Elle mesure le respect du texte d’entrée par la parole générée en TTS. Même les modèles avancés peuvent halluciner en ajoutant des mots absents ou supprimer des phrases entières. L’exactitude tient aussi compte des mots mal articulés et des prononciations étranges qui s’écartent du script prévu.
Sans forte fidélité au texte, un modèle vocal ne convient pas à des usages comme la lecture juridique ou médicale, où la précision sémantique est essentielle.
-
Traitement des données alphanumériques. Il mesure la fiabilité avec laquelle un modèle prononce les données hors dictionnaire : numéros de téléphone, identifiants de suivi, dates et adresses e-mail.
Il repose sur la normalisation. Le modèle doit d’abord interpréter le format, par exemple déterminer si « 12/01 » suit MM-JJ ou JJ-MM, puis le restituer correctement à l’oral. Lire un numéro de téléphone comme un grand nombre entier plutôt que chiffre par chiffre crée une expérience déroutante, surtout dans des contextes professionnels ou à fort enjeu comme la santé, la finance ou la logistique.
-
RTF, facteur temps réel. Pour la transcription STT, le RTF mesure la vitesse de production du texte pour une durée donnée d’audio. On divise le temps de traitement par la durée de l’audio d’entrée.
Si une IA met 30 secondes à transcrire un enregistrement de 1 minute, soit 60 secondes, son RTF est de 0,5 : elle est plus rapide que le temps réel. Un RTF égal à 1 signifie que le traitement prend exactement la durée de l’audio. Au-delà de 1, la transcription prend du retard car elle est plus lente que le temps réel.
Pour le TTS, la définition diffère légèrement : on mesure le temps nécessaire à la génération de l’audio à partir du texte.
| STT/ASR | TTS |
|---|---|
| Entrée audio, sortie textuelle. | Entrée textuelle, sortie audio. |
| RTF = temps de transcription / durée de l’audio d’entrée | RTF = temps de synthèse vocale / durée de la parole générée |
-
TTFS, délai du segment final. Pour un agent vocal en conversation directe, mesurer le RTF du modèle ASR n’est pas assez précis.
Le TTFS, Time to Final Segment, est plus pertinent. Aussi appelé TTCT, Time to Complete Transcript, il mesure le délai entre la fin du tour de l’utilisateur et la production de la transcription définitive par le modèle STT. Le texte est alors complet, validé et prêt pour le LLM.
Il ne faut pas le confondre avec l’autre TTFS, Time to First Segment, qui mesure seulement l’arrivée du premier fragment de texte. Le TTCT mesure l’achèvement de toute la transcription. Pour un agent conversationnel, le segment final est le véritable point de passage, car les traitements en aval attendent la fin du TTCT pour agir.
-
TTFB, délai du premier octet. Il mesure la réactivité d’un modèle TTS : le temps entre l’arrivée du texte et le début du renvoi des tout premiers octets d’audio.
Un TTFB inférieur à 300 ms était auparavant la référence pour une conversation naturelle. Au-delà, on ressent un décalage gênant de type talkie-walkie.
Chez Cartesia, nous sommes allés plus loin. Les modèles Sonic 3 atteignent 40 à 90 ms, moins qu’un clignement d’œil humain d’environ 100 ms.
Le temps réel devient ainsi tangible.
-
MOS, note moyenne d’opinion. Cette mesure existe parce que la qualité perçue d’une voix, son naturel, sa crédibilité ou son adéquation, comporte une forte part de subjectivité. Une voix bien notée pour une application de méditation peut sembler inadaptée à un agent de triage médical. Traditionnellement évalués par des panels humains, ces scores sont aussi prédits par des modèles IA dans les processus actuels.
Le MOS est la moyenne des notes attribuées par des auditeurs sur une échelle de 1 à 5. Il structure cette appréciation subjective et permet d’évaluer une voix selon les attentes et préférences du public visé.
Il fournit donc un cadre d’évaluation lié au contexte précis et à l’usage attendu par ce public. Il est particulièrement pertinent pour l’IA vocale conversationnelle, dont la qualité dépend fortement du contexte et de l’usage.
-
WER STT, taux d’erreur sur les mots en transcription. Le WER mesure littéralement le pourcentage de mots mal transcrits. Cette précision littérale est parfois importante.
Pour les agents vocaux conversationnels, elle peut toutefois être un indicateur flatteur sans réelle utilité.
Une transcription n’a plus besoin d’être exacte à 100 % pour être efficace à 100 %, car les LLM modernes savent très bien lire entre les lignes. Ils traitent par exemple « gonna » et « going to » de la même façon.
Une mesure plus utile est le WER sémantique. Il évalue la capacité de la transcription à transmettre l’intention de l’utilisateur, plutôt que de noter chaque « euh », « ah » ou virgule déplacée.
Accorder trop d’importance au WER littéral peut aussi ajouter de la latence. Le WER sémantique est plus utile car il cherche à déterminer si l’IA comprend réellement l’intention et y répond.
-
WER TTS, taux d’erreur sur les mots en synthèse vocale. Pour les modèles TTS, le WER mesure la fidélité de la parole générée au texte source. Il vérifie si le modèle a correctement articulé les mots, géré les prononciations complexes et évité d’inventer ou d’omettre des mots.
Créer une IA réellement conversationnelle comporte donc bien plus de couches que relier des modèles vocaux rapides à un LLM. La conversation humaine est désordonnée, bruyante et imprévisible. Concevoir des agents efficaces demande de concilier ingénierie et caractéristiques humaines sans perte importante de qualité, d’exactitude ou de vitesse.
Chez Cartesia, nous pensons que le potentiel des agents vocaux commence par une conception attentive et un contrôle précis de l’expérience conversationnelle de bout en bout. Cette philosophie guide la conception, l’entraînement, la construction, l’évaluation et le déploiement de nos modèles à espace d’état (SSM). Chaque couche doit être assemblée délibérément, en tenant compte des compromis, des résultats commerciaux, des objectifs de l’usage et de la qualité de l’ingénierie.
Nous sommes là pour vous aider à trouver une voix instinctive, fiable et humaine. Contactez-nous à business@cartesia.ai.
