Apprendre

Agent vocal IA : définition et création

Rene, Kabir Goel 
Agent vocal IA : définition et création

Un agent vocal IA décroche, écoute ce que veut l’appelant et agit : il réserve un rendez-vous, vérifie une commande, répond à une question ou transfère à une personne avant que l’appelant soit bloqué. Un chatbot le fait en lisant et en écrivant. Un agent vocal travaille sur de l’audio en direct, alors que l’appelant est encore au milieu de sa phrase.

Cette différence de timing représente l’essentiel de l’ingénierie. Cette page explique la définition, le fonctionnement, les difficultés et les deux façons de construire un agent sur Cartesia.

Qu’est-ce qu’un agent vocal IA ?

C’est un logiciel qui tient une conversation orale et agit. Il transcrit, décide quoi faire, appelle un calendrier ou un système de commandes, puis dit le résultat. Il appartient à la catégorie plus large de l’IA conversationnelle, appliquée ici à la parole en temps réel. Notre présentation de l’IA conversationnelle couvre la catégorie entière.

On le confond parfois avec deux systèmes voisins :

SystèmeFonctionDifférence
Serveur vocal à touches ou menusLit des menus et oriente les appelsNe comprend pas le langage ; l’appelant s’adapte au menu
Chatbot textuelLit et écrit du textePas d’audio en direct ; il peut attendre entre les tours sans que l’appelant le remarque

Un agent vocal peut comprendre une demande non prévue par les menus et doit répondre pendant que l’appelant reste en ligne. Un mauvais timing provoque des chevauchements de parole, des silences gênants ou un raccrochage.

Comment fonctionne un agent vocal

La boucle comporte quatre étapes. Les bons systèmes les font se chevaucher plutôt que les exécuter successivement :

ÉtapeRôlePoints à surveiller
Transcription en continuTranscrire l’audio à mesure qu’il arriveExactitude sur vos accents, codecs téléphoniques et bruit ; préserver les silences utiles au détecteur
Détection des toursDéterminer si l’appelant a terminé son idéeUne pause peut signifier réflexion ou fin ; un délai fixe traite les deux de la même façon
LLM et outilsPréparer la réponse, appeler calendrier ou commandesLa latence des outils s’ajoute directement à l’attente
Synthèse vocaleDire la réponse au fil de sa générationDémarrer avant la phrase complète et gérer proprement les interruptions

L’appelant perçoit un seul chiffre : le temps entre la fin de sa phrase et le début de la réponse. Chaque étape y contribue. Un TTS sous la seconde ne sauve pas des outils qui prennent trois secondes, et un LLM rapide ne sauve pas une reconnaissance qui déforme le numéro de compte. Mesurez toute la boucle. Ink réunit les deux premières étapes : transcription en continu et détection native des tours. Sonic est la quatrième, un TTS classé premier aux tests d’écoute à l’aveugle, avec moins de 90 ms de latence et plus de 40 langues. Vous choisissez le modèle de langage au milieu.

Ce qui rend les agents difficiles à construire

La chaîne est la partie facile. Trois comportements mettent les agents en difficulté.

Les tours de parole. Les humains ne parlent pas en phrases achevées. Ils disent « mon adresse est… », puis s’arrêtent pour la chercher. Les études interlinguistiques trouvent un passage de parole autour de 200 millisecondes (Stivers et al., 2009). Attendre une seconde fait perdre le rythme ; intervenir à chaque pause coupe la parole. Distinguer réflexion et fin est un problème à part entière, traité dans notre guide de la détection d’activité vocale et des tours.

Les interruptions. L’appelant change d’avis pendant la réponse : « finalement, plutôt jeudi ». Un agent utile se tait, intègre la correction et continue. Il faut annuler la génération textuelle, mais aussi l’audio déjà en mémoire tampon dans le haut-parleur. Le problème se situe autant côté client que serveur.

La récupération. La reconnaissance entendra mal. Un outil dépassera son délai. L’agent doit avoir une suite : confirmer une fois, réessayer ou transférer avant que l’appelant se répète une troisième fois. Un agent qui ne sait que réussir échoue bruyamment.

Évaluer vos appels réels

Toutes les démonstrations fonctionnent, parce qu’elles sont conçues pour elles-mêmes. Vos appelants ont leurs accents, connexions et termes. Avant d’envoyer du trafic réel, faites passer un lot d’appels enregistrés ou de test et notez la conversation :

  • L’agent laisse-t-il finir les idées en suspens comme « et, euh, le deuxième » ?
  • Répond-il rapidement aux réponses complètes, sans seconde morte ?
  • L’audio s’arrête-t-il réellement quand l’appelant interrompt ?
  • En cas de mauvaise compréhension, confirme-t-il ou transfère-t-il au lieu de deviner ?
  • Confirme-t-il avant une action importante, comme annuler une réservation ou modifier une commande ?

Le guide pilote pour centres d’appels IA transforme ces questions en grille pour une file de support. Le guide du réceptionniste IA comprend des tests d’acceptation, dont un cas d’injection de prompt.

Deux façons de construire sur Cartesia

Managed Agents (/agents) relie la boucle pour vous. Choisissez le LLM, connectez outils et transferts, ajoutez une base de connaissances et obtenez un numéro en quelques clics. Cartesia exploite la pile de diffusion. C’est le chemin rapide vers un agent testable.

L’API fournit les composants. Sonic produit la parole, Ink transcrit en continu et détecte les tours, votre LLM occupe le milieu et votre code gère la boucle. Choisissez cette voie pour contrôler le modèle, le langage de programmation ou le déploiement. L’introduction à Managed Agents décrit les deux voies et leurs responsabilités.

Les deux reposent sur les mêmes modèles à espace d’état, qui rendent ces latences de diffusion réalisables. Vous n’avez pas besoin de vous soucier de l’architecture avant de vous soucier de votre facture.

Les usages des agents vocaux

Support et assistance, accueil et rendez-vous, automatisation des centres d’appels, personnages et jouets interactifs. Decagon, ServiceNow, Quora, Retell et EliseAI créent des produits vocaux avec Cartesia. La page clients donne les détails.

Guides associés

FAQ

Qu'est-ce qu'un agent vocal IA ?

C'est un logiciel qui tient une conversation orale et agit. Il écoute l'appelant, comprend sa demande, utilise les outils nécessaires et répond à voix haute en temps réel. C'est un agent conversationnel appliqué à l'audio en direct, avec les contraintes de timing correspondantes.

Comment fonctionne un agent vocal IA ?

Sa chaîne a quatre parties : transcription en continu pendant la parole, détection de fin de tour, modèle de langage qui prépare la réponse et appelle les outils, puis synthèse vocale en continu. Les étapes se chevauchent : le délai perçu est la somme des chemins lents dans la boucle, pas la latence d'un seul modèle.

À quelle vitesse un agent doit-il répondre ?

Assez vite pour que l'appelant ne remarque pas la machine. Les humains se passent la parole en environ 200 millisecondes, et une pause d'une seconde évoque une hésitation. L'agent doit donc commencer bien avant une seconde. Sonic diffuse pendant la génération avec moins de 90 ms de latence modèle ; la voix représente souvent une petite part du budget face au LLM et au réseau.

Quelle est la meilleure plateforme d'agents vocaux IA ?

Cela dépend de la tâche. Vérifiez les tests d'écoute à l'aveugle, le temps de réponse complet, les interruptions et phrases partielles, les outils, la téléphonie, le prix à votre volume et le déploiement, notamment sur site. Faites passer vos appels par la plateforme avant de choisir. Les benchmarks fournisseurs sont un point de départ, pas un verdict.

Existe-t-il un agent vocal IA gratuit ?

Vous pouvez essayer gratuitement les modèles Cartesia dans le playground et configurer puis appeler un agent Managed Agents en test avant de vous engager. Les appels courants sont facturés à l'usage. Consultez les tarifs pour les offres et quotas actuels.