La synthèse vocale pour les agents vocaux en temps réel
Écoutez la voix avec vos mots
Essayez une phrase que votre application pourrait prononcer. Comparez les voix sur les mêmes mots, puis écoutez la prononciation et le rythme.
Intégrez la parole à votre application
Sonic transforme le texte produit par votre application en audio. Votre application fournit la réponse ; le modèle vocal la prononce.
Choisir une voix
Testez les voix sur les mots que votre application prononcera réellement. Incluez des noms, des nombres et des abréviations au lieu de vous limiter à une salutation.
Générer l'audio via l'API
Envoyez du texte depuis votre application et recevez l'audio synthétisé. Choisissez une voix et un format, puis lisez la réponse ou enregistrez-la dans un fichier.
Diffuser les réponses parlées
Utilisez l'audio en streaming pour les conversations. Mesurez le délai avant que l'utilisateur entende la parole, y compris le transfert réseau et la mise en mémoire tampon.
Lecture dans le navigateur ou API vocale ?
Les deux transforment le texte en parole. Choisissez selon l'endroit où la voix doit s'exécuter et la façon dont votre application utilise l'audio.
Synthèse vocale dans le navigateur
Utilisez l'interface SpeechSynthesis du navigateur pour lire le texte avec les voix de l'appareil. Les voix disponibles dépendent du navigateur et du système d'exploitation.
Idéal pour Lire du texte à voix haute dans une page web.
Consulter le guide de synthèse vocale dans le navigateurL'API vocale de Cartesia
Choisissez une voix Sonic par son identifiant et générez de la parole depuis votre backend. Diffusez, enregistrez ou lisez l'audio dans vos applications web, mobiles et téléphoniques.
Idéal pour Générer de l'audio pour votre application.
Découvrir l'API vocaleDes voix réalistes et expressives pour chaque usage
Écoutez des exemples pour différentes applications. Comparez l'interprétation, puis testez une voix sur les mots que votre public entendra.
Assistance
Audio original en anglais
Transformez les réponses du service client en paroles grâce à la synthèse vocale. Lisez les mises à jour de service et les étapes de dépannage avec une voix cohérente dans les appels et les applications.
Jeux vidéo
Enregistrement original
Générez les dialogues des personnages à partir des textes de votre jeu. Comparez les voix pour chaque rôle, puis écoutez les nouvelles répliques en contexte pour vérifier le rythme et la diction.
Contenu
Enregistrement original
Créez des voix off pour les vidéos, les tutoriels et les présentations de produits à partir de texte. Modifiez le texte et générez une nouvelle narration sans réenregistrer chaque phrase.
Médias
Enregistrement original
Transformez les articles et les récits écrits en audio parlé. Utilisez la synthèse vocale pour les introductions de podcasts ou les actualités audio, en vérifiant les noms et la prononciation avant publication.
Santé
Audio original en anglais
Lisez des rappels de rendez-vous et des informations destinées aux patients à partir de textes relus par votre équipe. Utilisez une voix cohérente pour les instructions courantes et les changements de planning.
Ventes
Audio original en anglais
Ajoutez une narration aux démonstrations de produits et aux présentations commerciales. Testez votre texte avec différentes voix, puis actualisez l'audio quand votre produit ou votre message évolue.
agents vocaux
Audio original en anglais
Donnez aux agents vocaux d'IA des réponses orales générées à partir des textes de votre application. Choisissez une voix pour l'accueil et les conversations, puis testez-la sur des réponses courtes et longues.
Doublage
Audio original en japonais
Générez de la parole à partir de textes traduits dans votre processus de localisation. Comparez les voix dans les langues prises en charge et vérifiez la prononciation et le rythme avant d'ajouter l'audio à une vidéo.
Avatars
Enregistrement original
Associez un avatar numérique à la synthèse vocale pour des présentations et des parcours guidés. Générez les dialogues à partir de texte et coordonnez la lecture audio avec l'animation de votre avatar.
Logistique
Audio original en anglais
Transformez les mises à jour d'expédition et les consignes de livraison en messages parlés. Connectez la synthèse vocale à votre application pour que l'audio reflète les dernières informations de livraison.
Recrutement
Enregistrement original
Créez des introductions d'entretien et des messages de prise de rendez-vous pour les candidats à partir de textes validés. Gardez des instructions cohérentes et régénérez l'audio quand votre recrutement évolue.
Accessibilité
Enregistrement original
Proposez des versions audio de guides, d'articles et de supports pédagogiques écrits. Permettez au public d'écouter vos contenus tout en suivant le texte original à son rythme.
Une voix fluide et naturelle, partout dans le monde
Atteignez les marchés internationaux avec Sonic : 44 langues et un large choix d'accents, avec des voix de qualité native.
D'une démo vocale à une conversation
La synthèse vocale produit la réponse parlée. Un agent conversationnel doit aussi comprendre les entrées, décider quoi dire et gérer les interruptions.
Créer votre pipeline audio
Utilisez l'API Bytes lorsque votre texte est prêt ou une connexion WebSocket lorsque le texte arrive progressivement. Adaptez le format de sortie à votre lecteur et arrêtez l'audio en attente lorsqu'un utilisateur interrompt l'agent.
Consulter le guide WebSocketDévelopper avec Managed Agents
Associez une voix aux instructions et aux outils de votre agent. Utilisez Managed Agents pour travailler sur la conversation et sa voix ensemble.
Découvrir Managed AgentsFAQ sur la synthèse vocale
Qu'est-ce que la synthèse vocale ?
La synthèse vocale génère de l'audio parlé à partir de texte. Elle est aussi appelée text to speech ou TTS. Sonic réalise cette étape dans une application vocale. La reconnaissance vocale fait l'inverse : elle transforme la parole en texte.
Cartesia est-il identique à l'API SpeechSynthesis du navigateur ?
Non. L'interface window.speechSynthesis utilise les voix disponibles sur l'appareil et y gère la lecture. Cartesia est une API hébergée qui renvoie l'audio généré à votre application. Pour une simple lecture dans le navigateur sans clé API, consultez le tutoriel JavaScript de synthèse vocale. Les voix varient selon le système d'exploitation et peuvent utiliser des services locaux ou distants.
Comment intégrer la synthèse vocale à une application ?
Commencez avec le guide Python de synthèse vocale pour générer et enregistrer un WAV. Gardez la clé API sur votre backend. Pour un agent vocal, il faut aussi gérer la lecture et les interruptions ; l'exemple de fichier enregistré ne les implémente pas. Vous pouvez aussi utiliser Cartesia Managed Agents.
La synthèse vocale prononce-t-elle toujours le texte correctement ?
Testez la voix choisie avec les noms, abréviations et nombres de votre application. Écoutez les mots dans leur contexte et modifiez le texte si nécessaire. Un exemple représentatif aide à choisir une voix adaptée à votre contenu.
Quelles langues Cartesia prend-il en charge ?
Consultez la liste actuelle des langues Sonic et écoutez les exemples dans vos langues cibles. Fournissez le texte dans la langue à prononcer ; la synthèse vocale ne le traduit pas automatiquement.
Puis-je utiliser la synthèse vocale Cartesia hors ligne ou gratuitement ?
L'API hébergée de Cartesia nécessite Internet et un compte. L'audio généré et enregistré dans un fichier peut être lu hors ligne. L'utilisation dépend de votre offre et de ses limites ; consultez les tarifs actuels avant d'envoyer des requêtes.
La synthèse vocale et la reconnaissance vocale sont-elles identiques ?
La synthèse vocale transforme le texte en audio parlé. La reconnaissance vocale transforme l'audio en texte. Un agent peut utiliser la reconnaissance pour comprendre l'appelant, un modèle de langage pour produire une réponse et la synthèse pour la prononcer. Découvrez Sonic pour la synthèse et Ink pour la reconnaissance.
Puis-je diffuser la parole pendant sa génération ?
Oui. Cartesia propose des points de terminaison qui renvoient l'audio progressivement. Votre application peut commencer la lecture à son arrivée. Consultez la référence de l'API de streaming pour le format de réponse et adaptez la lecture aux paramètres audio de votre intégration.
Puis-je contrôler la vitesse et l'émotion de la parole synthétisée ?
Les modèles Sonic compatibles proposent des réglages de vitesse, de volume et d'émotion. Testez-les avec votre voix et votre texte pour entendre leur effet. Le guide des réglages vocaux décrit les commandes actuelles et les modèles compatibles.
La synthèse vocale peut-elle traduire le texte dans une autre langue ?
Fournissez le texte dans la langue à prononcer. La traduction est une étape distincte de la synthèse. Vérifiez les noms, les nombres et les formulations régionales avant de générer l'audio final. Parcourez les exemples linguistiques pour écouter les voix avant de choisir.
Quelle différence entre clonage vocal et synthèse vocale ?
Le clonage crée une voix réutilisable à partir d'enregistrements. La synthèse utilise une voix pour lire un nouveau texte. Vous pouvez choisir une voix existante ou créer un clone autorisé, puis générer la parole avec son identifiant. Consultez le guide du clonage vocal pour les exigences d'enregistrement.
Commencer aujourd'hui
Parlez à un expert.
Échangez avec notre équipe et découvrez comment Cartesia peut vous aider à créer des expériences vocales de premier plan.
Commencez à développer.
Accédez à nos modèles via l'API et mettez un agent vocal en production en quelques minutes.