Chez Cartesia, nous investissons dans les avancées fondamentales des architectures et algorithmes d’IA, car elles permettent de véritables changements de capacité des modèles.
Sonic-3.6 réunit nos dernières avancées dans les architectures qui apprennent efficacement à partir d’audio multilingue, pendant le préentraînement et le post-entraînement. Il progresse fortement par rapport à Sonic-3.5 en naturel et en qualité. Les auditeurs le préfèrent dans jusqu’à 93 % des comparaisons directes à l’aveugle sur quinze variantes linguistiques régionales.
Au début de l’année, nous avons parié que la meilleure recherche exigeait de tout repenser depuis les principes fondamentaux plutôt que d’ajuster progressivement l’approche existante. Depuis, nous avons reconstruit nos données, notre architecture, notre entraînement et nos évaluations autour de nouvelles idées. Ces efforts portent leurs fruits.
Sonic-3.6 arrive seulement deux mois après Sonic-3.5 et reprend une nouvelle fois la première place des classements Artificial Analysis, avec voix contrôlée comme avec voix des fournisseurs. Dans le classement contrôlé, le modèle détrôné est Sonic-3.5. Dépasser notre propre modèle alors qu’aucun autre fournisseur n’a comblé l’écart montre l’accélération de notre recherche.


Se rapprocher de la parole naturelle
Pour ceux qui déploient la voix à grande échelle, le naturel détermine si le client reste en ligne. Une voix même légèrement synthétique peut faire perdre confiance et susciter une demande d’interlocuteur humain. Nous avons conçu Sonic-3.6 pour une voix assez naturelle et native pour maintenir la conversation dans 44 langues.
En anglais américain, les auditeurs ont choisi Sonic-3.6 plutôt qu’Eleven v3 dans 92 % des comparaisons à l’aveugle, grâce à une meilleure intonation, une qualité vocale supérieure et une émotion adaptée au contexte. Sonic-3.6 lit une phrase comme elle doit être entendue et adapte son interprétation à la conversation comme une personne. Les exemples conservent leurs enregistrements et transcriptions dans leur langue originale.
I understand things are difficult right now. We can start with a smaller amount, around $35 a month, and adjust it later. There's no pressure to commit to more than you can manage.
Eleven v3
Sonic-3.6
¿Hablas español?
Nous avons toujours considéré l’anglais comme un minimum. Sonner natif dans chaque autre langue ou accent est le vrai défi qui déterminera si l’IA vocale reste surtout anglophone ou devient une technologie à laquelle le monde entier peut parler. La plupart des modèles sont compréhensibles à l’étranger, mais peu reproduisent de manière convaincante l’accent, le ton et la prononciation locale d’un nom ou d’un lieu.
Nous avons testé Sonic-3.6 comme un client le jugerait : à l’oreille, dans chaque langue, face aux principaux concurrents. Des panels de locuteurs natifs ont préféré Sonic-3.6 dans chaque langue principale testée.
Préférence des locuteurs natifs
Comparaison à l'aveugle avec le principal concurrent de chaque variante régionale.
Note méthodologique : pour chaque langue, nous avons pris le principal concurrent et choisi une voix Sonic-3.6 comparable. Nous avons généré l'audio avec les mêmes textes, puis demandé à des panels de locuteurs natifs d'évaluer chaque paire à l'aveugle. Part des votes = victoires du modèle ÷ total des votes valides
Ces améliorations permettent :
- Une portée plus large : 61 variantes régionales, dont 11 indiennes, et plus de 500 voix prédéfinies disponibles, ainsi que deux nouvelles langues, l’odia et l’ourdou, toutes deux lancées avec une exactitude du texte supérieure à 96 %.
- Le hinglish : alternez hindi et anglais dans une même génération, avec un texte en devanagari, en alphabet latin ou dans les deux.
- Un meilleur respect des accents pour les clones instantanés : Sonic-3.6 conserve bien mieux l’accent d’un locuteur, y compris les accents moins répandus.
- La prise en compte de la région : définissez le champ locale facultatif pour prononcer dates, heures et nombres à la manière locale.
Alterner naturellement hindi et anglais :
हमारी टीम ने पिछले quarter में customer feedback के आधार पर 12/08/2026 को नया mobile app launch किया, जिससे revenue में लगभग पंद्रह प्रतिशत की growth देखी गई।
Lire la date à la manière d’un Australien :
Right, so I've confirmed your Qantas booking, QF11, departing Sydney on 21/07/2026. You're in seat 32A, you've got one checked bag at twenty-three kilos, and check-in opens three hours before the 9:50am departure.
Conçu pour la production
Le naturel peut convaincre dans une démonstration, mais l’appel réel reste le vrai test. Conçu pour les charges professionnelles à grande échelle, Sonic-3.6 :
- Répond en moins de 90 ms et génère presque deux fois plus vite que v3 Conversational, à 132 contre 68 caractères par seconde.
- Fonctionne à grande échelle dans le cloud, sur site et via des points de terminaison localisés, avec un SLA de disponibilité de 99,9 %.
- Alimente des millions d’appels en production avec la fiabilité qu’exige ce volume.
- Se déploie dans votre propre cloud via Baseten, Amazon SageMaker ou Together AI, pour que l’audio n’ait jamais à quitter votre infrastructure.
- Répond aux exigences de conformité des entreprises, avec SOC 2, PCI, HIPAA et RGPD.
- S’adapte à votre marque, avec l’aide directe de notre équipe pour développer et trouver votre voix personnalisée.
Écoutez par vous-même
Sonic-3.6 est désormais disponible pour tous dans le playground ou via l’API.
Essayez-le vite. À ce rythme, nous pourrions en sortir un nouveau avant la fin de votre intégration.
