Nous avons fondé Cartesia pour créer une intelligence durable en temps réel pour chaque appareil, à partir d’une innovation architecturale : les modèles à espace d’états. Nous lançons aujourd’hui Sonic, notre modèle vocal à faible latence qui génère une parole réaliste.
Construire une intelligence en temps réel
Imaginez une IA incroyablement efficace, capable de traiter des contextes de toute taille, de fonctionner sur n’importe quel appareil et de traiter nativement toute modalité en temps réel. Dans ce monde, l’intelligence est omniprésente et durable. Elle converse avec nous pour nous aider à comprendre notre environnement et à nous y orienter, et agit de manière autonome pour résoudre des problèmes complexes. Chacun peut accéder à une intelligence instantanée, la contrôler et l’exécuter, avec une personnalisation et une confidentialité adaptées à ses besoins.
Nous pensons que cet avenir nécessite des architectures d’intelligence fondamentalement nouvelles. Les modèles actuels sont loin du niveau de l’intelligence humaine. Ils ne comprennent pas le monde avec notre niveau de détail et sont si lents et coûteux que leur développement et leur diffusion se concentrent dans les grandes entreprises. Même les meilleurs modèles ne peuvent pas traiter en continu et analyser un an de flux audio, vidéo et textuel, soit 1 milliard de tokens de texte, 10 milliards de tokens audio et 1 000 milliards de tokens vidéo. Encore moins sur un appareil. Tout le monde ne devrait-il pas avoir accès à une intelligence abordable sans devoir mobiliser un centre de données ?
Réaliser cette vision est le travail de notre vie. Au cours des quatre dernières années, nos cofondateurs Albert et Karan ont créé ensemble une nouvelle approche, le modèle à espace d’états, ou SSM, fondamentalement plus efficace pour construire des modèles d’IA. Les modèles à espace d’états offrent une base pour entraîner des modèles efficaces en temps réel qui reçoivent nativement l’information en continu, comme les humains. Des modèles comme S4 et Mamba, initialement développés par notre équipe dans le monde universitaire avec l’inimitable Tri Dao, sont désormais rapidement adoptés dans le monde entier. Ils inspirent de nouveaux travaux dans les laboratoires universitaires et industriels, des variantes pour la vision, la robotique et la biologie aux modèles de langage industriels comme Jamba, Zamba et d’autres. Ils donnent un aperçu d’un avenir où l’IA sera bien plus efficace et accessible.
Chez Cartesia, nous cherchons sans relâche à améliorer l’efficacité de l’intelligence, pour la rendre plus rapide, moins chère et plus accessible à tous. Nous construisons la plateforme qui permettra une intelligence durable en temps réel sur chaque appareil.
L’intelligence en temps réel prendra de nombreuses formes. Notre premier objectif est une IA conversationnelle en temps réel dotée d’une mémoire durable. C’est une nouvelle plateforme informatique où les modèles conversent et comprennent nativement l’audio, gardent une mémoire à long terme des interactions et peuvent agir pour résoudre des problèmes. Cette plateforme permettra de nouvelles expériences, du jeu en temps réel au support client. Nous présentons ci-dessous nos premiers progrès.
Des modèles à faible latence pour les modalités haute résolution
La latence est un défi majeur pour l’intelligence en temps réel. Les modèles devraient répondre instantanément à une entrée. Nous avons progressé dans le développement de nouvelles architectures de modèles à espace d’états qui permettent de générer efficacement et avec une faible latence des modalités haute résolution comme l’audio et la vidéo. Pour commencer, nous avons expérimenté et développé notre approche sur la parole et l’audio, en cohérence avec notre objectif d’IA conversationnelle en temps réel.
Dans nos expériences jusqu’ici, nous avons constaté que nous pouvions améliorer simultanément la qualité du modèle, la vitesse d’inférence, le débit et la latence par rapport aux implémentations Transformer largement utilisées pour générer de l’audio. À nombre de paramètres égal, un modèle Cartesia entraîné sur Multilingual Librispeech pendant une époque obtient une perplexité de validation inférieure de 20 %. Dans les évaluations en aval, cela se traduit par un taux d’erreur sur les mots deux fois plus faible et un score de qualité supérieur d’un point sur cinq, mesuré par l’évaluation NISQA. À l’inférence, il atteint une latence plus faible, avec un temps jusqu’au premier audio divisé par 1,5, une inférence plus rapide, avec un facteur temps réel divisé par deux, et un débit quatre fois supérieur.
Nous publierons davantage de détails sur notre nouvelle architecture dans un rapport distinct.
Sonic : génération vocale à faible latence
Nous avons utilisé cette architecture pour entraîner un nouveau modèle vocal appelé Sonic, que nous lançons aujourd’hui. Sonic crée une parole réaliste de qualité pour n’importe quelle voix avec une latence de modèle de 135 ms, la plus rapide pour un modèle de cette catégorie.
Nous avons construit et optimisé notre propre pile d’inférence pour modèles à espace d’états afin de servir Sonic avec une faible latence et un débit élevé, et ainsi proposer des modèles de qualité à moindre coût. Sonic est disponible avec un playground web et une API à faible latence. Le playground propose une bibliothèque variée de voix pour le support client, le divertissement et la création de contenu, ainsi que le clonage instantané et la conception de voix par réglage de la vitesse et de l’émotion. Toutes ces fonctions sont accessibles par l’API.
Vous pouvez vous inscrire et l’essayer ici. Si vous souhaitez collaborer avec nous pour créer une IA conversationnelle en temps réel, contactez-nous via ce formulaire. Nous serons ravis d’échanger.
La suite
Notre objectif plus large est de permettre aux développeurs et aux entreprises de créer et d’exécuter des expériences multimodales en temps réel sur n’importe quel appareil. L’audio n’est qu’un début. Nous voulons que nos modèles comprennent et génèrent instantanément toute modalité. Au cours de l’année à venir, nous apporterons une intelligence nativement multimodale en temps réel à toutes les modalités.
Restez aussi à l’écoute : nous préparons une publication open source qui devrait plaire aux développeurs.
Nous recrutons
Si notre mission d’apporter une intelligence multimodale en temps réel à chaque appareil vous intéresse, écrivez-nous à join@cartesia.ai.
