Nous annonçons une levée d’amorçage de 27 millions de dollars menée par Index Ventures, avec la participation de Lightspeed, Factory, Conviction, General Catalyst, A*, SV Angel et 90 investisseurs providentiels.
Chez Cartesia, notre mission est de construire une intelligence en temps réel dotée d’une mémoire longue, qui fonctionne où que vous soyez. Le développement à grande échelle des Transformers a transformé l’IA. Ces modèles ont toutefois des limites importantes. Ils ne peuvent traiter et générer que de petites quantités d’information à la fois, quelques minutes d’audio ou secondes de vidéo, ne conservent pas efficacement un état entre les interactions et coûtent trop cher pour fonctionner en temps réel sur la plupart des matériels. La prochaine génération d’IA nécessitera d’innover dans les architectures de base de l’intelligence.
Ces dernières années, nous avons développé de nouvelles architectures, comme S4 et Mamba, pour avancer vers cette vision. Elles ont plusieurs propriétés importantes : leur coût de calcul augmente linéairement avec la longueur des séquences plutôt que quadratiquement, elles apprennent à compresser de longues séquences dans un état de taille fixe et leur inférence est rapide et efficace.
Nous préparons un avenir où les modèles pourront absorber continuellement un contexte massif sur le monde, le compresser dans une mémoire de travail et générer plusieurs modalités en temps réel sur un appareil proche de vous.
Une grande partie de notre mission consiste à apporter ces modèles de pointe aux clients qui construisent l’avenir des applications d’IA en temps réel. Cette année, nous avons lancé Sonic, le modèle de génération vocale hyperréaliste le plus rapide, puis l’avons porté sur appareil. Sonic est en production chez des milliers de clients, des créateurs individuels et startups aux grandes entreprises. Il alimente la prochaine génération d’agents vocaux, de médias numériques et d’assistants.
Construire des modèles génératifs à contexte long pour des signaux multimodaux riches comme l’audio et la vidéo reste difficile. Les modèles sont difficiles à contrôler et dévient vite. Au cours des derniers mois, nous avons créé une nouvelle architecture SSM pour des modèles multiflux qui raisonnent et génèrent en continu sur plusieurs flux de données de modalités différentes en parallèle. Cela permet d’entraîner des modèles de bout en bout avec une inférence en continu très efficace et un contrôle inédit entre modalités.
Nous avons entraîné un modèle de génération vocale de bout en bout avec cette architecture multiflux. Il permet un contrôle fin du texte pour éviter les hallucinations tout en conservant le réalisme de la génération de bout en bout. C’est une amélioration fondamentale par rapport aux architectures précédentes, qui peuvent peiner à suivre des textes complexes, longs ou répétitifs. Cela compte pour l’ensemble de nos utilisateurs, et particulièrement pour ceux qui construisent des agents vocaux où l’exactitude est essentielle. Voici quelques exemples, avec leurs transcriptions dans la langue originale des enregistrements :
Are you available at any of the following times? 10:00am, 10:05am, 10:10am, 10:15am, 10:20am, 10:25am, 10:30am, 10:35am, 10:40am, 10:45am, 10:50am, or 10:55am?
My phone number is 8888888888.
My email address is HELLOWORLD at CARTESIA dot AI
How much wood could a woodchuck chuck if a woodchuck could chuck wood? A woodchuck would chuck as much wood as a woodchuck could chuck if a woodchuck could chuck wood.
Vous pouvez essayer ce nouveau modèle dans le playground dès aujourd’hui sous le nom Sonic Preview. Il sera disponible via notre API en temps réel dans les prochaines semaines.
Nous continuons à développer nos architectures SSM multiflux pour plusieurs modalités d’entrée et de sortie et préparons la prochaine génération d’IA multimodale en temps réel. Si nos travaux vous intéressent, envisagez de nous rejoindre.
