Blog / Recherche

Nouvelles avancées de l'intelligence sur appareil

Karan Goel 
Nouvelles avancées de l'intelligence sur appareil

Chez Cartesia, notre mission est de construire la prochaine génération d’IA : une intelligence interactive omniprésente qui fonctionne où que vous soyez. Nos modèles et notre plateforme permettent aux développeurs de créer des systèmes d’IA multimodaux en temps réel, à commencer par nos avancées en audio et Sonic, l’API de voix générative la plus rapide au monde. Aujourd’hui, nous annonçons une première étape vers une intelligence disponible sur chaque appareil.

Nous pensons que l’intelligence artificielle doit devenir si efficace qu’elle puisse un jour se détacher du centre de données. Cela placerait des modèles capables sur chaque appareil et permettrait de créer des applications respectueuses de notre vie privée, interagissant rapidement avec le monde à des volumes et des vitesses qui semblent aujourd’hui impossibles. Agents, assistants personnels, robotique, jeux, santé, transport, défense et sécurité ne sont que quelques-uns des domaines qui se transformeront avec cette technologie.

Ces dernières années, nous avons développé une nouvelle architecture d’IA, les modèles à espace d’états ou SSM. Comparés aux architectures d’attention courantes, les SSM sont très efficaces : leurs coûts augmentent de façon presque linéaire avec la longueur des séquences, plutôt que quadratique. Nous pensons qu’ils joueront un rôle majeur dans les progrès de l’IA et permettront de créer des modèles de fondation en temps réel, dotés d’une mémoire à long terme et d’une faible latence, capables de fonctionner sur chaque appareil. Nous continuerons à développer cette jeune technologie au cours des prochaines années.

Nous apportons maintenant les modèles à espace d’états à votre appareil. Cette publication comprend :

  • Edge, une bibliothèque open source sous licence Apache 2.0 pour soutenir la recherche et la publication de SSM très efficaces destinés aux applications sur appareil, sur différents accélérateurs et environnements. Edge rassemble des modèles de langage SSM à poids ouverts, dont Rene, et les rend disponibles sur le matériel Apple grâce à nos nouveaux noyaux Metal optimisés pour les SSM.
  • Rene, un modèle de langage open source de 1,3 milliard de paramètres, préentraîné à partir de zéro avec une architecture SSM hybride Mamba-2 et adapté à l’inférence sur appareil.
  • Sonic On-Device, en bêta privée. C’est le premier modèle de voix générative ultra-réaliste prenant en charge la diffusion en continu en temps réel à faible latence sur appareil, avec un nombre illimité de voix et le clonage instantané.

Ces trois publications marquent une étape vers notre objectif : créer des architectures et des plateformes radicalement nouvelles qui dépassent les contraintes de calcul des systèmes actuels. Si vous souhaitez collaborer avec nous pour construire la prochaine génération de produits d’IA sur appareil avec Rene et Sonic On-Device, contactez-nous via notre formulaire de contact.

L’intelligence sur appareil

La tendance dominante en IA est de créer des modèles de fondation toujours plus grands. Ce domaine continuera de croître avec les investissements et la recherche. Ces grands modèles sont conçus pour des centres de données gourmands en calcul et en énergie, loin de leur lieu d’utilisation.

Et si l’on prenait le chemin inverse ? Un grand nombre d’usages deviendront possibles lorsque des modèles “assez grands” seront déployés en périphérie ou directement sur appareil.

Cette approche présente des avantages distincts par rapport à un grand modèle cloud accessible par API :

  • Les transferts de données sont réduits, ce qui permet aux applications d’envoyer en continu des données multimodales haute résolution aux modèles, par exemple pour comprendre l’audio et la vidéo.
  • La latence réseau disparaît, permettant une latence et une fiabilité applicatives autrement impossibles à atteindre.
  • La connectivité réseau n’est plus nécessaire. Les modèles restent disponibles dans les environnements mal connectés, soumis à de fortes exigences de sécurité ou ne tolérant pas les coupures réseau.
  • Les déploiements sont entièrement privés et sécurisés, sans jamais sortir des limites physiques du matériel.

L’IA sur appareil permet de nouvelles applications capables de traiter leur environnement et d’y répondre continuellement en temps réel. Voici quelques usages qui nous intéressent :

  • Assistants : transformer n’importe quel appareil en assistant personnel qui aide les utilisateurs de manière proactive et fait des suggestions.
  • Communication : traduire instantanément entre les langues, à la manière de Babelfish, où que vous soyez.
  • Sécurité : identifier des anomalies et des événements pertinents sur des caméras vidéo, puis agir.
  • Santé : communiquer en toute confidentialité avec les patients dans les interactions de soins.
  • Éducation : générer du contenu sur un iPad pour créer des supports pédagogiques personnalisés de façon sûre et privée.
  • Robots : percevoir et agir rapidement et de manière fiable face à des changements soudains de l’environnement.
  • Jeux : générer et contrôler de la vidéo sur PC pour créer des jeux entièrement génératifs.

Même si ces usages commencent par des prototypes cloud, la meilleure expérience nécessitera un passage au calcul en périphérie ou sur appareil.

De nouvelles architectures de modèles permettront des déploiements plus rapides, plus efficaces et à plus faible latence en périphérie. Nous pensons que les modèles à espace d’états seront une technologie déterminante pour des modèles de fondation économes en énergie et en calcul fonctionnant en périphérie. Voici nos premières publications dans cette direction.

Edge : une bibliothèque open source de SSM sur appareil

Chez Cartesia, l’un de nos objectifs est de trouver de nouvelles façons d’apporter des modèles efficaces et de qualité aux développeurs comme aux utilisateurs. Nous publions donc Edge, notre bibliothèque pour développer des modèles sur appareil fondés sur les SSM. Nous y construirons nos modèles open source pour différents appareils, en commençant par les puces Apple de la série M. Edge comprend des noyaux Metal personnalisés pour Mamba-2, réutilisables sur ordinateur portable et mobile. Pour faciliter le développement et les tests locaux, nous publions aussi cartesia-mlx, un package Python pour construire sur Edge dans Apple MLX. Edge intègre l’inférence optimisée, notamment des liaisons vers les noyaux Metal et la quantification des couches.

Disponibilité. Tous les modèles Mamba-2 officiels, dont Rene, sont désormais disponibles dans Edge. D’autres publications de notre équipe et de la communauté suivront.

Rene : un modèle de langage SSM open source de 1,3 milliard de paramètres

Rene est un petit modèle de langage, ou SLM, conçu pour une utilisation très efficace sur appareil. Avec 1,3 milliard de paramètres, c’est un SLM hybride alternant couches Mamba-2 et MLP, avec quelques couches d’attention à fenêtre glissante, ou SWA, intercalées. Rene a été entraîné sur 1 500 milliards de tokens du jeu public Dolma-1.7. Merci à AllenAI.

L’efficacité d’abord. Grâce à Mamba-2 et SWA, Rene occupe une quantité fixe de mémoire à l’inférence, ce qui permet un fonctionnement fiable dans les environnements contraints comme les appareils personnels. Les couches Mamba-2 permettent un préremplissage plus rapide que les autres architectures fondées uniquement sur des SSM.

Évaluation. Nous avons comparé Rene à plusieurs SLM open source récents sur des tests standard de modélisation du langage, avec LM Evaluation Harness. Ils couvrent plusieurs catégories, notamment le raisonnement de sens commun avec COPA, WinoGrande, ARC-Easy et ARC-Challenge, et la compréhension du langage avec PIQA, HellaSwag, OpenBookQA et MMLU. Rene dépasse aussi des SLM comme OpenELM d’Apple à 1,1 milliard de paramètres et recurrent Gemma de Google à 2 milliards, comme le montre la figure 1. Rene est le premier SLM à architecture récurrente à atteindre des performances similaires à celles des meilleurs SLM de taille comparable, soit au plus 2 milliards de paramètres, sur ces tests.

Rene : un modèle de langage SSM open source de 1,3 milliard de paramètres

Sur appareil. Edge prend Rene en charge nativement dans MLX sans perte de qualité par rapport à son implémentation PyTorch. Edge permet aussi sa quantification sur 8 et 4 bits pour une inférence plus rapide sans perte de qualité, comme le montre la figure 2.

Rene : un modèle de langage SSM open source de 1,3 milliard de paramètres

Bêta privée de Sonic On-Device

L’adoption de Sonic depuis son lancement nous a impressionnés, dans les assistants, agents conversationnels, jeux, outils pédagogiques et doublages. Depuis, nous avons reçu de nombreuses demandes pour Sonic sur appareil, pour des raisons de latence, de confidentialité et de disponibilité.

Nous annonçons aujourd’hui Sonic On-Device en bêta privée. C’est le premier modèle de voix générative ultra-réaliste permettant la diffusion en continu en temps réel à faible latence sur appareil. Il reprend toutes les capacités de Sonic, notamment le clonage instantané et le contrôle de la prononciation, de la vitesse et de l’émotion. Nous souhaitons travailler avec les développeurs et les entreprises pour construire la prochaine génération d’applications vocales sur appareil, notamment des assistants personnels et des outils de traduction et de doublage en temps réel.

Conclusion

Rene, Edge et Sonic On-Device marquent le début de notre travail pour apporter une intelligence multimodale en temps réel à chaque appareil. Chez Cartesia, nous pensons qu’un avenir où l’IA sur appareil devient la norme exige un changement profond dans notre manière de penser les architectures de modèles et l’apprentissage automatique. Nous poursuivons la construction de modèles et de plateformes optimisés pour le matériel afin que chaque utilisateur, sur chaque appareil, puisse bénéficier d’une IA multimodale en temps réel.

Si vous souhaitez collaborer avec nous pour construire la prochaine génération de produits d’IA sur appareil avec Rene et Sonic On-Device, contactez-nous via notre formulaire de contact :