La missione di Cartesia è costruire la prossima generazione di IA: un’intelligenza interattiva e diffusa, che funzioni ovunque tu sia. I nostri modelli e la nostra piattaforma permettono di costruire sistemi IA multimodali in tempo reale, a partire dai progressi nell’audio e da Sonic, l’API di generazione vocale più veloce al mondo. Oggi annunciamo la prima tappa del percorso per portare l’intelligenza su ogni dispositivo.
Crediamo che l’intelligenza artificiale debba diventare così efficiente da potersi svincolare dal data center. Questo porta modelli capaci su ogni dispositivo e permette applicazioni che rispettano la privacy e interagiscono rapidamente con il mondo a volumi e velocità oggi impensabili. Agenti, assistenti personali, robotica, giochi, sanità, trasporti, difesa e sicurezza sono solo alcuni degli ambiti che questa tecnologia trasformerà.
Negli ultimi anni abbiamo sviluppato una nuova architettura IA, i modelli a spazio di stato, SSM. Rispetto alle architetture di attenzione più diffuse, gli SSM sono molto efficienti: i costi crescono quasi linearmente con la lunghezza della sequenza, invece che quadraticamente. Crediamo che avranno un ruolo centrale nei progressi dell’IA e permetteranno modelli di base in tempo reale, con memoria a lungo termine e bassa latenza, eseguibili su ogni dispositivo. Continueremo a sviluppare questa tecnologia ancora giovane nei prossimi anni.
Ora portiamo i modelli a spazio di stato sui tuoi dispositivi. Con questa pubblicazione annunciamo:
- Edge, una libreria open source con licenza Apache 2.0 per la ricerca e la distribuzione di SSM molto efficienti in applicazioni sui dispositivi, su diversi acceleratori e ambienti. Riunisce modelli linguistici SSM a pesi aperti, tra cui Rene, e li rende disponibili sull’hardware Apple tramite nuovi kernel Metal ottimizzati per SSM.
- Rene, un modello linguistico open source da 1.3B parametri preaddestrato da zero, con struttura SSM ibrida Mamba-2 e pensato per l’inferenza sui dispositivi.
- Sonic On-Device, in beta privata. È il primo modello di generazione vocale ultrarealistico che supporta streaming in tempo reale a bassa latenza sul dispositivo, con voci illimitate e clonazione istantanea.
Queste tre pubblicazioni segnano una tappa verso architetture e piattaforme radicalmente nuove, capaci di ridurre i requisiti di calcolo dei sistemi attuali. Se vuoi collaborare con noi per costruire la prossima generazione di prodotti IA sui dispositivi con Rene e Sonic On-Device, contattaci tramite il nostro modulo.
Intelligenza sui dispositivi
La tendenza dominante nell’IA è creare modelli di base sempre più grandi, un’area che continuerà a crescere con investimenti e ricerca. Questi modelli sono costruiti per data center che richiedono molto calcolo ed energia, lontani dal luogo in cui vengono usati.
E se seguissimo la direzione opposta? Moltissimi casi d’uso diventeranno possibili portando modelli “abbastanza grandi” all’edge o direttamente sui dispositivi.
Questo approccio offre vantaggi specifici rispetto a un grande modello eseguito nel cloud tramite API:
- Riduce al minimo il trasferimento dei dati e permette alle applicazioni di inviare continuamente ai modelli flussi multimodali ad alta risoluzione, per esempio per comprendere audio e video.
- Elimina la latenza di rete, raggiungendo tempi di risposta e affidabilità altrimenti impossibili.
- Non richiede connettività: le capacità del modello restano disponibili con connessioni scarse, requisiti di sicurezza elevati o impossibilità di tollerare interruzioni della rete.
- Le implementazioni sono completamente private e sicure, senza uscire dai confini fisici dell’hardware.
L’IA sui dispositivi permette nuove applicazioni che elaborano continuamente l’ambiente e rispondono in tempo reale. Ecco alcuni casi che ci interessano:
- Assistenti: trasformare qualsiasi dispositivo in un assistente personale che aiuta attivamente gli utenti e offre suggerimenti.
- Comunicazione: tradurre istantaneamente tra lingue in stile Babelfish, ovunque tu sia.
- Sicurezza: individuare anomalie ed eventi rilevanti nelle videocamere e agire.
- Sanità: comunicare privatamente con i pazienti durante le interazioni sanitarie.
- Istruzione: generare su iPad contenuti educativi personalizzati per gli studenti, in modo sicuro e privato.
- Robot: percepire e agire con velocità e affidabilità in risposta a rapidi cambiamenti dell’ambiente.
- Giochi: generare e controllare video su PC per creare giochi interamente generativi.
Questi casi d’uso possono nascere come prototipi nel cloud, ma la migliore esperienza utente richiederà il passaggio all’edge o al calcolo sui dispositivi.
Nuove architetture saranno decisive per implementazioni più veloci, efficienti e a bassa latenza all’edge. Pensiamo che gli SSM saranno una tecnologia centrale per modelli di base efficienti in energia e calcolo eseguiti all’edge. Queste sono le nostre prime pubblicazioni lungo il percorso.
Edge: una libreria open source per SSM sui dispositivi
Uno dei nostri obiettivi è trovare nuovi modi per portare modelli efficienti e di alta qualità a sviluppatori e utenti. Per questo pubblichiamo come open source Edge, la libreria per sviluppare modelli sui dispositivi basati su SSM. Qui costruiremo i nostri modelli open source per diversi dispositivi, a partire dai chip Apple serie M. Edge include kernel Metal personalizzati per Mamba-2, riutilizzabili su portatili e dispositivi mobili. Per facilitare sviluppo e test locali, abbiamo pubblicato anche cartesia-mlx, un pacchetto Python per costruire su Edge in Apple MLX. Edge integra supporto per inferenza ottimizzata, inclusi binding dei kernel Metal, quantizzazione dei livelli e altro.
Tutti i modelli Mamba-2 ufficiali, incluso Rene, sono ora disponibili in Edge. Seguiranno altre pubblicazioni nostre e della comunità.
Rene: un modello linguistico SSM open source da 1.3B
Rene è un piccolo modello linguistico, SLM, progettato per un uso molto efficiente sui dispositivi. Con 1.3B parametri, è un SLM ibrido composto da livelli Mamba-2 e MLP alternati, con alcuni livelli di attenzione a finestra scorrevole, SWA. È stato addestrato su 1.5T token del dataset pubblico Dolma-1.7, grazie ad AllenAI.
L’efficienza viene prima. Con Mamba-2 e SWA, Rene mantiene un’occupazione di memoria fissa durante l’inferenza, essenziale per funzionare in modo affidabile in ambienti con risorse limitate, come i dispositivi personali. I livelli Mamba-2 permettono tempi di prefill inferiori rispetto ad altre architetture basate solo su SSM.
Per la valutazione, abbiamo confrontato Rene con recenti SLM open source su diversi benchmark standard, usando LM Evaluation Harness. Coprono categorie come ragionamento di senso comune, COPA, WinoGrande, ARC-Easy e ARC-Challenge, e comprensione del linguaggio, PIQA, HellaSwag, OpenBookQA e MMLU. Rene supera anche SLM come OpenELM di Apple, 1.1B, e recurrent Gemma di Google, 2B, nella Figura 1. È il primo SLM basato su un’architettura ricorrente a ottenere risultati simili agli SLM più avanzati di dimensioni comparabili, fino a 2B parametri, su questi benchmark.

Sui dispositivi, Edge supporta Rene nativamente in MLX senza perdita di qualità rispetto all’implementazione PyTorch. Permette inoltre la quantizzazione a 8 e 4 bit per inferenza più veloce senza perdita di qualità, come mostra la Figura 2.

Beta privata di Sonic On-Device
Dalla pubblicazione di Sonic abbiamo osservato un’ampia adozione in assistenti, agenti conversazionali, giochi, istruzione e doppiaggio. Da allora abbiamo ricevuto molte richieste per eseguirlo sui dispositivi, per motivi di latenza, privacy e disponibilità.
Con questo aggiornamento annunciamo Sonic On-Device in beta privata. È il primo modello di generazione vocale ultrarealistico che supporta streaming in tempo reale a bassa latenza sul dispositivo. Offre tutte le capacità di Sonic, tra cui clonazione istantanea e controllo di pronuncia, velocità ed emozione. Vogliamo lavorare con sviluppatori e imprese alla prossima generazione di applicazioni vocali sui dispositivi, come assistenti personali, traduzione e doppiaggio in tempo reale.
Conclusione
Rene, Edge e Sonic On-Device sono l’inizio del nostro percorso verso un’intelligenza multimodale in tempo reale per ogni dispositivo. In Cartesia crediamo che un futuro in cui l’IA sui dispositivi sia la norma richieda un cambiamento nel modo di pensare alle architetture e al machine learning. Continueremo a costruire modelli e piattaforme ottimizzati per l’hardware, per permettere a ogni utente, su qualsiasi dispositivo, di usare l’IA multimodale in tempo reale.
Se vuoi collaborare con noi per costruire la prossima generazione di prodotti IA sui dispositivi con Rene e Sonic On-Device, contattaci tramite il nostro modulo:
