Abbiamo fondato Cartesia per costruire un’intelligenza in tempo reale e duratura per ogni dispositivo, partendo da un’innovazione architetturale: i modelli a spazio di stato. Oggi pubblichiamo Sonic, il nostro modello vocale a bassa latenza che genera parlato realistico.
Costruire intelligenza in tempo reale
Immagina un mondo in cui l’IA è incredibilmente efficiente: elabora contesti di qualsiasi dimensione, funziona su qualsiasi dispositivo e gestisce nativamente ogni modalità in tempo reale. In questo mondo l’intelligenza è ovunque e dura nel tempo, conversa con noi per aiutarci a capire ciò che ci circonda e agisce in autonomia per risolvere problemi complessi. Tutti possono accedere a un’intelligenza istantanea, controllarla ed eseguirla, personalizzata e privata secondo le proprie esigenze.
Crediamo che questo futuro richieda architetture dell’intelligenza fondamentalmente nuove. I modelli attuali sono lontani dallo standard dell’intelligenza umana. Non comprendono il mondo con il nostro livello di dettaglio e sono lenti e costosi, tanto che il loro sviluppo e la loro diffusione sono concentrati nelle grandi aziende. Nemmeno i modelli migliori possono elaborare e analizzare continuamente un flusso di un anno di audio, video e testo, pari a 1B token testuali, 10B token audio e 1T token video, tanto meno farlo su un dispositivo. Non dovrebbero tutti avere accesso a un’intelligenza economica che non richieda un data center?
Realizzare questa visione è il lavoro della nostra vita. Negli ultimi 4 anni, i cofondatori Albert e Karan hanno creato insieme un nuovo paradigma, il modello a spazio di stato, SSM, che offre un approccio fondamentalmente più efficiente alla costruzione di modelli IA. Gli SSM forniscono una base per addestrare modelli efficienti in tempo reale che acquisiscono nativamente informazioni in streaming, come fanno gli esseri umani. Modelli come S4 e Mamba, sviluppati originariamente dal nostro team in ambito accademico con l’inimitabile Tri Dao, vengono ora adottati rapidamente in tutto il mondo e ispirano nuovi lavori nei laboratori accademici e industriali: varianti per visione, robotica e biologia, e modelli linguistici industriali come Jamba, Zamba e altri. Mostrano un futuro in cui l’IA può essere molto più efficiente e accessibile.
In Cartesia siamo concentrati sull’efficienza dell’intelligenza: renderla più veloce, economica e accessibile a tutti. Stiamo costruendo la piattaforma per un’intelligenza in tempo reale e duratura, eseguibile su ogni dispositivo.
L’intelligenza in tempo reale avrà molte forme. Il nostro primo obiettivo è un’IA conversazionale in tempo reale con memoria duratura. È una nuova piattaforma di calcolo in cui i modelli conversano e comprendono l’audio nativamente, ricordano le interazioni nel lungo periodo e agiscono per risolvere problemi. Questa piattaforma permetterà nuove esperienze, dai giochi in tempo reale all’assistenza clienti. Di seguito riportiamo i primi progressi.
Modelli a bassa latenza per modalità ad alta risoluzione
La latenza è una sfida centrale per costruire intelligenza in tempo reale. I modelli dovrebbero rispondere istantaneamente agli input. Abbiamo fatto progressi nello sviluppo di nuove architetture SSM che permettono di generare modalità ad alta risoluzione, come audio e video, in modo efficiente e con bassa latenza. Per costruire IA conversazionale in tempo reale, abbiamo iniziato sperimentando e facendo crescere il nostro approccio su parlato e audio.
Negli esperimenti condotti finora, abbiamo migliorato contemporaneamente qualità del modello, velocità di inferenza, throughput e latenza rispetto alle implementazioni Transformer comunemente usate per generare audio. Un modello Cartesia con lo stesso numero di parametri, addestrato su Multilingual Librispeech per un’epoca, ottiene una perplexity di validazione inferiore del 20%. Nelle valutazioni successive, questo si traduce in un tasso di errore sulle parole dimezzato e un punteggio di qualità superiore di 1 punto su 5, misurato con NISQA. In inferenza ottiene una latenza inferiore, con tempo fino al primo audio ridotto di 1.5 volte, una velocità maggiore, con real-time factor dimezzato, e un throughput 4 volte superiore.
Pubblicheremo maggiori dettagli sulla nuova architettura in un rapporto separato.
Sonic: generazione vocale a bassa latenza
Abbiamo usato questa architettura per addestrare un nuovo modello vocale, Sonic, che pubblichiamo oggi. Sonic crea parlato realistico di alta qualità per qualsiasi voce con una latenza del modello di 135ms, la più bassa per un modello di questa classe.
Abbiamo costruito e ottimizzato il nostro stack di inferenza SSM per erogare Sonic con bassa latenza e alto throughput, offrendo modelli di alta qualità a costi inferiori. Sonic arriva con un Playground web e un’API a bassa latenza. Il Playground include una libreria di voci per assistenza clienti, intrattenimento e creazione di contenuti, con clonazione istantanea e progettazione della voce, tra cui velocità ed emozione. Tutto è utilizzabile anche tramite API.
Puoi registrarti e provarlo qui. Se vuoi collaborare con noi per costruire IA conversazionale in tempo reale, contattaci tramite il modulo: ne parleremo volentieri.
Cosa arriva dopo
Il nostro obiettivo più ampio è permettere a sviluppatori e aziende di costruire ed eseguire esperienze multimodali in tempo reale su qualsiasi dispositivo. L’audio è solo l’inizio: vogliamo che i modelli comprendano e generino istantaneamente qualsiasi modalità. Nel prossimo anno porteremo intelligenza nativamente multimodale e in tempo reale in ogni modalità.
Presto arriverà anche una pubblicazione open source che pensiamo piacerà agli sviluppatori.
Stiamo assumendo
Se vuoi contribuire a portare l’intelligenza multimodale in tempo reale su ogni dispositivo, scrivici a join@cartesia.ai.
