Annunciamo un round seed da $27M guidato da Index Ventures, con la partecipazione di Lightspeed, Factory, Conviction, General Catalyst, A*, SV Angel e 90 angel investor.
La missione di Cartesia è costruire un’intelligenza in tempo reale con memoria lunga, che funzioni ovunque tu sia. L’intelligenza artificiale ha attraversato una trasformazione straordinaria grazie alla crescita dei modelli Transformer. Questi modelli hanno però limiti importanti: possono elaborare e generare solo brevi quantità di informazione alla volta, minuti di audio o secondi di video, non mantengono lo stato in modo efficiente tra le interazioni e sono troppo costosi da eseguire in tempo reale sulla maggior parte dell’hardware. La prossima generazione di IA richiederà innovazione nelle architetture di base dell’intelligenza.
Negli ultimi anni abbiamo aperto la strada a nuove architetture, come S4 e Mamba, per realizzare questa visione. Queste architetture hanno proprietà importanti: il costo computazionale cresce linearmente con la lunghezza della sequenza anziché quadraticamente, imparano a comprimere lunghe sequenze di dati in uno stato di dimensione fissa e offrono inferenza veloce ed efficiente.
Stiamo costruendo un percorso verso modelli capaci di acquisire continuamente un contesto enorme sul mondo, comprimerlo in una memoria di lavoro e generare più modalità in tempo reale su un dispositivo vicino a te.
Una parte importante della nostra missione consiste nel portare questi modelli ai clienti che costruiscono il futuro delle applicazioni IA in tempo reale. Quest’anno abbiamo pubblicato Sonic, il modello di generazione vocale iperrealistica più veloce, e lo abbiamo portato sui dispositivi. Sonic è in produzione presso migliaia di clienti, dai singoli creatori e dalle startup alle grandi imprese, e supporta la prossima generazione di agenti vocali, media digitali e assistenti.
Costruire modelli generativi con contesto lungo per segnali multimodali ricchi come audio e video resta difficile: i modelli sono difficili da controllare e deviano rapidamente dal compito. Negli ultimi mesi abbiamo creato una nuova architettura SSM per modelli multi-stream che ragionano e generano continuamente su più flussi di dati di modalità diverse in parallelo. Questo permette di addestrare modelli end-to-end con inferenza streaming molto efficiente e un controllo senza precedenti tra le modalità.
Abbiamo addestrato un modello end-to-end di generazione vocale con la nostra architettura multi-stream. Offre un controllo preciso sul testo per prevenire le allucinazioni, mantenendo il realismo della generazione end-to-end. È un miglioramento fondamentale rispetto alle precedenti architetture per la generazione audio end-to-end, che possono faticare a seguire testi complessi, lunghi e ripetitivi. Questo conta per tutti i nostri utenti, in particolare per chi costruisce agenti vocali in cui la correttezza è essenziale. Ecco alcuni esempi. Le registrazioni e i testi associati mantengono la lingua originale.
Are you available at any of the following times? 10:00am, 10:05am, 10:10am, 10:15am, 10:20am, 10:25am, 10:30am, 10:35am, 10:40am, 10:45am, 10:50am, or 10:55am?
My phone number is 8888888888.
My email address is HELLOWORLD at CARTESIA dot AI
How much wood could a woodchuck chuck if a woodchuck could chuck wood? A woodchuck would chuck as much wood as a woodchuck could chuck if a woodchuck could chuck wood.
Puoi provare questo nuovo modello oggi nel Playground sotto Sonic Preview. Sarà disponibile tramite la nostra API in tempo reale nelle prossime settimane.
Continuiamo a far crescere le architetture SSM multi-stream su più modalità di ingresso e uscita, con un piano ambizioso per la prossima generazione di IA multimodale in tempo reale. Se il nostro lavoro ti interessa, considera di unirti a noi.
