Blog / Novità

Il round di serie A e il futuro dell'IA vocale

Karan Goel 
Il round di serie A e il futuro dell'IA vocale

In Cartesia stiamo costruendo il futuro dell’IA vocale: ultrarealistica, veloce e controllabile. Nell’ultimo anno abbiamo supportato milioni di chiamate e aiutato decine di migliaia di creatori a rendere i propri contenuti più accessibili.

Annunciamo un round di serie A da $64 milioni guidato da Kleiner Perkins. I nuovi fondi ci aiuteranno ad ampliare il team e investire nella ricerca per costruire la prossima generazione di modelli, infrastrutture e prodotti vocali, a partire dal lancio del nostro ultimo modello di generazione vocale, Sonic 2.0.

Sonic 2.0 usa la nostra nuova architettura di modelli a spazio di stato ed è il modello vocale più veloce e controllabile disponibile oggi. Ha dimensioni doppie rispetto a Sonic, ma è più veloce: solo 90ms di latenza per il modello completo e 40ms per turbo. Nelle valutazioni alla cieca, con confronti diretti su 100 voci escluse dall’addestramento, il numero di persone che ha preferito Sonic 2.0 è stato 1.5 volte quello di chi ha scelto il miglior fornitore successivo.

Oltre a velocità e qualità, Sonic 2.0 offre un controllo senza precedenti sulle generazioni, con una clonazione vocale ai vertici della categoria che cattura accenti complessi e ambienti sonori ricchi. Abbiamo introdotto anche due nuovi endpoint:

  • Voice changer, per perfezionare lo stile e la voce del tuo audio.
  • Infill, per modificare i contenuti all’interno del tuo audio senza stacchi.

Stiamo costruendo la piattaforma per l’IA vocale con un’infrastruttura per le imprese. L’API Sonic è progettata per gli sviluppatori e ha lo stack di erogazione più affidabile e veloce per la generazione vocale, con disponibilità del 99.9% e le latenze P90 più basse a livello globale. Siamo conformi a SOC-2 e HIPAA e supportiamo implementazioni in tempo reale on-premise e sui dispositivi.

Continuiamo anche a portare avanti il nostro programma di ricerca a lungo termine. La prossima generazione di modelli audio richiederà progressi algoritmici in diversi ambiti, tra cui architetture streaming, codec, modellazione di contesti lunghi e inferenza sui dispositivi. Condivideremo qui i nostri progressi.

Scopri il nostro lavoro sull’IA vocale su cartesia.ai/sonic. Se vuoi lavorare con noi, contattaci.