Blog / Noticias

Anunciamos nuestra ronda semilla

Karan Goel 
Anunciamos nuestra ronda semilla

Anunciamos nuestra ronda semilla de 27 millones de dólares, liderada por Index Ventures con participación de Lightspeed, Factory, Conviction, General Catalyst, A*, SV Angel y 90 inversores ángeles.

Nuestra misión en Cartesia es crear inteligencia en tiempo real con memoria duradera que funcione donde estés. La IA ha cambiado extraordinariamente gracias al escalado de Transformers. Sin embargo, estos modelos tienen limitaciones importantes: solo pueden procesar y generar cantidades reducidas de información de una vez, como minutos de audio o segundos de vídeo; no conservan el estado eficientemente entre interacciones; y son demasiado caros para ejecutarse en tiempo real en la mayoría del hardware. La próxima generación de IA necesita innovación en sus arquitecturas básicas.

En los últimos años hemos desarrollado avances como S4 y Mamba para acercarnos a esa visión. Sus costes de cómputo crecen linealmente con la longitud de la secuencia, en lugar de cuadráticamente; aprenden a comprimir secuencias largas en un estado de tamaño fijo; y su inferencia es rápida y eficiente.

Estamos trazando el camino hacia modelos que reciban continuamente grandes cantidades de contexto del mundo, las compriman en memoria de trabajo y generen distintas modalidades en tiempo real en un dispositivo cercano.

Una parte importante de nuestra misión es llevar estos modelos avanzados a los clientes que crean el futuro de las aplicaciones de IA en tiempo real. Este año lanzamos Sonic, el modelo de generación de voz hiperrealista más rápido, y lo llevamos al dispositivo. Sonic está en producción con miles de clientes, desde creadores individuales y startups hasta grandes empresas, y sostiene la próxima generación de agentes de voz, medios digitales y asistentes.

Crear modelos generativos de contexto largo para señales multimodales ricas como audio y vídeo sigue siendo difícil. Los modelos son complicados de controlar y se desvían pronto. En los últimos meses hemos creado una arquitectura SSM para modelos multiflujo que razonan y generan continuamente sobre varios flujos de distintas modalidades en paralelo. Permite entrenar modelos de extremo a extremo con inferencia en streaming muy eficiente y un control sin precedentes entre modalidades.

Hemos entrenado un modelo de generación de voz de extremo a extremo con esta arquitectura. Ofrece control preciso del texto para evitar alucinaciones, manteniendo el realismo de la generación integral. Mejora las arquitecturas anteriores, que pueden tener problemas con textos complejos, largos y repetitivos. Esto importa a nuestros usuarios y especialmente a quienes crean agentes de voz donde la exactitud es esencial. Estos ejemplos conservan el audio y el texto originales en inglés:

Are you available at any of the following times? 10:00am, 10:05am, 10:10am, 10:15am, 10:20am, 10:25am, 10:30am, 10:35am, 10:40am, 10:45am, 10:50am, or 10:55am?

My phone number is 8888888888.

My email address is HELLOWORLD at CARTESIA dot AI

How much wood could a woodchuck chuck if a woodchuck could chuck wood? A woodchuck would chuck as much wood as a woodchuck could chuck if a woodchuck could chuck wood.

Puedes probar el nuevo modelo hoy en Playground como Sonic Preview. Estará disponible mediante nuestra API en tiempo real durante las próximas semanas.

Seguimos ampliando nuestras arquitecturas SSM multiflujo a varias modalidades de entrada y salida y tenemos un plan ambicioso para ofrecer la próxima generación de IA multimodal en tiempo real. Si te interesa nuestro trabajo, considera unirte al equipo.