Fundamos Cartesia para crear inteligencia persistente en tiempo real para todos los dispositivos, partiendo de una innovación arquitectónica: los modelos de espacio de estados. Hoy lanzamos Sonic, nuestro modelo de baja latencia que genera voz natural.
Crear inteligencia en tiempo real
Imagina un mundo en el que la IA sea extraordinariamente eficiente, procese contextos de cualquier tamaño, funcione en cualquier dispositivo y trate de forma nativa cualquier modalidad en tiempo real. Un mundo con inteligencia ubicua y persistente, que converse con nosotros para ayudarnos a comprender nuestro entorno y desenvolvernos en él, y actúe de forma autónoma para resolver problemas complejos. En ese mundo, todos pueden acceder a una inteligencia instantánea, controlarla y ejecutarla de manera personalizada y privada.
Creemos que este futuro exige arquitecturas de inteligencia radicalmente nuevas. Los modelos actuales están lejos del nivel de la inteligencia humana. No comprenden el mundo con nuestro grado de detalle y, además, son lentos y caros, lo que ha concentrado su desarrollo y distribución en grandes empresas. Ni siquiera los mejores modelos pueden procesar y razonar continuamente sobre un flujo de audio, vídeo y texto de un año de duración, equivalente a 1.000 millones de tokens de texto, 10.000 millones de audio y un billón de vídeo. Mucho menos pueden hacerlo en el dispositivo. ¿No debería todo el mundo tener acceso a una inteligencia barata que no requiera movilizar un centro de datos?
Hacer realidad esta visión es el trabajo de nuestra vida. Durante los últimos 4 años, nuestros cofundadores Albert y Karan han trabajado juntos para crear un nuevo enfoque, el modelo de espacio de estados o SSM, que permite construir modelos de IA de forma mucho más eficiente. Los modelos de espacio de estados ofrecen una base elegante para entrenar modelos eficientes en tiempo real que reciben información de forma continua y nativa, como los seres humanos. S4 y Mamba, desarrollados originalmente por nuestro equipo junto con el inimitable Tri Dao en el ámbito académico, se están adoptando rápidamente en todo el mundo. Inspiran una nueva generación de trabajos en laboratorios académicos e industriales, con variantes para visión, robótica y biología, además de modelos de lenguaje industriales como Jamba y Zamba. Estos modelos anticipan un futuro en el que la IA puede ser mucho más eficiente y accesible.
En Cartesia nos obsesiona mejorar la eficiencia de la inteligencia para que sea más rápida, barata y accesible para todos. Estamos creando la plataforma para una inteligencia persistente en tiempo real que funcione en todos los dispositivos.
La inteligencia en tiempo real adoptará muchas formas. Nuestro primer objetivo es una IA conversacional en tiempo real con memoria duradera. Es una nueva plataforma informática cuyos modelos conversan y comprenden audio de forma nativa, mantienen memoria de las interacciones a largo plazo y pueden actuar para resolver problemas. Nos entusiasman las experiencias que permitirá, desde videojuegos en tiempo real hasta atención al cliente. A continuación compartimos nuestros primeros avances.
Modelos de baja latencia para modalidades de alta resolución
La latencia es uno de los grandes retos de la inteligencia en tiempo real. Los modelos deberían responder al instante cuando reciben una entrada. Hemos avanzado en el desarrollo de nuevas arquitecturas de modelos de espacio de estados que generan de forma eficiente y con baja latencia modalidades de alta resolución como audio y vídeo. Para empezar, en línea con nuestro objetivo de crear IA conversacional en tiempo real, estamos experimentando y ampliando nuestro enfoque en voz y audio.
En los experimentos realizados hasta ahora, hemos observado mejoras simultáneas en calidad del modelo, velocidad de inferencia, capacidad de procesamiento y latencia frente a implementaciones de Transformer ampliamente utilizadas para generar audio. Un modelo de Cartesia con el mismo número de parámetros, entrenado durante una época con Multilingual Librispeech, obtiene una perplejidad de validación un 20 % menor. En evaluaciones posteriores, esto se traduce en una tasa de error de palabras dos veces menor y una puntuación de calidad un punto superior sobre 5, medida con NISQA. Durante la inferencia, consigue menor latencia, con un tiempo hasta el primer audio 1,5 veces menor; más velocidad, con un factor de tiempo real dos veces menor; y una capacidad de procesamiento cuatro veces mayor.
Publicaremos más detalles de nuestra nueva arquitectura en un informe separado.
Sonic: generación de voz de baja latencia
Hemos utilizado esta arquitectura para entrenar Sonic, el nuevo modelo de voz que lanzamos hoy. Sonic produce habla natural de alta calidad con cualquier voz y una latencia de modelo de 135 ms, la más rápida de su categoría.
Hemos creado y optimizado nuestra propia infraestructura de inferencia de modelos de espacio de estados para ofrecer Sonic con baja latencia y alta capacidad de procesamiento. Esto nos permite servir modelos de alta calidad a menor coste. Sonic se lanza con un entorno de pruebas web y una API de baja latencia. El entorno de pruebas incluye una variada biblioteca de voces para atención al cliente, entretenimiento y creación de contenidos, con clonación instantánea y diseño de voz mediante controles de velocidad y emoción. Todo ello también está disponible mediante la API.
Puedes registrarte y probarlo aquí. Si te interesa colaborar con nosotros para crear IA conversacional en tiempo real, escríbenos mediante este formulario y estaremos encantados de hablar.
Próximos pasos
Nuestro objetivo más amplio es permitir que desarrolladores y empresas creen y ejecuten experiencias multimodales en tiempo real en cualquier dispositivo. El audio es solo el comienzo. Queremos que nuestros modelos comprendan y generen cualquier modalidad al instante. Durante el próximo año llevaremos inteligencia nativamente multimodal y en tiempo real a todas las modalidades.
Pronto también publicaremos un proyecto de código abierto que creemos que encantará a los desarrolladores.
Únete al equipo
Si te ilusiona nuestra misión de llevar inteligencia multimodal en tiempo real a todos los dispositivos, escríbenos a join@cartesia.ai.
