Blog / Investigación

Novedades sobre inteligencia en el dispositivo

Karan Goel 
Novedades sobre inteligencia en el dispositivo

En Cartesia, nuestra misión es crear la próxima generación de IA: inteligencia ubicua e interactiva que funcione donde estés. Nuestros modelos y plataforma permiten a los desarrolladores crear sistemas de IA multimodales en tiempo real, empezando por nuestros avances en audio y Sonic, la API de voz generativa más rápida del mundo. Hoy anunciamos el primer hito de nuestro trabajo para llevar inteligencia a todos los dispositivos.

Creemos que la inteligencia artificial debe ser tan eficiente que llegue a independizarse del centro de datos. Así podremos disponer de modelos capaces en todos los dispositivos y crear aplicaciones que respeten nuestra privacidad e interactúen rápidamente con el mundo a escalas y velocidades que hoy parecen imposibles. Agentes, asistentes personales, robótica, videojuegos, sanidad, transporte, defensa y seguridad son solo algunos de los ámbitos que se transformarán con esta tecnología.

Durante los últimos años hemos desarrollado una nueva arquitectura de IA denominada modelos de espacio de estados, o SSM. Frente a las arquitecturas de atención más utilizadas, los SSM son muy eficientes: sus costes crecen de forma casi lineal con la longitud de la secuencia, en lugar de cuadrática. Creemos que los SSM tendrán un papel decisivo en el progreso de la IA y permitirán crear modelos fundacionales en tiempo real con memoria a largo plazo y baja latencia que funcionen en todos los dispositivos. Seguiremos desarrollando esta tecnología incipiente durante los próximos años.

Ahora llevamos los modelos de espacio de estados a tu dispositivo. En este lanzamiento anunciamos:

  • Edge, una biblioteca de código abierto con licencia Apache 2.0 para investigar y publicar SSM muy eficientes destinados a aplicaciones en el dispositivo, en distintos aceleradores y entornos. Edge reúne modelos de lenguaje SSM con pesos abiertos, incluido Rene, y los ofrece para hardware de Apple mediante nuestros nuevos kernels Metal optimizados para SSM.
  • Rene, un modelo de lenguaje de código abierto de 1.300 millones de parámetros, preentrenado desde cero sobre una arquitectura híbrida de SSM Mamba-2 y adaptado a la inferencia en el dispositivo.
  • Sonic On-Device, en beta privada. Es el primer modelo de voz generativa ultrarrealista que admite streaming en tiempo real y de baja latencia en el dispositivo, con voces ilimitadas y clonación instantánea.

Estos tres lanzamientos marcan un avance hacia nuevas arquitecturas de modelos y plataformas que rompan con las exigencias de cómputo de los sistemas actuales. Si te interesa colaborar para crear la próxima generación de productos de IA en el dispositivo con Rene y Sonic On-Device, escríbenos mediante nuestro formulario de contacto.

Inteligencia en el dispositivo

La tendencia predominante en IA es crear modelos fundacionales cada vez más grandes. Este ámbito seguirá creciendo con más inversión e investigación. Son modelos diseñados para centros de datos que consumen mucha energía y cómputo, lejos de donde se utilizan.

¿Y si tomamos la dirección contraria? Hay numerosos casos de uso que serán posibles cuando despleguemos modelos “lo bastante grandes” en el extremo de la red o en el dispositivo.

Este enfoque presenta ventajas frente a ejecutar un gran modelo en la nube mediante una API:

  • Reduce la transferencia de datos y permite que las aplicaciones envíen continuamente a los modelos datos multimodales de alta resolución, por ejemplo para comprender audio y vídeo.
  • Elimina la latencia de red y permite alcanzar niveles de latencia y fiabilidad de la aplicación que de otro modo serían imposibles.
  • Deja de requerir conectividad de red, por lo que los modelos pueden funcionar en entornos con mala conexión, requisitos de seguridad elevados o sin tolerancia a los cortes.
  • Los despliegues son completamente privados y seguros, sin salir de los límites físicos del hardware.

La IA en el dispositivo permite nuevas aplicaciones que procesan su entorno y responden continuamente en tiempo real. Estos son algunos de los casos que nos interesan:

  • Asistentes: convertir cualquier dispositivo en un asistente personal que ayude de forma proactiva y haga sugerencias.
  • Comunicación: traducir entre idiomas al instante, al estilo de Babelfish, donde estés.
  • Seguridad: identificar anomalías y acontecimientos relevantes en cámaras de vídeo y actuar.
  • Sanidad: comunicarse de forma privada con pacientes durante la atención sanitaria.
  • Educación: generar contenido en un iPad para crear materiales educativos personalizados de forma segura y privada.
  • Robots: percibir el entorno y actuar con rapidez y fiabilidad ante cambios repentinos.
  • Videojuegos: generar y controlar vídeo en un PC para crear juegos completamente generativos.

Aunque estos casos de uso pueden empezar como prototipos en la nube, ofrecer la mejor experiencia exigirá trasladar el cómputo al extremo de la red o al dispositivo.

Las nuevas arquitecturas de modelos permitirán despliegues más rápidos, eficientes y de menor latencia en el dispositivo. Creemos que los modelos de espacio de estados serán una tecnología importante para crear modelos fundacionales eficientes en energía y cómputo que funcionen en el extremo de la red. Hoy compartimos los primeros lanzamientos de ese trabajo.

Edge: una biblioteca de código abierto para SSM en el dispositivo

Uno de nuestros objetivos en Cartesia es encontrar nuevas formas de ofrecer modelos eficientes y de alta calidad a desarrolladores y usuarios. Por eso publicamos Edge, nuestra biblioteca para desarrollar modelos en el dispositivo basados en SSM. En Edge desarrollaremos nuestros modelos de código abierto para diversos dispositivos, empezando por los chips de la serie M de Apple. Incluye kernels Metal personalizados para Mamba-2 que pueden reutilizarse tanto en portátiles como en móviles. Para facilitar el desarrollo y las pruebas locales también publicamos cartesia-mlx, un paquete de Python para desarrollar sobre Edge en Apple MLX. Edge incorpora inferencia optimizada, incluidos enlaces a kernels Metal, cuantización de capas y otras funciones.

Disponibilidad. Todos los modelos oficiales Mamba-2, incluido Rene, ya están disponibles en Edge. Publicaremos más modelos, tanto nuestros como de la comunidad.

Rene: un modelo de lenguaje SSM abierto de 1.300 millones de parámetros

Rene es un modelo de lenguaje pequeño, o SLM, diseñado para funcionar con gran eficiencia en el dispositivo. Tiene 1.300 millones de parámetros y una arquitectura híbrida que alterna capas Mamba-2 y MLP, con algunas capas de atención de ventana deslizante, o SWA, intercaladas. Rene se entrenó con 1,5 billones de tokens del conjunto público Dolma-1.7, gracias a AllenAI.

La eficiencia como prioridad. Gracias a Mamba-2 y SWA, Rene utiliza una cantidad fija de memoria durante la inferencia, algo necesario para ejecutarlo de forma fiable en entornos con recursos limitados, como los dispositivos personales. Las capas Mamba-2 permiten tiempos de prefill más cortos que otras arquitecturas basadas exclusivamente en SSM.

Evaluación. Comparamos Rene con varios SLM recientes de código abierto en pruebas estándar de modelado del lenguaje mediante LM Evaluation Harness. Estas pruebas abarcan razonamiento de sentido común, con COPA, WinoGrande, ARC-Easy y ARC-Challenge, y comprensión del lenguaje, con PIQA, HellaSwag, OpenBookQA y MMLU. Rene también supera a SLM como OpenELM de Apple, de 1.100 millones de parámetros, y el Gemma recurrente de Google, de 2.000 millones, como muestra la figura 1. Rene es el primer SLM basado en una arquitectura recurrente que alcanza resultados similares a los SLM más avanzados de tamaño comparable, de hasta 2.000 millones de parámetros, en estas pruebas.

Rene: un modelo de lenguaje SSM abierto de 1.300 millones de parámetros

En el dispositivo. Edge admite Rene de forma nativa en MLX sin pérdida de calidad frente a su implementación en PyTorch. También permite cuantizar Rene a 8 y 4 bits para acelerar la inferencia sin pérdida de calidad, como muestra la figura 2.

Rene: un modelo de lenguaje SSM abierto de 1.300 millones de parámetros

Beta privada de Sonic On-Device

Desde su lanzamiento, Sonic se ha adoptado en aplicaciones de asistentes, agentes conversacionales, videojuegos, educación y doblaje. Desde entonces hemos recibido numerosas solicitudes para llevar Sonic al dispositivo por razones de latencia, privacidad y disponibilidad.

Con esta actualización anunciamos Sonic On-Device en beta privada. Es el primer modelo de voz generativa ultrarrealista que admite streaming de baja latencia y en tiempo real en el dispositivo. Incluye todas las capacidades de Sonic, como clonación instantánea y control de pronunciación, velocidad y emoción. Queremos trabajar con desarrolladores y empresas en la próxima generación de aplicaciones de voz en el dispositivo, incluidos asistentes personales y traducción y doblaje en tiempo real.

Conclusión

Rene, Edge y Sonic On-Device son el comienzo de nuestro trabajo para crear inteligencia multimodal en tiempo real para todos los dispositivos. En Cartesia creemos que un futuro en el que la IA en el dispositivo sea habitual exige cambiar cómo entendemos las arquitecturas de modelos y el aprendizaje automático. Seguiremos creando la próxima generación de modelos y plataformas optimizados para el hardware, para que cualquier usuario pueda beneficiarse de la IA multimodal en tiempo real en cualquier dispositivo.

Si te interesa colaborar con nosotros para crear la próxima generación de productos de IA en el dispositivo con Rene y Sonic On-Device, escríbenos mediante nuestro formulario de contacto: