Na Cartesia, nossa missão é construir a próxima geração de IA, com inteligência presente em todo lugar, interativa e disponível onde você estiver. Nossos modelos e nossa plataforma permitem que desenvolvedores criem sistemas de IA multimodais em tempo real, começando por nossos avanços em áudio e pelo Sonic, a API de voz generativa mais rápida do mundo. Hoje, anunciamos o primeiro marco da nossa jornada para levar inteligência a todos os dispositivos.
Acreditamos que a inteligência artificial precisa ser tão eficiente que possa, no futuro, se desvincular dos data centers. Isso coloca modelos capazes em todos os dispositivos e permite construir aplicações que respeitam nossa privacidade e interagem rapidamente com o mundo em volumes e velocidades que hoje parecem impossíveis. Agentes, assistentes pessoais, robótica, jogos, saúde, transporte, defesa e segurança são algumas das áreas que essa tecnologia vai transformar.
Nos últimos anos, fomos pioneiros em uma nova arquitetura de IA chamada modelos de espaço de estados, ou SSMs. Em comparação com as arquiteturas de atenção amplamente usadas, os SSMs são muito eficientes. Seus custos crescem de forma quase linear com o comprimento da sequência, em vez de quadrática. Acreditamos que os SSMs terão um papel essencial no avanço da IA e permitirão criar modelos fundamentais em tempo real, com memória de longo prazo e baixa latência, que rodam em qualquer dispositivo. Vamos continuar desenvolvendo essa tecnologia inicial nos próximos anos enquanto avançamos em direção aos nossos objetivos.
Agora, estamos levando os modelos de espaço de estados para o seu dispositivo. Neste lançamento, anunciamos:
- Edge, uma biblioteca de código aberto, com licença Apache 2.0, para apoiar a pesquisa e o lançamento de SSMs altamente eficientes em aplicações no dispositivo, em diferentes aceleradores e ambientes. O Edge reúne modelos de linguagem SSM de pesos abertos, incluindo o Rene, e os disponibiliza para hardware Apple por meio de nossos novos kernels Metal otimizados para SSMs.
- Rene, um modelo de linguagem de código aberto com 1.3B parâmetros, pré-treinado do zero com uma estrutura SSM híbrida Mamba-2 e adaptado à inferência no dispositivo.
- Sonic On-Device, em beta privado. É o primeiro modelo de voz generativa ultrarrealista que oferece transmissão em tempo real com baixa latência no dispositivo, com vozes ilimitadas e clonagem instantânea de voz.
Juntos, esses três lançamentos representam um marco no nosso objetivo de criar arquiteturas de modelos e plataformas radicalmente novas, que rompam com as exigências de computação dos sistemas atuais. Se você quer colaborar conosco para construir a próxima geração de produtos de IA no dispositivo com Rene e Sonic On-Device, entre em contato pelo nosso formulário de contato.
Inteligência no dispositivo
A tendência predominante na IA é criar modelos fundamentais cada vez maiores. Essa área continuará crescendo com mais investimentos e pesquisa e desenvolvimento. Esses grandes modelos são feitos para data centers que consomem muita computação e energia, longe de onde são usados.
E se seguirmos na direção oposta? Muitos casos de uso se tornarão possíveis quando modelos “grandes o suficiente” forem implantados na borda, ou no próprio dispositivo.
Essa abordagem tem vantagens específicas em relação a um grande modelo que roda na nuvem e é acessado por API.
- A transferência de dados é mínima, permitindo que as aplicações transmitam continuamente dados multimodais de alta resolução para os modelos, por exemplo, para compreensão de áudio e vídeo.
- A latência de rede é eliminada, permitindo níveis de latência e confiabilidade da aplicação que seriam impossíveis de alcançar de outra forma.
- A conexão de rede deixa de ser necessária. Os modelos podem funcionar em ambientes com conectividade ruim, requisitos elevados de segurança ou que não toleram quedas de rede.
- As implantações são totalmente privadas e seguras, sem sair dos limites físicos do hardware.
A IA no dispositivo permite novas aplicações que processam o ambiente e respondem a ele continuamente, em tempo real. Alguns dos casos de uso que queremos explorar são:
- Assistentes: transformar qualquer dispositivo em um assistente pessoal que ajuda os usuários de forma proativa e faz sugestões.
- Comunicação: traduzir instantaneamente entre idiomas, no estilo do Babelfish, onde você estiver.
- Segurança: identificar anomalias e eventos relevantes em câmeras de vídeo e tomar medidas.
- Saúde: conversar com pacientes de forma privada durante atendimentos.
- Educação: gerar conteúdo em um iPad para criar materiais educativos personalizados para os alunos, com segurança e privacidade.
- Robôs: perceber mudanças rápidas no ambiente e agir com velocidade e confiabilidade.
- Jogos: gerar e controlar vídeo em um PC para criar jogos totalmente generativos.
Embora esses casos de uso possam começar com protótipos na nuvem, a melhor experiência exigirá uma mudança para a computação na borda ou no dispositivo.
Novas arquiteturas de modelos serão a chave para implantações mais rápidas, com menor latência e maior eficiência na borda. Acreditamos que os modelos de espaço de estados serão uma tecnologia central para viabilizar modelos fundamentais eficientes em energia e computação que rodam na borda. Estes são nossos primeiros lançamentos nessa jornada.
Edge: uma biblioteca de código aberto para SSMs no dispositivo
Um dos nossos principais objetivos na Cartesia é encontrar novas formas de levar modelos eficientes e de alta qualidade a desenvolvedores e usuários. Por isso, estamos abrindo o código do Edge, nossa biblioteca para desenvolver modelos no dispositivo com SSMs. No Edge, vamos desenvolver nossos modelos de código aberto para vários dispositivos, começando pelos chips da série M da Apple. A biblioteca inclui kernels Metal personalizados para Mamba-2, reutilizáveis em notebooks e dispositivos móveis. Para facilitar o desenvolvimento e os testes locais, também lançamos cartesia-mlx, um pacote Python para desenvolver sobre o Edge no Apple MLX. O Edge oferece suporte integrado à inferência otimizada, incluindo integrações com kernels Metal, quantização de camadas e outros recursos.
Disponibilidade. Todos os modelos Mamba-2 oficiais, incluindo Rene, já estão disponíveis no Edge. Acompanhe os próximos lançamentos da nossa equipe e da comunidade!
Rene: um modelo de linguagem SSM de código aberto com 1.3B parâmetros
Rene é um modelo de linguagem pequeno, ou SLM, projetado para uso altamente eficiente no dispositivo. Com 1.3B parâmetros, é um SLM híbrido composto de camadas alternadas de Mamba-2 e MLP, intercaladas com algumas camadas de atenção de janela deslizante, ou SWA. O Rene foi treinado com 1.5T tokens do conjunto de dados público Dolma-1.7, disponibilizado pela AllenAI.
Eficiência em primeiro lugar. Com Mamba-2 e SWA, o Rene mantém um uso fixo de memória durante a inferência. Isso é essencial para rodar de forma confiável em ambientes com recursos limitados, como dispositivos de computação pessoal. As camadas Mamba-2 permitem tempos de processamento inicial, ou prefill, menores que os de outras arquiteturas baseadas apenas em SSMs.
Avaliação. Comparamos o Rene a vários SLMs recentes de código aberto em benchmarks padrão de modelagem de linguagem, usando o LM Evaluation Harness. Esses benchmarks incluem raciocínio de senso comum, com COPA, WinoGrande, ARC-Easy e ARC-Challenge, e compreensão de linguagem, com PIQA, HellaSwag, OpenBookQA e MMLU. O Rene também supera SLMs como OpenELM da Apple, com 1.1B parâmetros, e recurrent Gemma do Google, com 2B, como mostra a Figura 1. É o primeiro SLM baseado em arquitetura recorrente a alcançar desempenho semelhante ao de SLMs de ponta de tamanho comparável, com ≤2B parâmetros, nesses benchmarks.

No dispositivo. O Edge oferece suporte nativo ao Rene no MLX, sem perda de qualidade em relação à implementação em PyTorch. Também permite quantização de 8 bits e 4 bits para inferência mais rápida, sem perda de qualidade, como mostra a Figura 2.

Beta privado do Sonic On-Device
Desde o lançamento, a adoção do Sonic em assistentes, agentes conversacionais, jogos, educação e dublagem tem nos surpreendido. Recebemos muitos pedidos para disponibilizá-lo no dispositivo, por questões de latência, privacidade e disponibilidade.
Como parte desta atualização, anunciamos o lançamento do Sonic On-Device em beta privado. É o primeiro modelo de voz generativa ultrarrealista com transmissão em tempo real e baixa latência no dispositivo. Ele oferece todas as capacidades do Sonic, incluindo clonagem instantânea e controle de pronúncia, velocidade e emoção. Queremos trabalhar com desenvolvedores e empresas para construir a próxima geração de aplicações de fala no dispositivo, incluindo assistentes pessoais, tradução e dublagem em tempo real.
Conclusão
Rene, Edge e Sonic On-Device são o início da nossa jornada para construir inteligência multimodal em tempo real para todos os dispositivos. Na Cartesia, acreditamos que um futuro em que a IA no dispositivo seja a norma exige uma mudança na forma como pensamos sobre arquiteturas de modelos e aprendizado de máquina. Vamos continuar construindo a próxima geração de modelos e plataformas otimizados para hardware, para que qualquer pessoa, em qualquer dispositivo, possa usar IA multimodal em tempo real.
Se você quer colaborar conosco para construir a próxima geração de produtos de IA no dispositivo com Rene e Sonic On-Device, entre em contato pelo nosso formulário de contato:
