Blog / Notícias

Anunciamos nossa rodada seed

Karan Goel 
Anunciamos nossa rodada seed

Anunciamos nossa rodada seed de $27M, liderada pela Index Ventures com participação de Lightspeed, Factory, Conviction, General Catalyst, A*, SV Angel e 90 investidores-anjo.

Na Cartesia, nossa missão é construir inteligência em tempo real com memória de longo prazo, disponível onde você estiver. A inteligência artificial passou por uma transformação extraordinária com a ampliação dos modelos Transformer. Porém, esses modelos têm limitações importantes. Só conseguem processar e gerar pequenas quantidades de informação por vez, como minutos de áudio ou segundos de vídeo. Não preservam estado entre interações de forma eficiente e são caros demais para rodar em tempo real na maioria dos hardwares. A próxima geração de IA exigirá inovação nas arquiteturas fundamentais da inteligência.

Nos últimos anos, fomos pioneiros em avanços de arquitetura, como S4 e Mamba, para concretizar essa visão. Essas novas arquiteturas têm propriedades importantes. Seu custo computacional cresce linearmente com o comprimento da sequência, em vez de quadraticamente. Elas aprendem a comprimir sequências longas de dados em um estado de tamanho fixo e oferecem inferência rápida e eficiente.

Estamos traçando um caminho para modelos capazes de receber continuamente grandes volumes de contexto sobre o mundo, comprimi-los em memória de trabalho e gerar conteúdo em várias modalidades, em tempo real, em um dispositivo perto de você.

Uma parte central da nossa missão é levar esses modelos avançados aos clientes que estão construindo o futuro das aplicações de IA em tempo real. Neste ano, lançamos o Sonic, o modelo mais rápido de geração de voz hiper-realista, e o levamos ao dispositivo. Milhares de clientes, de criadores independentes e startups a grandes empresas, usam o Sonic em produção para alimentar a próxima geração de agentes de voz, mídia digital e assistentes.

Construir modelos generativos de contexto longo para sinais multimodais ricos, como áudio e vídeo, continua sendo difícil. Os modelos são difíceis de controlar e perdem o rumo rapidamente. Nos últimos meses, criamos uma nova arquitetura SSM para modelos de múltiplos fluxos, que raciocinam e geram continuamente sobre vários fluxos de dados de diferentes modalidades em paralelo. Isso permite treinar modelos de ponta a ponta com inferência em streaming altamente eficiente e controle sem precedentes entre modalidades.

Treinamos um modelo de geração de voz de ponta a ponta com essa arquitetura de múltiplos fluxos. Ele permite controlar o texto com precisão para evitar alucinações, mantendo o realismo incomparável da geração de ponta a ponta. Isso representa uma melhora fundamental em relação às arquiteturas anteriores de geração de áudio de ponta a ponta, que podem ter dificuldade para seguir transcrições complexas, longas e repetitivas. Esse avanço é importante para todos os nossos usuários, especialmente para quem cria agentes de voz que precisam ser exatos. Veja alguns exemplos, com as transcrições no idioma original das gravações:

Are you available at any of the following times? 10:00am, 10:05am, 10:10am, 10:15am, 10:20am, 10:25am, 10:30am, 10:35am, 10:40am, 10:45am, 10:50am, or 10:55am?

My phone number is 8888888888.

My email address is HELLOWORLD at CARTESIA dot AI

How much wood could a woodchuck chuck if a woodchuck could chuck wood? A woodchuck would chuck as much wood as a woodchuck could chuck if a woodchuck could chuck wood.

Você já pode experimentar o novo modelo no playground, como Sonic Preview. Ele estará disponível pela nossa API em tempo real nas próximas semanas.

Continuamos ampliando nossas arquiteturas SSM de múltiplos fluxos para várias modalidades de entrada e saída. Temos um plano ambicioso para entregar a próxima geração de IA multimodal em tempo real. Se nosso trabalho desperta seu interesse, considere fazer parte da equipe.