Blog / Pesquisa

Apresentamos Sonic: voz natural com baixa latência

Karan Goel 
Apresentamos Sonic: voz natural com baixa latência

Fundamos a Cartesia para criar inteligência persistente em tempo real em todos os dispositivos, começando por uma inovação arquitetural: modelos de espaço de estados. Hoje lançamos Sonic, nosso modelo de voz que gera fala natural com baixa latência.

Construindo inteligência em tempo real

Imagine uma IA extremamente eficiente, capaz de processar contextos de qualquer tamanho, rodar em qualquer dispositivo e trabalhar nativamente com qualquer modalidade em tempo real. Uma inteligência presente em toda parte e duradoura, que conversa para nos ajudar a compreender o entorno e age de forma independente para resolver problemas complexos. Nesse mundo, todos podem acessar, controlar e executar inteligência instantânea, privada e personalizada.

Acreditamos que esse futuro exige arquiteturas fundamentalmente novas. Os modelos atuais estão longe do padrão humano. Além de compreenderem o mundo com menos detalhe, são lentos e caros, concentrando desenvolvimento e distribuição nas grandes empresas. Nem os melhores processam e analisam continuamente um ano de áudio, vídeo e texto: 1 bilhão de tokens de texto, 10 bilhões de áudio e 1 trilhão de vídeo, muito menos em um dispositivo. Não deveríamos ter acesso a inteligência barata sem mobilizar um centro de dados?

Tornar essa visão real é o trabalho de nossas vidas. Nos últimos quatro anos, nossos cofundadores Albert e Karan criaram juntos um novo paradigma, o modelo de espaço de estados, ou SSM, uma abordagem mais eficiente para modelos de IA. Ele oferece uma base para treinar modelos em tempo real que recebem informações continuamente, como os humanos. S4 e Mamba, desenvolvidos originalmente pela equipe na academia com Tri Dao, são adotados rapidamente no mundo e inspiram trabalhos em visão, robótica e biologia, além de modelos de linguagem industriais como Jamba e Zamba. Eles apontam para uma IA muito mais eficiente e acessível.

Na Cartesia, nosso foco é a eficiência da inteligência: torná-la mais rápida, barata e acessível. Construímos a plataforma para inteligência persistente em tempo real em qualquer dispositivo.

Essa inteligência terá várias formas. Nosso primeiro objetivo é uma IA conversacional em tempo real com memória duradoura. Nessa nova plataforma de computação, modelos conversam e compreendem áudio nativamente, lembram interações e agem para resolver problemas. Ela permitirá novas experiências, de jogos em tempo real a atendimento ao cliente. A seguir, mostramos os primeiros resultados.

Baixa latência para modalidades de alta resolução

A latência é um grande desafio. Modelos devem responder imediatamente a uma entrada. Avançamos em arquiteturas SSM que geram áudio e vídeo de alta resolução de forma eficiente e com baixa latência. Para começar a construir a IA conversacional, testamos e ampliamos a abordagem em fala e áudio.

Nos experimentos até agora, melhoramos simultaneamente qualidade, velocidade de inferência, vazão e latência em relação a implementações Transformer comuns para áudio. Com o mesmo número de parâmetros e uma época de treinamento no Multilingual Librispeech, um modelo Cartesia alcança perplexidade de validação 20% menor. Nas avaliações posteriores, isso resulta em metade da taxa de erro de palavras e um ponto a mais na nota de qualidade, em uma escala de cinco medida pelo NISQA. Na inferência, alcança tempo até o primeiro áudio 1,5 vez menor, fator de tempo real duas vezes menor e vazão quatro vezes maior.

Publicaremos mais detalhes da arquitetura em um relatório separado.

Sonic: geração de voz com baixa latência

Usamos essa arquitetura para treinar Sonic, lançado hoje. Ele cria fala natural de alta qualidade para qualquer voz com latência de modelo de 135 ms, a menor de sua categoria.

Construímos e otimizamos nossa própria infraestrutura de inferência SSM para servir Sonic com baixa latência e alta vazão, reduzindo os custos de modelos de qualidade. O lançamento inclui um playground web e uma API. O playground oferece uma biblioteca diversa para atendimento, entretenimento e criação de conteúdo, com clonagem instantânea e design de voz, incluindo velocidade e emoção. Tudo também está disponível pela API.

Você pode se cadastrar e experimentar. Se quiser colaborar na construção de IA conversacional em tempo real, entre em contato pelo formulário.

O que vem a seguir

Nossa agenda mais ampla é permitir que desenvolvedores e empresas criem e executem experiências multimodais em tempo real em qualquer dispositivo. Áudio é só o começo. Queremos modelos que compreendam e gerem qualquer modalidade instantaneamente. No próximo ano, levaremos inteligência nativamente multimodal em tempo real a todas as modalidades.

Também estamos preparando um lançamento open source que acreditamos ser útil para os desenvolvedores.

Estamos contratando

Se você quer ajudar a levar inteligência multimodal em tempo real a todos os dispositivos, escreva para join@cartesia.ai.