Blog / Notícias

Série A e o futuro da IA de voz

Karan Goel 
Série A e o futuro da IA de voz

Na Cartesia, construímos o futuro da IA de voz: realista, rápida e controlável. No último ano, apoiamos milhões de chamadas e ajudamos dezenas de milhares de criadores a tornar seus conteúdos mais acessíveis.

Anunciamos nossa rodada Série A de US$ 64 milhões, liderada pela Kleiner Perkins. O investimento permitirá ampliar a equipe e financiar pesquisas para a próxima geração de modelos, infraestrutura e produtos de voz, começando pelo Sonic 2.0.

Sonic 2.0 usa nossa nova arquitetura de espaço de estados e é o modelo de voz mais rápido e controlável disponível hoje. Tem o dobro do tamanho do Sonic, mas roda mais rápido: 90 ms de latência no modelo completo e 40 ms no turbo. Em avaliações diretas às cegas com 100 vozes reservadas para teste, 1,5 vez mais pessoas preferiram Sonic 2.0 ao segundo melhor fornecedor.

Além de velocidade e qualidade, Sonic 2.0 oferece controle sem precedentes sobre a geração, com clonagem de voz de ponta que captura sotaques complexos e paisagens sonoras ricas. Também lançamos dois novos endpoints:

  • Voice changer: aperfeiçoe o estilo e a voz do áudio.
  • Infill: edite conteúdo dentro do áudio de forma fluida.

Estamos construindo uma plataforma de IA de voz com infraestrutura empresarial. A API Sonic foi feita para desenvolvedores e oferece uma infraestrutura de geração rápida e confiável, com 99,9% de disponibilidade e as menores latências P90 globalmente. Estamos em conformidade com SOC-2 e HIPAA e aceitamos implantação em tempo real no ambiente local e no dispositivo.

Também seguimos avançando nossa agenda de pesquisa de longo prazo. A próxima geração de modelos de áudio exigirá avanços em arquiteturas de transmissão, codecs, modelagem de contexto longo e inferência no dispositivo. Queremos compartilhar esse progresso.

Saiba mais sobre nosso trabalho em cartesia.ai/sonic. Se quiser trabalhar conosco, entre em contato.