Na Cartesia, construímos o futuro da IA de voz: realista, rápida e controlável. No último ano, apoiamos milhões de chamadas e ajudamos dezenas de milhares de criadores a tornar seus conteúdos mais acessíveis.
Anunciamos nossa rodada Série A de US$ 64 milhões, liderada pela Kleiner Perkins. O investimento permitirá ampliar a equipe e financiar pesquisas para a próxima geração de modelos, infraestrutura e produtos de voz, começando pelo Sonic 2.0.
Sonic 2.0 usa nossa nova arquitetura de espaço de estados e é o modelo de voz mais rápido e controlável disponível hoje. Tem o dobro do tamanho do Sonic, mas roda mais rápido: 90 ms de latência no modelo completo e 40 ms no turbo. Em avaliações diretas às cegas com 100 vozes reservadas para teste, 1,5 vez mais pessoas preferiram Sonic 2.0 ao segundo melhor fornecedor.
Além de velocidade e qualidade, Sonic 2.0 oferece controle sem precedentes sobre a geração, com clonagem de voz de ponta que captura sotaques complexos e paisagens sonoras ricas. Também lançamos dois novos endpoints:
- Voice changer: aperfeiçoe o estilo e a voz do áudio.
- Infill: edite conteúdo dentro do áudio de forma fluida.
Estamos construindo uma plataforma de IA de voz com infraestrutura empresarial. A API Sonic foi feita para desenvolvedores e oferece uma infraestrutura de geração rápida e confiável, com 99,9% de disponibilidade e as menores latências P90 globalmente. Estamos em conformidade com SOC-2 e HIPAA e aceitamos implantação em tempo real no ambiente local e no dispositivo.
Também seguimos avançando nossa agenda de pesquisa de longo prazo. A próxima geração de modelos de áudio exigirá avanços em arquiteturas de transmissão, codecs, modelagem de contexto longo e inferência no dispositivo. Queremos compartilhar esse progresso.
Saiba mais sobre nosso trabalho em cartesia.ai/sonic. Se quiser trabalhar conosco, entre em contato.
