
Modelo TTS e voz são coisas diferentes
Um modelo TTS gera fala. Mas o modelo e a voz que ele usa são coisas diferentes. Confundi-los leva a decisões ruins no projeto de IA de voz.
[Produto]

Por que precisão e revocação importam tanto
A acurácia parece a métrica certa até seu modelo alcançar 90% sem fazer nada. Veja por que precisão e revocação contam uma história mais fiel e por que isso importa para IA de voz.
[Produto]

Apresentamos o Sonic-3.6
O Sonic-3.6 avança em naturalidade e qualidade em relação ao Sonic-3.5, com preferência dos ouvintes em até 93% dos testes cegos de comparação direta em quinze localidades.
[Produto]

Novidades no Ink-2: termos-chave e detecção de turnos configurável
Dois novos recursos do Ink-2: prompting com termos-chave, que melhora a transcrição de entidades específicas de um domínio, e detecção de turnos configurável, para priorizar velocidade ou exatidão.
[Produto]

Este modelo TTS é bom?
Uma análise prática de por que a avaliação de texto para fala perde eficácia conforme os modelos melhoram e de como medir o que realmente importa.
[Pesquisa]

Apresentamos o Ink-2: o STT nº 1 criado para agentes de voz
Apresentamos o Ink-2, nosso modelo de fala para texto criado para agentes de voz em tempo real, primeiro no ranking de streaming da Artificial Analysis, com a detecção de turnos integrada mais precisa entre os fornecedores.
[Notícias]

Guia para escolher modelos de IA de voz
Um método prático para avaliar modelos ASR, TTS e de detecção de turnos no seu caso de uso real.
[Produto]

Guia de termos de IA de voz para iniciantes
Um glossário em linguagem simples com os 20 termos essenciais para entender, avaliar e construir IA de voz conversacional.
[Produto]

Mamba-3: um modelo de espaço de estados que prioriza a inferência
O Mamba-3 adapta os modelos de espaço de estados às cargas modernas de inferência, melhorando a qualidade e preservando a baixa latência que torna os modelos lineares atraentes.
[Pesquisa]

A Cartesia está contratando uma pessoa de engenharia para formar um exército de Claudes
Escrever código parece um problema resolvido. Fazer engenharia, ainda não. Estamos contratando alguém para fechar essa lacuna.
[Engenharia]

Cartesia alcança conformidade com o GDPR
A plataforma de texto para fala da Cartesia agora está em conformidade com o GDPR, reafirmando nosso compromisso com proteção de dados, privacidade e IA responsável centrada nas pessoas.
[Notícias]

Apresentamos Line: plataforma moderna para desenvolver agentes de voz
Apresentamos Line, a plataforma da Cartesia para desenvolver agentes de voz. Criada com o código no centro, porque os melhores produtos são construídos com código.
[Produto]

Modelagem hierárquica
Apresentamos H-Nets, arquiteturas hierárquicas que aprendem diretamente de dados brutos, agrupando entradas em conceitos de nível mais alto e superando limites da tokenização.
[Pesquisa]

Apresentamos Ink: fala para texto em conversas em tempo real
Apresentamos Ink, uma família de modelos de fala para texto em streaming para aplicações de voz em tempo real. Ink-Whisper é o modelo STT mais rápido e acessível, criado para agentes de voz empresariais.
[Produto]

Apresentamos Organizações e Painéis
Criamos a Cartesia para desenvolvedores que ampliam o uso de IA de voz. Hoje, apresentamos Organizações e Painéis para facilitar a colaboração e a visibilidade.
[Produto]

Apresentamos a clonagem profissional de voz
Apresentamos a clonagem profissional de voz, ou PVC, com clones de qualidade profissional treinados no Sonic, agora disponíveis nos planos Startup e superiores.
[Produto]

SDK Python da Cartesia v2.0.0
Lançamos a versão 2.0.0 do SDK Python, aprimorando a experiência de desenvolvimento com os recursos de voz por IA da Cartesia em Python.
[Engenharia]

Cartesia entra na 7ª lista anual Enterprise Tech 30 da Wing Venture Capital
A Cartesia, uma das principais fornecedoras de modelos de áudio generativo, anunciou sua inclusão na sétima lista anual Enterprise Tech 30, que reúne empresas privadas de tecnologia empresarial promissoras em diferentes estágios.
[Notícias]

Série A e o futuro da IA de voz
Anunciamos nossa Série A de US$ 64 milhões, liderada pela Kleiner Perkins. O investimento ajudará a ampliar a equipe e pesquisar a próxima geração de modelos.
[Notícias]

Llamba: escalando modelos recorrentes destilados para processamento eficiente de linguagem
Os próximos anos darão início a uma nova era de IA no dispositivo. Esses modelos vão alimentar uma ampla variedade de aplicações.
[Pesquisa]

Como criar um agente de voz com IA usando a Cartesia
Um guia passo a passo para criar um agente de voz natural e de baixa latência com o Sonic da Cartesia, da arquitetura à implantação em produção.
[Engenharia]

O estado da IA de voz em 2024
Em nosso primeiro relatório sobre o estado da IA de voz em 2024, destacamos avanços de infraestrutura e novos casos de uso que impulsionam o setor, além das perspectivas para 2025.
[Pesquisa]

Anunciamos nossa rodada seed
Anunciamos nossa rodada seed de $27M, liderada pela Index Ventures com participação de Lightspeed, Factory, Conviction, General Catalyst, A*, SV Angel e 90 investidores-anjo.
[Notícias]

É temporada de hackathons na Cartesia
Outubro de 2024 foi movimentado na Cartesia. Reunimos mais de 2.000 desenvolvedores em São Francisco e distribuímos US$ 20.000 em prêmios para ideias inovadoras criadas com Sonic.
[Engenharia]

Apresentamos o Voice Changer: transforme o áudio do seu jeito
O Voice Changer transforma a voz de qualquer trecho de áudio e preserva a interpretação, a emoção e a prosódia originais, com vozes de estúdio ou clones.
[Produto]

Mais oito idiomas no Sonic Multilingual
Anunciamos a versão alfa de mais oito idiomas no Sonic Multilingual: hindi, italiano, coreano, holandês, polonês, russo, sueco e turco.
[Produto]

Novidades sobre inteligência no dispositivo
Na Cartesia, nossa missão é construir a próxima geração de IA: inteligência presente em todo lugar, interativa e disponível onde você estiver.
[Pesquisa]

Apresentamos Sonic: voz natural com baixa latência
Hoje lançamos Sonic, nosso modelo de voz que gera fala natural com baixa latência.
[Pesquisa]

Based: modelos de linguagem simples com atenção linear equilibram recuperação e vazão
O Based processa prompts 56% e 44% mais rápido que FlashAttention-2 e Mamba, respectivamente. Sua vazão de geração de texto é 24x maior que a do FlashAttention-2.
[Pesquisa]

Mamba-3B-SlimPJ: modelos de espaço de estados à altura dos melhores Transformers
Lançamos Mamba-3B-SlimPJ, nosso modelo de linguagem Mamba mais forte até agora, em parceria com Cartesia e Together, sob a licença Apache 2.0.
[Pesquisa]
Comece hoje
Fale com um especialista.
Converse com alguém da nossa equipe e descubra como a Cartesia pode ajudar você a criar experiências de voz de alto nível.
Comece a criar.
Acesse nossos modelos por API e coloque um agente de voz em produção em minutos.
