Diagrama que mostra o modelo TTS e a voz como entradas separadas

Modelo TTS e voz são coisas diferentes

Um modelo TTS gera fala. Mas o modelo e a voz que ele usa são coisas diferentes. Confundi-los leva a decisões ruins no projeto de IA de voz.

[Produto]

Uma grade 2x2 de quadrados, três em aquarela verde-sálvia e cinza-claro e um com contorno preto

Por que precisão e revocação importam tanto

A acurácia parece a métrica certa até seu modelo alcançar 90% sem fazer nada. Veja por que precisão e revocação contam uma história mais fiel e por que isso importa para IA de voz.

[Produto]

Uma folha de papel desenhada à mão sobre um balão de fala em aquarela verde marcado com 3.6

Apresentamos o Sonic-3.6

O Sonic-3.6 avança em naturalidade e qualidade em relação ao Sonic-3.5, com preferência dos ouvintes em até 93% dos testes cegos de comparação direta em quinze localidades.

[Produto]

Nomes difíceis de transcrever, como enclomiphene, zuclopenthixol e pityriasis, fazem uma curva em torno de um microfone, com aminophylline em foco ao lado

Novidades no Ink-2: termos-chave e detecção de turnos configurável

Dois novos recursos do Ink-2: prompting com termos-chave, que melhora a transcrição de entidades específicas de um domínio, e detecção de turnos configurável, para priorizar velocidade ou exatidão.

[Produto]

Este modelo TTS é bom?

Este modelo TTS é bom?

Uma análise prática de por que a avaliação de texto para fala perde eficácia conforme os modelos melhoram e de como medir o que realmente importa.

[Pesquisa]

Uma pergunta falada entra em espiral, palavra por palavra, em um microfone, representando a transcrição de fala para texto

Apresentamos o Ink-2: o STT nº 1 criado para agentes de voz

Apresentamos o Ink-2, nosso modelo de fala para texto criado para agentes de voz em tempo real, primeiro no ranking de streaming da Artificial Analysis, com a detecção de turnos integrada mais precisa entre os fornecedores.

[Notícias]

Uma roseta de pétalas verdes translúcidas sobrepostas, com três círculos contornados que se cruzam no centro

Guia para escolher modelos de IA de voz

Um método prático para avaliar modelos ASR, TTS e de detecção de turnos no seu caso de uso real.

[Produto]

Seis estudos em aquarela verde, cada um combinando blocos pintados com um retângulo desenhado à mão em uma composição diferente

Guia de termos de IA de voz para iniciantes

Um glossário em linguagem simples com os 20 termos essenciais para entender, avaliar e construir IA de voz conversacional.

[Produto]

Linhas escuras paralelas atravessam uma faixa verde da esquerda para a direita, entrelaçando-se no centro antes de continuar

Mamba-3: um modelo de espaço de estados que prioriza a inferência

O Mamba-3 adapta os modelos de espaço de estados às cargas modernas de inferência, melhorando a qualidade e preservando a baixa latência que torna os modelos lineares atraentes.

[Pesquisa]

Quatro cópias do mesmo símbolo de linha em laço, lado a lado, em verde-claro, verde médio, cinza e verde-escuro

A Cartesia está contratando uma pessoa de engenharia para formar um exército de Claudes

Escrever código parece um problema resolvido. Fazer engenharia, ainda não. Estamos contratando alguém para fechar essa lacuna.

[Engenharia]

Marca Cartesia acima da frase agora em conformidade com o GDPR, ao lado de um círculo de estrelas âmbar da União Europeia

Cartesia alcança conformidade com o GDPR

A plataforma de texto para fala da Cartesia agora está em conformidade com o GDPR, reafirmando nosso compromisso com proteção de dados, privacidade e IA responsável centrada nas pessoas.

[Notícias]

Quadrados verdes translúcidos em aquarela, empilhados em ângulos leves, com sobreposições mais escuras no centro

Apresentamos Line: plataforma moderna para desenvolver agentes de voz

Apresentamos Line, a plataforma da Cartesia para desenvolver agentes de voz. Criada com o código no centro, porque os melhores produtos são construídos com código.

[Produto]

Três fileiras de blocos em aquarela verde e contornos desenhados à mão, mais largos e escuros no topo e mais estreitos e claros embaixo

Modelagem hierárquica

Apresentamos H-Nets, arquiteturas hierárquicas que aprendem diretamente de dados brutos, agrupando entradas em conceitos de nível mais alto e superando limites da tokenização.

[Pesquisa]

Apresentamos Ink: fala para texto em conversas em tempo real

Apresentamos Ink: fala para texto em conversas em tempo real

Apresentamos Ink, uma família de modelos de fala para texto em streaming para aplicações de voz em tempo real. Ink-Whisper é o modelo STT mais rápido e acessível, criado para agentes de voz empresariais.

[Produto]

Apresentamos Organizações e Painéis

Apresentamos Organizações e Painéis

Criamos a Cartesia para desenvolvedores que ampliam o uso de IA de voz. Hoje, apresentamos Organizações e Painéis para facilitar a colaboração e a visibilidade.

[Produto]

Apresentamos a clonagem profissional de voz

Apresentamos a clonagem profissional de voz

Apresentamos a clonagem profissional de voz, ou PVC, com clones de qualidade profissional treinados no Sonic, agora disponíveis nos planos Startup e superiores.

[Produto]

SDK Python da Cartesia v2.0.0

SDK Python da Cartesia v2.0.0

Lançamos a versão 2.0.0 do SDK Python, aprimorando a experiência de desenvolvimento com os recursos de voz por IA da Cartesia em Python.

[Engenharia]

Cartesia entra na 7ª lista anual Enterprise Tech 30 da Wing Venture Capital

Cartesia entra na 7ª lista anual Enterprise Tech 30 da Wing Venture Capital

A Cartesia, uma das principais fornecedoras de modelos de áudio generativo, anunciou sua inclusão na sétima lista anual Enterprise Tech 30, que reúne empresas privadas de tecnologia empresarial promissoras em diferentes estágios.

[Notícias]

Série A e o futuro da IA de voz

Série A e o futuro da IA de voz

Anunciamos nossa Série A de US$ 64 milhões, liderada pela Kleiner Perkins. O investimento ajudará a ampliar a equipe e pesquisar a próxima geração de modelos.

[Notícias]

Llamba: escalando modelos recorrentes destilados para processamento eficiente de linguagem

Llamba: escalando modelos recorrentes destilados para processamento eficiente de linguagem

Os próximos anos darão início a uma nova era de IA no dispositivo. Esses modelos vão alimentar uma ampla variedade de aplicações.

[Pesquisa]

Como criar um agente de voz com IA usando a Cartesia

Como criar um agente de voz com IA usando a Cartesia

Um guia passo a passo para criar um agente de voz natural e de baixa latência com o Sonic da Cartesia, da arquitetura à implantação em produção.

[Engenharia]

O estado da IA de voz em 2024

O estado da IA de voz em 2024

Em nosso primeiro relatório sobre o estado da IA de voz em 2024, destacamos avanços de infraestrutura e novos casos de uso que impulsionam o setor, além das perspectivas para 2025.

[Pesquisa]

Anunciamos nossa rodada seed

Anunciamos nossa rodada seed

Anunciamos nossa rodada seed de $27M, liderada pela Index Ventures com participação de Lightspeed, Factory, Conviction, General Catalyst, A*, SV Angel e 90 investidores-anjo.

[Notícias]

É temporada de hackathons na Cartesia

É temporada de hackathons na Cartesia

Outubro de 2024 foi movimentado na Cartesia. Reunimos mais de 2.000 desenvolvedores em São Francisco e distribuímos US$ 20.000 em prêmios para ideias inovadoras criadas com Sonic.

[Engenharia]

Apresentamos o Voice Changer: transforme o áudio do seu jeito

Apresentamos o Voice Changer: transforme o áudio do seu jeito

O Voice Changer transforma a voz de qualquer trecho de áudio e preserva a interpretação, a emoção e a prosódia originais, com vozes de estúdio ou clones.

[Produto]

Mais oito idiomas no Sonic Multilingual

Mais oito idiomas no Sonic Multilingual

Anunciamos a versão alfa de mais oito idiomas no Sonic Multilingual: hindi, italiano, coreano, holandês, polonês, russo, sueco e turco.

[Produto]

Novidades sobre inteligência no dispositivo

Novidades sobre inteligência no dispositivo

Na Cartesia, nossa missão é construir a próxima geração de IA: inteligência presente em todo lugar, interativa e disponível onde você estiver.

[Pesquisa]

Apresentamos Sonic: voz natural com baixa latência

Apresentamos Sonic: voz natural com baixa latência

Hoje lançamos Sonic, nosso modelo de voz que gera fala natural com baixa latência.

[Pesquisa]

Based: modelos de linguagem simples com atenção linear equilibram recuperação e vazão

Based: modelos de linguagem simples com atenção linear equilibram recuperação e vazão

O Based processa prompts 56% e 44% mais rápido que FlashAttention-2 e Mamba, respectivamente. Sua vazão de geração de texto é 24x maior que a do FlashAttention-2.

[Pesquisa]

Mamba-3B-SlimPJ: modelos de espaço de estados à altura dos melhores Transformers

Mamba-3B-SlimPJ: modelos de espaço de estados à altura dos melhores Transformers

Lançamos Mamba-3B-SlimPJ, nosso modelo de linguagem Mamba mais forte até agora, em parceria com Cartesia e Together, sob a licença Apache 2.0.

[Pesquisa]

Comece hoje

Fale com um especialista.

Converse com alguém da nossa equipe e descubra como a Cartesia pode ajudar você a criar experiências de voz de alto nível.

Fale com vendas

Comece a criar.

Acesse nossos modelos por API e coloque um agente de voz em produção em minutos.

Experimente a Cartesia