Cartesia e Deepgram

A Cartesia mantém uma dispersão de latência menor que qualquer um dos modelos Deepgram.

O interlocutor ouve os turnos lentos, não a média.

2X Solutions logo
arini logo
toby logo

Consistência da latência

As chamadas mais lentas do Sonic 3.5 ficam próximas das mais rápidas

  • Uma média esconde as chamadas que interrompem uma conversa. A dispersão é o que o interlocutor realmente percebe.
  • A chamada mais lenta medida do Sonic 3.5 fica abaixo de meio segundo. Os dois modelos Deepgram ultrapassam esse limite.

Variação da latência: distribuição dos valores de TTFA

Menor é melhor

Covalagosto 2026
0ms100ms200ms300ms400ms500ms600ms700ms800ms
Sonic 3.5
Cartesia
Aura-2
Deepgram
Flux
Deepgram
Leia as medições de latência

Tempo até o primeiro áudio em milissegundos. A caixa abrange os 50% centrais das solicitações; a linha marca a mediana. As hastes não representam mínimos ou máximos absolutos.

  • Sonic 3.5: mediana de 267 ms; 50% centrais entre 234 e 297 ms; hastes entre 140 e 391 ms.
  • Aura-2: mediana de 304 ms; 50% centrais entre 213 e 424 ms; hastes entre 93 e 740 ms.
  • Flux: mediana de 245 ms; 50% centrais entre 201 e 500 ms; hastes entre 100 e 658 ms.

Latência de cauda

A Cartesia fica à frente onde mais importa

  • O P95 é o turno que um em cada vinte interlocutores enfrenta, determinando com que frequência a conversa para.
  • O Sonic 3.5 responde mais rápido que os dois modelos Deepgram nesse percentil e é o único dos três cuja dispersão permanece pequena o suficiente para ser previsível.

Latência no P95

Menor é melhor

Covalagosto 2026
370ms
547ms
590ms
Sonic 3.5
Cartesia
Aura-2
Deepgram
Flux
Deepgram

Precisão

O Sonic 3.6 comete menos erros de palavras que os dois modelos Deepgram

  • A Coval transcreve cada clipe gerado por cada modelo e o compara com o roteiro: uma taxa menor significa que mais do roteiro é falado como escrito.
  • O Sonic 3.6 lê menos palavras incorretamente que Flux e Aura-2, mantendo nomes, números e códigos como escritos.

Taxa de erro de palavras

Menor é melhor

Covalsetembro 2026
1.99%
2.2%
2.78%
Sonic 3.6
Cartesia
Flux
Deepgram
Aura-2
Deepgram

Por que as empresas escolhem a Cartesia em vez da Deepgram

CartesiaDeepgram
  1. Consistência

    Coval
    Cartesia
    Intervalo interquartil de 63ms
    Deepgram
    Intervalo interquartil de 211msAura-2Intervalo interquartil de 300msFlux

    agosto 2026

  2. Precisão

    Coval
    Cartesia
    Taxa de erro de palavras de 1.99%Sonic 3.6
    Deepgram
    Taxa de erro de palavras de 2.20%FluxTaxa de erro de palavras de 2.78%Aura-2

    setembro 2026

  3. Idiomas

    Cartesia
    44 idiomas em um único modelo, com sotaques ajustados por região
    Deepgram
    7 idiomas
  4. Variedade de vozes

    Cartesia
    Biblioteca de vozes completa, clone instantâneo com 10 segundos, clone profissional com 30 minutos
    Deepgram
    88 vozes predefinidas
  5. Implantação

    Cartesia
    VPC, implantação local, no dispositivo ou em rede isolada, com SLA de disponibilidade de 99.9%
    Deepgram
    A hospedagem própria exige um plano Enterprise

Perguntas frequentes

A qualidade de voz da Cartesia é avaliada de forma independente?

Sim. O Sonic 3.6 ocupa o primeiro lugar entre os 94 modelos da Artificial Analysis Provider Voice Arena, um teste de escuta às cegas em que os ouvintes comparam dois clipes sem saber qual modelo gerou cada um. Também ocupa o primeiro lugar na Controlled Voice Arena, que fornece a todos os modelos o mesmo conjunto de vozes clonadas.

Como a latência desta página é medida?

A Coval é uma plataforma de avaliação independente que chama a API pública de cada fornecedor e publica a distribuição completa dos resultados, em vez de um único número de destaque. Os dados aqui vêm de 478 execuções da Cartesia e 951 da Deepgram entre Aura-2 e Flux, medidas no mesmo período.

Por que a dispersão importa mais que a média?

Um interlocutor nunca vivencia uma média. Ele vivencia o turno atual. Um modelo geralmente rápido, mas às vezes lento, produz chamadas nas quais a pessoa começa a falar por cima do agente, e são essas chamadas que acabam abandonadas. Manter os tempos mais lentos próximos dos mais rápidos faz a interação com um agente de voz parecer uma conversa.

Posso executar a Cartesia na minha própria infraestrutura?

Sim. A Cartesia oferece implantação local e em redes isoladas, usadas por equipes de saúde, finanças e governo para manter o áudio na própria rede, com SLA de disponibilidade de 99.9%.

Quanto tempo leva para migrar da Deepgram?

Uma a duas semanas para a maioria das equipes. A Cartesia está integrada às principais plataformas de agentes de voz e todos os modelos estão na API pública. Assim, não é preciso adotar outra plataforma nem desfazer essa dependência depois.

Comece hoje

Fale com um especialista.

Converse com alguém da nossa equipe e descubra como a Cartesia pode ajudar você a criar experiências de voz de alto nível.

Fale com vendas

Comece a criar.

Acesse nossos modelos por API e coloque um agente de voz em produção em minutos.

Experimente a Cartesia