Cartesia e Deepgram
A Cartesia mantém uma dispersão de latência menor que qualquer um dos modelos Deepgram.
O interlocutor ouve os turnos lentos, não a média.


Consistência da latência
As chamadas mais lentas do Sonic 3.5 ficam próximas das mais rápidas
- Uma média esconde as chamadas que interrompem uma conversa. A dispersão é o que o interlocutor realmente percebe.
- A chamada mais lenta medida do Sonic 3.5 fica abaixo de meio segundo. Os dois modelos Deepgram ultrapassam esse limite.
Variação da latência: distribuição dos valores de TTFA
Menor é melhor
Leia as medições de latência
Tempo até o primeiro áudio em milissegundos. A caixa abrange os 50% centrais das solicitações; a linha marca a mediana. As hastes não representam mínimos ou máximos absolutos.
- Sonic 3.5: mediana de 267 ms; 50% centrais entre 234 e 297 ms; hastes entre 140 e 391 ms.
- Aura-2: mediana de 304 ms; 50% centrais entre 213 e 424 ms; hastes entre 93 e 740 ms.
- Flux: mediana de 245 ms; 50% centrais entre 201 e 500 ms; hastes entre 100 e 658 ms.
Latência de cauda
A Cartesia fica à frente onde mais importa
- O P95 é o turno que um em cada vinte interlocutores enfrenta, determinando com que frequência a conversa para.
- O Sonic 3.5 responde mais rápido que os dois modelos Deepgram nesse percentil e é o único dos três cuja dispersão permanece pequena o suficiente para ser previsível.
Latência no P95
Menor é melhor
Precisão
O Sonic 3.6 comete menos erros de palavras que os dois modelos Deepgram
- A Coval transcreve cada clipe gerado por cada modelo e o compara com o roteiro: uma taxa menor significa que mais do roteiro é falado como escrito.
- O Sonic 3.6 lê menos palavras incorretamente que Flux e Aura-2, mantendo nomes, números e códigos como escritos.
Taxa de erro de palavras
Menor é melhor
Por que as empresas escolhem a Cartesia em vez da Deepgram
Consistência
Em escala, a variação da latência importa mais que a média.
CartesiaIntervalo interquartil de 63msDeepgramIntervalo interquartil de 211msAura-2Intervalo interquartil de 300msFluxagosto 2026
Precisão
Se nomes, números e termos são falados como escritos.
CartesiaTaxa de erro de palavras de 1.99%Sonic 3.6DeepgramTaxa de erro de palavras de 2.20%FluxTaxa de erro de palavras de 2.78%Aura-2setembro 2026
Idiomas
Compreensão e confiança para uma base global de clientes.
Cartesia44 idiomas em um único modelo, com sotaques ajustados por regiãoDeepgram7 idiomasVariedade de vozes
Até onde o catálogo atende antes de você precisar da sua própria voz.
CartesiaBiblioteca de vozes completa, clone instantâneo com 10 segundos, clone profissional com 30 minutosDeepgram88 vozes predefinidasImplantação
Determina se equipes de setores regulamentados podem usar a solução.
CartesiaVPC, implantação local, no dispositivo ou em rede isolada, com SLA de disponibilidade de 99.9%DeepgramA hospedagem própria exige um plano Enterprise
Perguntas frequentes
A qualidade de voz da Cartesia é avaliada de forma independente?
Sim. O Sonic 3.6 ocupa o primeiro lugar entre os 94 modelos da Artificial Analysis Provider Voice Arena, um teste de escuta às cegas em que os ouvintes comparam dois clipes sem saber qual modelo gerou cada um. Também ocupa o primeiro lugar na Controlled Voice Arena, que fornece a todos os modelos o mesmo conjunto de vozes clonadas.
Como a latência desta página é medida?
A Coval é uma plataforma de avaliação independente que chama a API pública de cada fornecedor e publica a distribuição completa dos resultados, em vez de um único número de destaque. Os dados aqui vêm de 478 execuções da Cartesia e 951 da Deepgram entre Aura-2 e Flux, medidas no mesmo período.
Por que a dispersão importa mais que a média?
Um interlocutor nunca vivencia uma média. Ele vivencia o turno atual. Um modelo geralmente rápido, mas às vezes lento, produz chamadas nas quais a pessoa começa a falar por cima do agente, e são essas chamadas que acabam abandonadas. Manter os tempos mais lentos próximos dos mais rápidos faz a interação com um agente de voz parecer uma conversa.
Posso executar a Cartesia na minha própria infraestrutura?
Sim. A Cartesia oferece implantação local e em redes isoladas, usadas por equipes de saúde, finanças e governo para manter o áudio na própria rede, com SLA de disponibilidade de 99.9%.
Quanto tempo leva para migrar da Deepgram?
Uma a duas semanas para a maioria das equipes. A Cartesia está integrada às principais plataformas de agentes de voz e todos os modelos estão na API pública. Assim, não é preciso adotar outra plataforma nem desfazer essa dependência depois.
Comece hoje
Fale com um especialista.
Converse com alguém da nossa equipe e descubra como a Cartesia pode ajudar você a criar experiências de voz de alto nível.
Comece a criar.
Acesse nossos modelos por API e coloque um agente de voz em produção em minutos.