Blog / Notícias

Apresentamos o Ink-2:O STT nº 1 criado para agentes de voz

Eli Pugh 

Apresentamos o Ink-2, um modelo de fala para texto criado para agentes de voz em tempo real.

Em junho de 2026, ele ocupa o primeiro lugar no ranking de transcrição em streaming da Artificial Analysis pela menor taxa de erro de palavras. Com a detecção de turnos integrada mais precisa entre os fornecedores, o modelo sabe exatamente quando ouvir e quando responder.

Taxa de erro de palavras: transcrição final por conjunto de dados

Porcentagem de palavras transcritas incorretamente na finalização, após detectar o fim da fala. Quanto menor, melhor.

Artificial AnalysisJunho de 2026
AA-AgentTalkVoxPopuliEarnings22
3.4%
2.4%
5.3%
Ink-2 (finais semânticos)
Cartesia
2.8%
2.3%
6.4%
Scribe v2 Realtime
ElevenLabs
3.6%
2.1%
7.2%
U3.5 Pro Realtime
AssemblyAI
6.7%
4.9%
11.4%
Flux
Deepgram
Ink-2 (finais semânticos)
Cartesia
3.4%
2.4%
5.3%
Scribe v2 Realtime
ElevenLabs
2.8%
2.3%
6.4%
U3.5 Pro Realtime
AssemblyAI
3.6%
2.1%
7.2%
Flux
Deepgram
6.7%
4.9%
11.4%

Para agentes de voz, a transcrição precisa acertar em três aspectos, exatidão, detecção de turnos e latência. Se um deles falha, a experiência se degrada. O agente pode entender mal o usuário, interromper na hora errada, responder devagar ou tornar a conversa pouco natural. O Ink-2 foi criado para liderar nos três.

Exatidão: acertar cada palavra

Trabalhamos bastante no reconhecimento de entidades estruturadas, como números de telefone, endereços de e-mail, sequências alfanuméricas e datas. O Ink-2 entende quando está no meio de uma entidade e espera a sequência completa antes de confirmar o resultado, sem precisar de instruções especiais.

Criamos o Ink-2 para lidar bem com vários sotaques, como os encontrados em chamadas reais com agentes de voz. No AppTek, um benchmark que abrange 14 sotaques de inglês em diálogos reais de centrais de atendimento, o Ink-2 é o melhor fornecedor de STT em streaming, com WER de 8%, contra 10% do Deepgram Flux e 12% do ElevenLabs Scribe v2.

Taxa de erro de palavras (WER): AppTek

Benchmark de 14 sotaques de inglês em diálogos reais de centrais de atendimento. Quanto menor, melhor.

8%
Ink-2
Cartesia
10%
Flux
Deepgram
12%
Scribe v2 Realtime
ElevenLabs
13%
U3.5 Pro Realtime
AssemblyAI

A exatidão também se mantém em produção, além do áudio limpo de referência. Nosso benchmark interno usa amostras de áudio diretamente de chamadas reais com agentes de voz, incluindo falantes não nativos de inglês, ruído de fundo e áudio degradado por condições ruins de rede. O Ink-2 alcança WER de 6.5%, contra 9.2% do ElevenLabs Scribe v2 e 9.4% do Deepgram Flux.

Taxa de erro de palavras (WER): agentes em produção

Benchmark interno de 36 chamadas reais com nossos agentes, gravadas em produção. Quanto menor, melhor.

Avaliação da CartesiaJulho de 2026
6.5%
Ink-2
Cartesia
9.2%
Scribe v2 Realtime
ElevenLabs
9.4%
Flux
Deepgram
10.7%
U3.5 Pro Realtime
AssemblyAI

Entidades estruturadas e áudio real de produção são os desafios que de fato testam a exatidão de um agente de voz ao vivo, além de um benchmark limpo. As demonstrações mantêm as gravações e as transcrições no idioma original.

ink-2

Número completo e formatado

Transcreve todos os dez dígitos e os formata como um número de telefone.

flux-general-en

Omite o último dígito

Escreve o número por extenso e perde o último dígito.

Detecção de turnos: saber quando ouvir e responder

A exatidão aparece claramente nos benchmarks, mas é na detecção de turnos que a maioria dos agentes de voz falha em produção.

A maioria decide que um turno terminou com base no silêncio. Se a pessoa faz uma pausa longa o suficiente, o turno acaba abruptamente. Isso funciona em testes, mas, em uma chamada real, pode interromper o cliente no meio de um endereço ou responder logo depois de “e meu e-mail é…”.

Criamos o Ink-2 com detecção semântica de fim de turno integrada. O modelo interpreta o significado, em vez do silêncio, para decidir quando o turno termina. Ele reconhece quando um endereço ainda está incompleto ou quando uma ideia inacabada não é um ponto de parada. O turno permanece aberto até que o modelo tenha confiança de que a pessoa terminou.

O Ink-2 emite três eventos nativamente, sem precisar de VAD externo:

  • turn.start: o usuário começou a falar.
  • turn.eager_end: o modelo prevê que o turno está terminando. Seu LLM pode começar a gerar mais cedo.
  • turn.end: o fim do turno foi confirmado.

ink-2

Turnos: 1

Manteve todo o segmento como um único turno

flux-general-en

Turnos: 2

Dividiu um segmento em turnos separados

scribe_v2_realtime

Turnos: 3

Dividiu um segmento em turnos separados

Medimos a detecção de turnos em relação a uma referência anotada por humanos. A precisão indica com que frequência o modelo acerta ao declarar o fim de um turno. Baixa precisão significa interromper as pessoas. A revocação indica com que frequência ele identifica todos os finais reais de turno. Baixa revocação causa silêncios constrangedores enquanto o modelo continua ouvindo. O F1 equilibra as duas métricas em uma única pontuação.

O Ink-2 mantém precisão e revocação altas ao mesmo tempo, enquanto as alternativas sacrificam uma em favor da outra.

Detecção de fim de turno: agentes em produção

Benchmark interno de chamadas reais com agentes de voz em produção. Quanto maior, melhor.

Avaliação da CartesiaJulho de 2026
PrecisãoRevocaçãoF1
89%
97%
93%
Ink-2
Cartesia
80%
97%
88%
Flux
Deepgram
74%
97%
84%
U3.5 Pro Realtime
AssemblyAI
89%
87%
88%
Scribe v2 Realtime
ElevenLabs
Ink-2
Cartesia
89%
97%
93%
Flux
Deepgram
80%
97%
88%
U3.5 Pro Realtime
AssemblyAI
74%
97%
84%
Scribe v2 Realtime
ElevenLabs
89%
87%
88%

Na micro1, usamos o Ink-2 para alimentar a Zara, nossa agente de recrutamento com IA que realiza entrevistas por voz com candidatos em escala. A latência é quase instantânea, e a alternância de turnos lida muito bem com os padrões reais de conversa.

Aruj MahajanIA na micro1

Latência: manter a conversa fluindo

Assim como a latência de TTS, a latência de transcrição afeta diretamente a naturalidade da conversa. A métrica que nos interessa é o tempo até a transcrição final, ou TTFT. Ela mede quanto tempo leva para obter a transcrição final a partir do momento em que o usuário termina de falar. Isso determina se o agente parece prestar atenção ou estar esperando um carregamento.

O Ink-2 é extremamente rápido, com TTFT de 0.1s. E, como turn.eager_end permite que seu LLM comece antes da confirmação completa do turno, o agente responde rápido o suficiente para parecer realmente presente na conversa.

ink-2

10.1 s antes

Seu agente pode responder antes mesmo de o concorrente começar

flux-general-en

15.9s

Só agora o agente sabe que a pessoa terminou de falar; ele começa do zero

Junte-se às equipes que usam Ink-2

ServiceNow
HeyGen
Micro1
Synthesia

O Ink-2 já está disponível em play.cartesia.ai, diretamente por API e nas plataformas usadas por equipes de voz, incluindo LiveKit, Vapi e Pipecat.

Vamos continuar construindo ao lado das equipes que fazem a IA de voz avançar e usam o Ink-2 em produção. Já lançamos um modelo de inglês de primeira linha, e o suporte multilíngue está a caminho, para que o Ink-2 acompanhe a forma como seus usuários falam, onde quer que estejam.

Experimente o Ink-2

Esta demonstração do Ink 2 aceita inglês, espanhol, francês, hindi e japonês. Fale inglês nesta demonstração.

Clique ou pressione Space para iniciar uma transcrição
Toque para iniciar uma transcrição
Precisa de um assunto?
O que você está esperando com expectativa neste mês?

Experimente o Ink-2 hoje mesmo

Experimente a Cartesia (Inglês)