Apresentamos o Ink-2, um modelo de fala para texto criado para agentes de voz em tempo real.
Em junho de 2026, ele ocupa o primeiro lugar no ranking de transcrição em streaming da Artificial Analysis pela menor taxa de erro de palavras. Com a detecção de turnos integrada mais precisa entre os fornecedores, o modelo sabe exatamente quando ouvir e quando responder.
Taxa de erro de palavras: transcrição final por conjunto de dados
Porcentagem de palavras transcritas incorretamente na finalização, após detectar o fim da fala. Quanto menor, melhor.
Para agentes de voz, a transcrição precisa acertar em três aspectos, exatidão, detecção de turnos e latência. Se um deles falha, a experiência se degrada. O agente pode entender mal o usuário, interromper na hora errada, responder devagar ou tornar a conversa pouco natural. O Ink-2 foi criado para liderar nos três.
Exatidão: acertar cada palavra
Trabalhamos bastante no reconhecimento de entidades estruturadas, como números de telefone, endereços de e-mail, sequências alfanuméricas e datas. O Ink-2 entende quando está no meio de uma entidade e espera a sequência completa antes de confirmar o resultado, sem precisar de instruções especiais.
Criamos o Ink-2 para lidar bem com vários sotaques, como os encontrados em chamadas reais com agentes de voz. No AppTek, um benchmark que abrange 14 sotaques de inglês em diálogos reais de centrais de atendimento, o Ink-2 é o melhor fornecedor de STT em streaming, com WER de 8%, contra 10% do Deepgram Flux e 12% do ElevenLabs Scribe v2.
Taxa de erro de palavras (WER): AppTek
Benchmark de 14 sotaques de inglês em diálogos reais de centrais de atendimento. Quanto menor, melhor.
A exatidão também se mantém em produção, além do áudio limpo de referência. Nosso benchmark interno usa amostras de áudio diretamente de chamadas reais com agentes de voz, incluindo falantes não nativos de inglês, ruído de fundo e áudio degradado por condições ruins de rede. O Ink-2 alcança WER de 6.5%, contra 9.2% do ElevenLabs Scribe v2 e 9.4% do Deepgram Flux.
Taxa de erro de palavras (WER): agentes em produção
Benchmark interno de 36 chamadas reais com nossos agentes, gravadas em produção. Quanto menor, melhor.
Entidades estruturadas e áudio real de produção são os desafios que de fato testam a exatidão de um agente de voz ao vivo, além de um benchmark limpo. As demonstrações mantêm as gravações e as transcrições no idioma original.
ink-2
Número completo e formatado
Transcreve todos os dez dígitos e os formata como um número de telefone.
flux-general-en
Omite o último dígito
Escreve o número por extenso e perde o último dígito.
Detecção de turnos: saber quando ouvir e responder
A exatidão aparece claramente nos benchmarks, mas é na detecção de turnos que a maioria dos agentes de voz falha em produção.
A maioria decide que um turno terminou com base no silêncio. Se a pessoa faz uma pausa longa o suficiente, o turno acaba abruptamente. Isso funciona em testes, mas, em uma chamada real, pode interromper o cliente no meio de um endereço ou responder logo depois de “e meu e-mail é…”.
Criamos o Ink-2 com detecção semântica de fim de turno integrada. O modelo interpreta o significado, em vez do silêncio, para decidir quando o turno termina. Ele reconhece quando um endereço ainda está incompleto ou quando uma ideia inacabada não é um ponto de parada. O turno permanece aberto até que o modelo tenha confiança de que a pessoa terminou.
O Ink-2 emite três eventos nativamente, sem precisar de VAD externo:
turn.start: o usuário começou a falar.turn.eager_end: o modelo prevê que o turno está terminando. Seu LLM pode começar a gerar mais cedo.turn.end: o fim do turno foi confirmado.
ink-2
Turnos: 1
Manteve todo o segmento como um único turno
flux-general-en
Turnos: 2
Dividiu um segmento em turnos separados
scribe_v2_realtime
Turnos: 3
Dividiu um segmento em turnos separados
Medimos a detecção de turnos em relação a uma referência anotada por humanos. A precisão indica com que frequência o modelo acerta ao declarar o fim de um turno. Baixa precisão significa interromper as pessoas. A revocação indica com que frequência ele identifica todos os finais reais de turno. Baixa revocação causa silêncios constrangedores enquanto o modelo continua ouvindo. O F1 equilibra as duas métricas em uma única pontuação.
O Ink-2 mantém precisão e revocação altas ao mesmo tempo, enquanto as alternativas sacrificam uma em favor da outra.
Detecção de fim de turno: agentes em produção
Benchmark interno de chamadas reais com agentes de voz em produção. Quanto maior, melhor.
Na micro1, usamos o Ink-2 para alimentar a Zara, nossa agente de recrutamento com IA que realiza entrevistas por voz com candidatos em escala. A latência é quase instantânea, e a alternância de turnos lida muito bem com os padrões reais de conversa.
Latência: manter a conversa fluindo
Assim como a latência de TTS, a latência de transcrição afeta diretamente a naturalidade da conversa. A métrica que nos interessa é o tempo até a transcrição final, ou TTFT. Ela mede quanto tempo leva para obter a transcrição final a partir do momento em que o usuário termina de falar. Isso determina se o agente parece prestar atenção ou estar esperando um carregamento.
O Ink-2 é extremamente rápido, com TTFT de 0.1s. E, como turn.eager_end permite que seu LLM comece antes da confirmação completa do turno, o agente responde rápido o suficiente para parecer realmente presente na conversa.
ink-2
Seu agente pode responder antes mesmo de o concorrente começar
flux-general-en
Só agora o agente sabe que a pessoa terminou de falar; ele começa do zero
Junte-se às equipes que usam Ink-2
O Ink-2 já está disponível em play.cartesia.ai, diretamente por API e nas plataformas usadas por equipes de voz, incluindo LiveKit, Vapi e Pipecat.
Vamos continuar construindo ao lado das equipes que fazem a IA de voz avançar e usam o Ink-2 em produção. Já lançamos um modelo de inglês de primeira linha, e o suporte multilíngue está a caminho, para que o Ink-2 acompanhe a forma como seus usuários falam, onde quer que estejam.
Experimente o Ink-2
Esta demonstração do Ink 2 aceita inglês, espanhol, francês, hindi e japonês. Fale inglês nesta demonstração.