Blog / Noticias

Presentamos Ink-2:El STT número 1 creado para agentes de voz

Eli Pugh 

Presentamos Ink-2, un modelo de voz a texto creado para agentes de voz en tiempo real.

Ocupa el número 1 en la clasificación de streaming de Artificial Analysis por su menor tasa de error de palabras a junio de 2026. Incluye la detección de turnos más precisa entre proveedores, para saber cuándo escuchar y cuándo responder.

Tasa de error de palabras: transcripción final por conjunto

Porcentaje de palabras mal transcritas al finalizar, tras detectar el final del habla. Cuanto menor, mejor.

Artificial AnalysisJunio de 2026
AA-AgentTalkVoxPopuliEarnings22
3.4%
2.4%
5.3%
Ink-2 (finales semánticos)
Cartesia
2.8%
2.3%
6.4%
Scribe v2 Realtime
ElevenLabs
3.6%
2.1%
7.2%
U3.5 Pro Realtime
AssemblyAI
6.7%
4.9%
11.4%
Flux
Deepgram
Ink-2 (finales semánticos)
Cartesia
3.4%
2.4%
5.3%
Scribe v2 Realtime
ElevenLabs
2.8%
2.3%
6.4%
U3.5 Pro Realtime
AssemblyAI
3.6%
2.1%
7.2%
Flux
Deepgram
6.7%
4.9%
11.4%

Para los agentes de voz, STT debe acertar en exactitud, detección de turnos y latencia. Si falla cualquiera, la experiencia se resiente. El agente puede entender mal al usuario, interrumpirlo, responder tarde o hacer que la conversación resulte poco natural. Creamos Ink-2 para destacar en los tres aspectos.

Exactitud: acertar en cada palabra

Hemos trabajado mucho en reconocer entidades estructuradas como teléfonos, correos electrónicos, secuencias alfanuméricas y fechas. Ink-2 reconoce que una entidad está incompleta y espera a recibir toda la secuencia antes de fijar el resultado, sin instrucciones especiales.

Diseñamos Ink-2 para funcionar bien con distintos acentos, como los que aparecen en llamadas reales. En AppTek, una prueba con 14 acentos del inglés y diálogos reales de centros de llamadas, Ink-2 es el mejor proveedor STT en streaming con un 8 % de WER, frente al 10 % de Deepgram Flux y el 12 % de ElevenLabs Scribe v2.

Tasa de error de palabras (WER): AppTek

Prueba con 14 acentos del inglés en diálogos reales de centros de llamadas. Cuanto menor, mejor.

8%
Ink-2
Cartesia
10%
Flux
Deepgram
12%
Scribe v2 Realtime
ElevenLabs
13%
U3.5 Pro Realtime
AssemblyAI

La exactitud se mantiene en producción. Nuestra prueba interna toma audio directamente de llamadas reales e incluye hablantes no nativos de inglés, ruido de fondo y audio degradado por mala conexión. Ink-2 obtiene un 6,5 % de WER, frente al 9,2 % de ElevenLabs Scribe v2 y el 9,4 % de Deepgram Flux.

Tasa de error de palabras (WER): agentes en producción

Prueba interna de 36 llamadas reales con nuestros agentes, grabadas en condiciones de producción. Cuanto menor, mejor.

Evaluación de CartesiaJulio de 2026
6.5%
Ink-2
Cartesia
9.2%
Scribe v2 Realtime
ElevenLabs
9.4%
Flux
Deepgram
10.7%
U3.5 Pro Realtime
AssemblyAI

Las entidades estructuradas y el audio real de producción ponen a prueba la exactitud de un agente más allá de una evaluación con audio limpio. Las demostraciones conservan sus grabaciones y transcripciones originales.

ink-2

Número completo y con formato

Transcribe los diez dígitos y les da formato de número de teléfono.

flux-general-en

Omite el último dígito

Escribe el número con palabras y pierde el último dígito.

Detección de turnos: saber cuándo escuchar y responder

La exactitud se ve claramente en las pruebas, pero la detección de turnos es donde muchos agentes fallan en producción.

La mayoría decide que un turno ha terminado según el silencio. Si la pausa dura lo suficiente, cierra el turno. En una llamada real esto puede cortar al cliente a mitad de una dirección o justo después de “y mi correo es…”.

Creamos Ink-2 con detección semántica del final de turno. El modelo interpreta el significado, no solo el silencio. Sabe que una dirección incompleta sigue en curso o que una idea sin terminar no es un punto de cierre. Mantiene el turno abierto hasta tener confianza en que el hablante ha terminado.

Ink-2 emite tres eventos de forma nativa, sin VAD externo:

  • turn.start: el usuario ha empezado a hablar.
  • turn.eager_end: el modelo prevé que el turno está terminando y el LLM puede empezar a generar antes.
  • turn.end: se confirma que el turno ha terminado.

ink-2

Turnos: 1

Mantuvo todo el segmento como un solo turno

flux-general-en

Turnos: 2

Dividió un segmento en varios turnos

scribe_v2_realtime

Turnos: 3

Dividió un segmento en varios turnos

Medimos la detección frente a una referencia etiquetada por personas. La precisión indica con qué frecuencia acierta al declarar terminado un turno; si es baja, corta a los usuarios. La exhaustividad indica cuántos finales reales detecta; si es baja, deja silencios incómodos mientras sigue escuchando. F1 combina ambas métricas.

Ink-2 mantiene altas la precisión y la exhaustividad a la vez, mientras que las alternativas sacrifican una por la otra.

Detección del final de turno: agentes en producción

Prueba interna con llamadas reales de agentes de voz en condiciones de producción. Cuanto mayor, mejor.

Evaluación de CartesiaJulio de 2026
PrecisiónExhaustividadF1
89%
97%
93%
Ink-2
Cartesia
80%
97%
88%
Flux
Deepgram
74%
97%
84%
U3.5 Pro Realtime
AssemblyAI
89%
87%
88%
Scribe v2 Realtime
ElevenLabs
Ink-2
Cartesia
89%
97%
93%
Flux
Deepgram
80%
97%
88%
U3.5 Pro Realtime
AssemblyAI
74%
97%
84%
Scribe v2 Realtime
ElevenLabs
89%
87%
88%

En micro1 usamos Ink-2 para Zara, nuestro agente de selección de personal que realiza entrevistas de voz a escala. La respuesta es casi instantánea y la gestión de turnos se adapta muy bien a los patrones reales de conversación.

Aruj MahajanIA en micro1

Latencia: mantener el ritmo de la conversación

Como la latencia TTS, la de transcripción afecta directamente a la naturalidad. Nos centramos en el tiempo hasta la transcripción final, TTFT: cuánto tarda en llegar desde que el usuario termina de hablar. Eso determina si el agente parece atento o si parece estar esperando a cargar.

Ink-2 tiene un TTFT de 0,1 s. Además, turn.eager_end permite al LLM empezar antes de confirmar el final del turno. Así, el agente responde con rapidez suficiente para participar en la conversación.

ink-2

10.1s antes

Tu agente puede responder antes de que el competidor empiece

flux-general-en

15.9s

Solo ahora sabe el agente que la persona terminó de hablar y empieza desde cero

Únete a los equipos que usan Ink-2

ServiceNow
HeyGen
Micro1
Synthesia

Ink-2 está disponible en play.cartesia.ai, directamente mediante API y en plataformas como LiveKit, Vapi y Pipecat.

Queremos seguir trabajando con los equipos que hacen avanzar la voz con IA y ejecutan Ink-2 en producción. Ya hemos lanzado un modelo de inglés de primer nivel y la compatibilidad multilingüe está en camino, para adaptarse a cómo hablan tus usuarios, donde estén.

Prueba Ink-2

Haz clic o pulsa Space para iniciar una transcripción
Toca para iniciar una transcripción
¿Necesitas un tema?
¿Qué pequeño detalle te ha hecho sonreír últimamente?