Presentamos Ink-2, un modelo de voz a texto creado para agentes de voz en tiempo real.
Ocupa el número 1 en la clasificación de streaming de Artificial Analysis por su menor tasa de error de palabras a junio de 2026. Incluye la detección de turnos más precisa entre proveedores, para saber cuándo escuchar y cuándo responder.
Tasa de error de palabras: transcripción final por conjunto
Porcentaje de palabras mal transcritas al finalizar, tras detectar el final del habla. Cuanto menor, mejor.
Para los agentes de voz, STT debe acertar en exactitud, detección de turnos y latencia. Si falla cualquiera, la experiencia se resiente. El agente puede entender mal al usuario, interrumpirlo, responder tarde o hacer que la conversación resulte poco natural. Creamos Ink-2 para destacar en los tres aspectos.
Exactitud: acertar en cada palabra
Hemos trabajado mucho en reconocer entidades estructuradas como teléfonos, correos electrónicos, secuencias alfanuméricas y fechas. Ink-2 reconoce que una entidad está incompleta y espera a recibir toda la secuencia antes de fijar el resultado, sin instrucciones especiales.
Diseñamos Ink-2 para funcionar bien con distintos acentos, como los que aparecen en llamadas reales. En AppTek, una prueba con 14 acentos del inglés y diálogos reales de centros de llamadas, Ink-2 es el mejor proveedor STT en streaming con un 8 % de WER, frente al 10 % de Deepgram Flux y el 12 % de ElevenLabs Scribe v2.
Tasa de error de palabras (WER): AppTek
Prueba con 14 acentos del inglés en diálogos reales de centros de llamadas. Cuanto menor, mejor.
La exactitud se mantiene en producción. Nuestra prueba interna toma audio directamente de llamadas reales e incluye hablantes no nativos de inglés, ruido de fondo y audio degradado por mala conexión. Ink-2 obtiene un 6,5 % de WER, frente al 9,2 % de ElevenLabs Scribe v2 y el 9,4 % de Deepgram Flux.
Tasa de error de palabras (WER): agentes en producción
Prueba interna de 36 llamadas reales con nuestros agentes, grabadas en condiciones de producción. Cuanto menor, mejor.
Las entidades estructuradas y el audio real de producción ponen a prueba la exactitud de un agente más allá de una evaluación con audio limpio. Las demostraciones conservan sus grabaciones y transcripciones originales.
ink-2
Número completo y con formato
Transcribe los diez dígitos y les da formato de número de teléfono.
flux-general-en
Omite el último dígito
Escribe el número con palabras y pierde el último dígito.
Detección de turnos: saber cuándo escuchar y responder
La exactitud se ve claramente en las pruebas, pero la detección de turnos es donde muchos agentes fallan en producción.
La mayoría decide que un turno ha terminado según el silencio. Si la pausa dura lo suficiente, cierra el turno. En una llamada real esto puede cortar al cliente a mitad de una dirección o justo después de “y mi correo es…”.
Creamos Ink-2 con detección semántica del final de turno. El modelo interpreta el significado, no solo el silencio. Sabe que una dirección incompleta sigue en curso o que una idea sin terminar no es un punto de cierre. Mantiene el turno abierto hasta tener confianza en que el hablante ha terminado.
Ink-2 emite tres eventos de forma nativa, sin VAD externo:
turn.start: el usuario ha empezado a hablar.turn.eager_end: el modelo prevé que el turno está terminando y el LLM puede empezar a generar antes.turn.end: se confirma que el turno ha terminado.
ink-2
Turnos: 1
Mantuvo todo el segmento como un solo turno
flux-general-en
Turnos: 2
Dividió un segmento en varios turnos
scribe_v2_realtime
Turnos: 3
Dividió un segmento en varios turnos
Medimos la detección frente a una referencia etiquetada por personas. La precisión indica con qué frecuencia acierta al declarar terminado un turno; si es baja, corta a los usuarios. La exhaustividad indica cuántos finales reales detecta; si es baja, deja silencios incómodos mientras sigue escuchando. F1 combina ambas métricas.
Ink-2 mantiene altas la precisión y la exhaustividad a la vez, mientras que las alternativas sacrifican una por la otra.
Detección del final de turno: agentes en producción
Prueba interna con llamadas reales de agentes de voz en condiciones de producción. Cuanto mayor, mejor.
En micro1 usamos Ink-2 para Zara, nuestro agente de selección de personal que realiza entrevistas de voz a escala. La respuesta es casi instantánea y la gestión de turnos se adapta muy bien a los patrones reales de conversación.
Latencia: mantener el ritmo de la conversación
Como la latencia TTS, la de transcripción afecta directamente a la naturalidad. Nos centramos en el tiempo hasta la transcripción final, TTFT: cuánto tarda en llegar desde que el usuario termina de hablar. Eso determina si el agente parece atento o si parece estar esperando a cargar.
Ink-2 tiene un TTFT de 0,1 s. Además, turn.eager_end permite al LLM empezar antes de confirmar el final del turno. Así, el agente responde con rapidez suficiente para participar en la conversación.
ink-2
Tu agente puede responder antes de que el competidor empiece
flux-general-en
Solo ahora sabe el agente que la persona terminó de hablar y empieza desde cero
Únete a los equipos que usan Ink-2
Ink-2 está disponible en play.cartesia.ai, directamente mediante API y en plataformas como LiveKit, Vapi y Pipecat.
Queremos seguir trabajando con los equipos que hacen avanzar la voz con IA y ejecutan Ink-2 en producción. Ya hemos lanzado un modelo de inglés de primer nivel y la compatibilidad multilingüe está en camino, para adaptarse a cómo hablan tus usuarios, donde estén.