Ink: el modelo de reconocimiento de voz más rápido y preciso

N.º 1 en precisión, diseñado para agentes de voz con detección semántica del final de turno y una latencia líder en el sector.
Haz clic o pulsa Space para iniciar una transcripción
Toca para iniciar una transcripción
¿Necesitas un tema?
¿Cómo sería tu día libre ideal?

Un modelo de transcripción para todos los entornos a los que llegue tu empresa

Los trenes retumban al pasar y los anuncios crepitan por los altavoces. Ink-2 transcribe cada palabra de quien llama.

Ciudad ruidosa

Ilustración de escena callejera de Mañana
Ilustración de escena callejera de Mediodía
Ilustración de escena callejera de Noche
Ilustración de escena callejera de Mañana

Diseñado para agentes de voz

Cuatro capacidades que convierten a Ink en la capa de transcripción en la que confían los agentes en producción.

Precisión

Entiende bien a la primera.

En la práctica

En un agente de voz, la transcripción es la base sobre la que se construye todo lo demás. Un error de transcripción perjudica la entrada del LLM y desvía la interacción.

Lo contrario también es cierto: los beneficios de la precisión se acumulan, y una transcripción exacta supone una mejor respuesta y una llamada resuelta.


El enfoque de Ink-2

Ink tiene la tasa de error de palabras (WER) más baja de todos los modelos STT en streaming y maneja de forma nativa datos estructurados como teléfonos, fechas, correos electrónicos, monedas y UUID. Está diseñado para audio real: telefonía, ruido de fondo, acentos variados y más.

Fechas, códigos alfanuméricos e identificadores

Fluidez de la conversación

Sabe cuándo empiezas y cuándo terminas.

En la práctica

Una conversación tiene dos momentos decisivos: cuando una persona empieza a hablar y cuando termina. Si el agente no detecta el inicio, pierde todo el turno. Si detecta el final demasiado pronto, interrumpe una idea a medias. El modelo de transcripción adecuado acierta en ambos sin hacer esperar.


El enfoque de Ink-2

Ink-2 incorpora detección nativa de turnos: el modelo emite directamente turn.start y turn.end, sin VAD externo que integrar o mantener. Para reducir la latencia, turn.eager_end permite que el LLM se adelante antes de confirmar que el turno ha terminado.

La detección semántica determina el final del turno por el significado, no por el silencio, para que una pausa a mitad de una idea no active al agente antes de tiempo.

ink-2

10.1s antes

Tu agente puede responder antes de que el competidor empiece

flux-general-en

15.9s

Solo ahora sabe el agente que la persona terminó de hablar y empieza desde cero

Velocidad

La persona deja de hablar.
El agente empieza a pensar.

En la práctica

Cuando la transcripción es rápida y constante, la respuesta del agente parece inmediata. Una transcripción lenta de cada diez significa una llamada de cada diez en la que se rompe esa sensación de disponibilidad. Nueve buenas llamadas no compensan la que no funcionó bien.


El enfoque de Ink-2

Ink es el modelo ASR en streaming más rápido, construido sobre un motor de inferencia propio diseñado para conversaciones en tiempo real. La transcripción final tarda 0,1 s, y turn.eager_end reduce el intervalo entre la última palabra y la primera respuesta.

Ink
88ms
Un parpadeo
100ms
Umbral de respuesta humana
150ms

Coste

Calidad que no cuesta más a medida que creces.

En la práctica

La voz es la interfaz más natural para comunicarse. Acertar con el coste y la calidad a escala permite usar la voz en todas partes, como interfaz predeterminada de cada interacción con agentes.


El enfoque de Ink-2

La arquitectura de modelos de espacio de estados de Ink ofrece entre 10 y 100 veces el rendimiento de los transformers, con menor coste de cómputo a escala y sin sacrificar calidad. La optimización continua de nuestros modelos mejora los costes unitarios a medida que creces.

Seguridad empresarial.De la nube al entorno local.

  • Insignia de Cumple con HIPAA

    Cumple con HIPAA

  • Insignia de SOC 2 Type 2

    SOC 2 Type 2

  • Insignia de GDPR

    GDPR

  • Insignia de PCI

    PCI

Preguntas frecuentes

¿Por qué Ink-2 es el mejor modelo de reconocimiento de voz para agentes?

Ink-2 es el modelo de reconocimiento de voz en streaming de Cartesia, diseñado para agentes de voz en producción. Como nuestro TTS, se basa en la arquitectura de modelos de espacio de estados (SSM) desarrollada por nuestro equipo fundador en Stanford, que permite a Ink-2 ofrecer tres ventajas a la vez:

La menor WER de cualquier modelo STT en streaming. Ink-2 supera a Deepgram Flux, Soniox RT-V4, AssemblyAI RT Pro, ElevenLabs Scribe-2-realtime y otros modelos en producción en grabaciones de línea, habla con acentos, ruido y conferencias de resultados, incluidos datos alfanuméricos como teléfonos, correos y UUID.

Detección de turnos de primer nivel, integrada. Ink-2 integra la detección de final de turno en el modelo, por lo que no necesitas otro modelo como Silero en tu arquitectura. Menos dependencias, menor latencia y turnos más precisos.

Resistencia al ruido integrada. Ink-2 funciona con ruido de fondo sin necesitar Krisp ni otros filtros de audio, lo que elimina costes y latencia de tu arquitectura.

¿Sigo necesitando Krisp o Silero con Ink-2?

No. Es una de las principales razones por las que los equipos cambian a Ink-2:

Los turnos están integrados. La mayoría de modelos STT necesitan un detector externo, como Silero, para saber cuándo ha terminado la persona. Ink-2 lo gestiona de forma nativa, con más rapidez y precisión que un modelo independiente.

La resistencia al ruido está integrada. La mayoría de agentes añaden Krisp o filtros similares sobre su STT para eliminar ruido de fondo, con más coste, latencia y complejidad. Ink-2 resiste el ruido de fondo de serie.

Menos modelos implican menor latencia, menor coste y menos puntos de fallo.

¿Puede Ink-2 ejecutarse en mis instalaciones o en mi propia nube (VPC)?

Sí, Ink-2 puede desplegarse:

En tu centro de datos, incluidos entornos aislados de la red

En tu propia VPC de AWS, GCP o Azure

Mediante licencias OEM para integrar Ink-2 directamente en tu producto

Esto permite utilizar Ink-2 en contratación pública, sectores regulados como salud, servicios financieros y seguros, y clientes con requisitos de soberanía o residencia de datos. Los despliegues locales y OEM están disponibles bajo contratos empresariales.

¿Qué idiomas admite Ink-2?

Ink-2 admite inglés, español, francés, hindi y japonés.

¿Cuánto cuesta Ink-2?

Ink-2 tiene un precio de 3 créditos por segundo. Los detalles de precios y los descuentos por volumen están en https://www.cartesia.ai/pricing. Los contratos Enterprise incluyen precios personalizados según el uso y el modelo de implementación.

Cartesia también ofrece un programa de ayudas para startups en https://www.cartesia.ai/startups, con créditos para empresas en fase inicial que cumplan los requisitos.

¿Cuándo debo contactar con ventas?

Contacta con el equipo de Cartesia si se cumple alguna de estas condiciones:

Ejecutas cargas de producción de gran volumen, superiores a 50 millones de créditos

Necesitas despliegue local, VPC u OEM

Necesitas un BAA, ausencia de conservación de datos u otras condiciones contractuales de cumplimiento para salud, servicios financieros o sectores regulados

Participas en contratación gubernamental, federal o del sector público

Para evaluación, prototipos y cargas de producción menores, puedes empezar con los planes de autoservicio y la documentación técnica en https://docs.cartesia.ai/build-with-cartesia/stt-models/latest.

Empieza hoy

Habla con un experto.

Habla con nuestro equipo y descubre cómo puede ayudarte Cartesia a crear experiencias de voz de primer nivel.

Contactar con ventas

Empieza a crear.

Accede a nuestros modelos mediante API y lleva un agente de voz a producción en minutos.

Probar Cartesia