Hoy presentamos Ink, una nueva familia de modelos de voz a texto, o STT, en streaming para desarrolladores que crean aplicaciones de voz en tiempo real. Nuestro primer modelo es Ink-Whisper, una variante de Whisper de OpenAI optimizada para transcribir conversaciones con baja latencia. Ink-Whisper está disponible desde hoy y es el modelo STT más rápido y económico, diseñado para agentes de voz de nivel empresarial.
De Sonic a Ink: de generar voz a comprenderla
Con Sonic, nos hemos convertido en el proveedor de texto a voz preferido por quienes priorizan velocidad, calidad y fiabilidad. Su liderazgo en latencia ultrabaja permite a nuestros clientes crear experiencias interactivas de voz muy realistas. Ahora, con Ink, nos centramos en el otro lado de la conversación: la voz a texto.
Adaptar Whisper al tiempo real
Para nuestro lanzamiento de STT, examinamos qué usan ya los desarrolladores y qué problemas encuentran. Así llegamos a whisper-large-v3-turbo de OpenAI. Se utiliza ampliamente por buenas razones: su exactitud al transcribir conversaciones es comparable a la de otros proveedores propietarios de voz a texto, es de código abierto y permite una inferencia eficiente.
La mayor parte de la innovación alrededor de Whisper se ha centrado en la capacidad de procesamiento, es decir, la rapidez con que se transcriben conjuntos de datos enormes, medida con el factor de tiempo real o RTF. Es útil para el procesamiento posterior de archivos largos, pero Whisper estándar se queda corto en velocidad y exactitud para agentes de voz en tiempo real. Estos necesitan transcripciones de calidad en cada llamada, no solo en promedio. Además, Whisper estándar no se diseñó para las condiciones difíciles del mundo real.
Whisper se creó para procesar grandes lotes, no para el diálogo en directo. Por eso rediseñamos su arquitectura para crear Ink-Whisper, pensado para voz con IA en tiempo real y con la velocidad y el contexto real como prioridades.
Ink-Whisper está diseñado para conversaciones reales
En aplicaciones empresariales, los agentes de voz deben transcribir el habla a medida que se produce y hacerlo con fiabilidad en entornos muy distintos. Diseñamos Ink-Whisper para esas condiciones, centrándonos en las que suelen causar problemas a los sistemas habituales de voz a texto:
- Artefactos telefónicos: el audio comprimido de ancho de banda reducido introduce distorsión.
- Nombres propios y terminología especializada: los nombres de productos, medicamentos o instrumentos financieros requieren claridad.
- Ruido de fondo: tráfico, conversaciones de restaurantes, bebés llorando e interferencias dificultan la transcripción.
- Disfluencias y silencio: muletillas como “eh” y pausas confunden a las implementaciones estándar de Whisper.
- Acentos y variaciones: las voces son diversas y los modelos STT deben adaptarse.
Una de nuestras principales mejoras es la división dinámica en fragmentos. Whisper estándar funciona mejor con fragmentos completos de 30 segundos. Pero la IA conversacional trabaja con segmentos de audio mucho más cortos y fragmentados. Hemos modificado Whisper para manejar fragmentos de longitud variable que terminan en puntos con significado semántico. Esto reduce errores y alucinaciones, especialmente durante silencios o huecos de audio.
Para comprobar que Ink-Whisper mejora en condiciones reales, creamos varios conjuntos de evaluación que reflejan estos problemas habituales:
- Conjunto de ruido de fondo: conversaciones grabadas en entornos ruidosos, como tráfico, cafeterías u oficinas.
- Conjunto de nombres propios: 100 muestras de SPGISpeech con abundante terminología financiera y nombres de marcas.
- Conjunto de acentos: transcripciones con diversos acentos del inglés para evaluar el rendimiento entre grupos demográficos.
En estos conjuntos, Ink-Whisper supera a whisper-large-v3-turbo de referencia en exactitud, medida mediante la tasa de error de palabras, o WER. Su WER también es competitiva frente a otros modelos de voz a texto en streaming. Además, está optimizado para funcionar en producción y en tiempo real:
| Tasa de error de palabras en conjuntos relevantes | Detalles del conjunto | Cartesia Streaming whisper-natural | Deepgram Nova3 Streaming | Fireworks Whisper Streaming | Assembly Streaming |
|---|---|---|---|---|---|
| Llamadas telefónicas | Conversaciones naturales por teléfono | 0.19 | 0.18 | 0.28 | 0.23 |
| Nombres propios | Habla con abundante jerga | 0.065 | 0.045 | 0.071 | 0.044 |
| Ruidos de fondo | Ruido de fondo | 0.033 | 0.038 | 0.099 | 0.027 |
| Disfluencias | Muletillas y ruido | 0.064 | 0.055 | 0.156 | 0.137 |
| Subconjunto de Speech Accent Archive | Acentos diversos | 0.015 | 0.024 | 0.014 | 0.016 |
Ink-Whisper es el modelo de streaming más rápido
Además de exactitud, la transcripción en streaming necesita gran velocidad para lograr conversaciones realistas. Con Ink-Whisper destacamos una nueva métrica: tiempo hasta completar la transcripción, o TTCT. Mide cuánto tarda en estar lista la transcripción completa desde que el usuario deja de hablar. Determina con qué rapidez puede responder todo el sistema, como lo haría una persona que escucha con atención.
El retraso en la respuesta delata a un bot poco natural. Rompe el ritmo de la conversación y provoca llamadas abandonadas, usuarios frustrados e ingresos perdidos. Reducir el TTCT al mínimo mejora la velocidad y hace que la interacción se sienta humana.
Ink-Whisper supera a whisper-large-v3-turbo de referencia en TTCT. De hecho, ofrece el TTCT más rápido de todos los modelos de voz a texto en streaming que hemos probado:
| Tiempo para completar la transcripción tras el último audio enviado | Cartesia Streaming Ink-Whisper | Deepgram Nova3 Streaming | Fireworks Whisper Streaming | AssemblyAI Universal Streaming |
|---|---|---|---|---|
| Mediana (ms) | 66 | 74 | 70 | 737 |
| P90 (ms) | 98 | 109 | 189 | 829 |
Whisper estándar sigue siendo uno de los modelos STT abiertos más versátiles, pero no se creó para el tiempo real. Ink-Whisper lo adapta mediante optimizaciones de exactitud conversacional y latencia ultrabaja. Ofrece el TTCT más rápido que hemos observado y buenos resultados con ruido, acentos y habla cambiante. Lo evaluamos en las condiciones reales de los agentes de voz, no en el entorno controlado de un laboratorio o estudio.
Ink-Whisper es el modelo de streaming más económico
Creemos que la voz es el futuro y queremos que Ink-Whisper sea accesible para quienes crean soluciones de voz. Es el modelo STT en streaming más rápido y económico disponible. Por solo 1 crédito por segundo, o 0,13 dólares por hora con el plan Scale, ofrece transcripción en tiempo real de primer nivel al menor precio.
Empezar con Ink-Whisper es sencillo:
- Se integra con Vapi, Pipecat y LiveKit, para que puedas empezar a transmitir interacciones de voz en minutos.
- Con una disponibilidad del 99,9 % y cumplimiento empresarial de SOC 2 Type II, HIPAA y PCI, puedes desplegarlo a escala con confianza.
Empieza aquí o consulta la documentación.
El futuro de la voz con IA en Cartesia
La demanda de agentes de voz está creciendo rápidamente. Los más eficaces dependen de IA de audio avanzada, como nuestro modelo de texto a voz Sonic. Ahora, con Ink-Whisper, atendemos la otra parte de esa demanda para permitir conversaciones rápidas y naturales. Este lanzamiento es un primer vistazo a nuestra nueva infraestructura de voz en tiempo real. Habrá más novedades.
