Comparas modelos de voz a texto porque algo falló después de la transcripción: un agente reservó el día equivocado, una transcripción estropeó un número de teléfono o un proceso por lotes costó más que el producto al que sirve. Esta página organiza los modelos relevantes en 2026 según la tarea que les pides y explica dónde falla cada uno.
La versión breve: si transcribes audio en inglés en directo para un agente de voz, Ink 2 es el mejor punto de partida. Ocupaba el primer puesto por tasa de error de palabras en la clasificación de voz a texto en streaming de Artificial Analysis en junio de 2026 y detecta turnos sin un modelo adicional. Para streaming multilingüe, Deepgram Nova-3 y los modelos Universal de AssemblyAI cubren más idiomas hoy. Para transcribir archivos grabados en hardware que controlas, Whisper large-v3 de OpenAI es la opción habitual de código abierto. Las posiciones cambian; consulta las clasificaciones actuales en vez de confiar en una sola página, incluida esta.
Visión general: streaming y procesamiento por lotes son tareas distintas
La primera distinción no es entre proveedores, sino entre dos tipos de trabajo:
- La transcripción en streaming, en tiempo real, devuelve texto mientras la persona sigue hablando. La necesitan los agentes de voz, los subtítulos en directo y el enrutamiento de llamadas. El modelo confirma palabras que solo ha escuchado parcialmente, por lo que se evalúa su precisión, su latencia y su capacidad de reconocer cuándo termina una idea.
- La transcripción por lotes recibe una grabación completa y devuelve una transcripción. Aquí entran la posproducción de pódcast, las notas de reuniones y la revisión de cumplimiento. La latencia importa mucho menos; la precisión y el coste por hora importan más.
Un modelo creado para una tarea rara vez destaca en la otra. Whisper es el ejemplo más claro: excelente precisión por lotes para un modelo abierto, pero ningún streaming nativo. Elegir según una sola clasificación que mezcla ambas tareas pasa por alto esta diferencia. Por eso agrupamos las comparaciones por tarea.
Cómo evaluar un modelo de voz a texto
Tres criterios deciden la mayoría de las implementaciones en tiempo real:
- Precisión, especialmente en las cadenas que importan a tu producto. La tasa de error de palabras media (WER) oculta los errores costosos. Un modelo puede tener un WER global respetable y aun así confundir códigos de confirmación, estropear correos electrónicos u omitir un número hablado sin avisar. Esos fallos rompen el flujo de reservas de un agente. Explicamos el problema en nuestra guía sobre la tasa de error de palabras: el WER es un diagnóstico, no un veredicto, porque depende de la transcripción de referencia y no dice qué errores perdona una persona.
- Detección de turnos. En una conversación hay que decidir cuándo ha dejado de hablar el usuario. Muchas implementaciones añaden un detector de actividad de voz y un tiempo de espera de silencio; esa combinación interpreta mal las pausas, y cada modelo adicional añade latencia. Los modelos que predicen el final del turno de forma integrada eliminan ese complemento.
- Latencia en condiciones reales. Las páginas de los proveedores citan medianas con audio limpio. Tu audio tiene acentos, voces superpuestas y ruido de fondo, y quienes llaman experimentan tu p95. Mide el tiempo hasta la transcripción final con grabaciones parecidas a tu tráfico.
El precio es el cuarto criterio, y la respuesta sincera es poco emocionante: las tarifas por minuto difieren en unas décimas de céntimo, cambian a menudo e importan menos que elegir un modelo que no entienda mal a tus clientes. Consulta las páginas de precios vigentes cuando leas esto.
Los modelos que conviene comparar
Estos son los modelos que encontrará quien seleccione opciones de voz a texto en 2026. Las afirmaciones proceden de materiales de los propios proveedores o de clasificaciones independientes, y se indica su origen.
Cartesia Ink 2: inglés en streaming para agentes de voz
Ink 2 es un modelo de streaming creado para agentes en tiempo real, y es el modelo que desarrollamos. Sus fortalezas, según el anuncio de lanzamiento y la clasificación de streaming de Artificial Analysis, donde ocupaba el primer puesto por tasa de error de palabras en junio de 2026:
- Precisión en audio de producción: grabaciones de llamadas, habla con distintos acentos, entornos ruidosos y presentaciones de resultados. En esas pruebas supera a Deepgram Flux, Soniox RT-V4, los modelos en tiempo real de AssemblyAI y ElevenLabs Scribe-2-realtime. Para entidades estructuradas, como teléfonos, correos, UUID y fechas, espera a recibir la secuencia completa antes de confirmarla.
- Detección de turnos integrada: la predicción del final del turno forma parte del modelo, por lo que no necesitas Silero ni otro servicio de gestión de turnos. En una implementación de Pipecat, las predicciones anticipadas de final de turno de Ink redujeron el tiempo de respuesta en aproximadamente medio segundo al permitir al agente iniciar su respuesta antes de que terminara formalmente el turno del usuario.
- Resistencia al ruido sin filtro de preprocesamiento, lo que elimina una etapa como Krisp, junto con su coste y latencia.
Sus límites actuales: Ink 2 transcribe solo inglés, con un modelo multilingüe en versión preliminar. Si tus agentes reciben llamadas en español o hindi hoy, elige una de las opciones multilingües siguientes y vuelve a evaluarlo más adelante. Cartesia ofrece despliegues en la nube, en tus instalaciones y en entornos aislados de la red, y puedes probar Ink gratis en el Playground.
OpenAI Whisper large-v3: la opción habitual de código abierto por lotes
Whisper es el modelo de referencia para transcribir por lotes en tus propias GPU: pesos abiertos, unos 99 idiomas, buena precisión con audio limpio y sin dependencia de un proveedor. Los equipos lo alojan por su cuenta para cargas sensibles a la privacidad o al coste.
Su punto débil es la tarea del título de esta página. Whisper solo procesa por lotes: no tiene streaming nativo ni detección de turnos, y tiende a inventar frases durante el silencio o el audio sin habla. Es el problema que señala el artículo de AssemblyAI y que hereda cualquier adaptador de streaming para Whisper. Las implementaciones por fragmentos añaden unos 500 milisegundos de latencia y deben resolver por su cuenta la detección del final del habla. Usa Whisper para archivos. No lo uses como oído de un agente en tiempo real.
Deepgram Nova-3: streaming multilingüe a escala
Nova-3 de Deepgram es una API de streaming consolidada para implementaciones multilingües: latencia inferior a 300 milisegundos según el proveedor, alternancia de idiomas en tiempo real entre diez idiomas y personalización por dominio. El anuncio de Nova-3 informa de un WER mediano del 6.84% en audio de streaming. Es una cifra del proveedor; los índices independientes lo sitúan más alto. Conviene tratar las cifras de los proveedores como marketing hasta reproducirlas. Deepgram también ofrece Flux, un modelo que añade detección de final de turno para agentes de voz y reconoce que el STT clásico no resuelve por sí solo la alternancia de turnos.
Elige Nova-3 si necesitas muchos idiomas en producción hoy y puedes aceptar una capa separada de detección de turnos o Flux junto a él.
AssemblyAI Universal: streaming con análisis de voz incluido
La línea Universal de AssemblyAI combina transcripción en streaming con resúmenes, detección de entidades, análisis de sentimiento y ocultación de información personal en una API. Sus modelos en tiempo real compiten directamente en pruebas de agentes de voz. Los artículos de la empresa informan de un WER del 5.19% para Universal-3.6 Pro Realtime en su prueba de agentes de voz en inglés, por delante de Scribe v2 y Nova-3 en la misma prueba. Es una evaluación realizada por el proveedor, pero su propuesta es clara: un proveedor para transcripción y análisis de audio. Es una buena opción si la transcripción alimenta tanto análisis como un agente.
Google Chirp 3: para equipos que ya usan Google Cloud
Chirp 3 de Google completa las opciones gestionadas, con amplia cobertura de idiomas y la sencillez operativa de seguir con un proveedor de nube que muchos equipos ya usan. Rara vez encabeza las clasificaciones independientes de precisión en inglés en streaming, pero la realidad de las compras, con contratos existentes, requisitos de cumplimiento y una sola factura, mantiene su presencia en producción.
Ink frente a Whisper: cuándo pierde la opción de código abierto
La comparación que más vemos es entre Cartesia Ink y OpenAI Whisper, así que merece una respuesta propia. La pregunta parece ser qué modelo es mejor, pero la verdadera pregunta es qué tarea necesitas resolver.
Whisper gana cuando tienes archivos, muchos idiomas y tus propias GPU: transcripciones por lotes de llamadas grabadas, pódcast o archivos históricos, a bajo coste y a escala, sin factura por minuto de un proveedor.
Ink gana cuando tienes una conversación en directo: transmite texto mientras habla el usuario, confirma palabras antes, predice el final del turno sin otro modelo y mantiene la precisión con números, identificadores y acentos. Esos son los errores que acaban en reservas equivocadas. Ejecutar Whisper con un adaptador de streaming te obliga a gestionar los fragmentos, la detección del final del habla y las alucinaciones durante silencios, y pagas esa complejidad con latencia de ida y vuelta.
Un criterio para desempatar: si tu sistema ya incluye Silero, Krisp y una máquina de estados de tiempos de espera de silencio sostenida con reintentos, esa maquinaria compensa el uso de un modelo por lotes en una tarea de streaming. Un modelo diseñado para streaming la sustituye.
¿Qué modelo de voz a texto deberías elegir?
Ajusta el modelo a la tarea:
| Tu tarea | Empieza por |
|---|---|
| Agente de voz en inglés en directo | Ink 2 |
| Transcripción multilingüe en directo | Deepgram Nova-3, AssemblyAI Universal realtime |
| Archivos por lotes, con alojamiento propio | Whisper large-v3 |
| Transcripción y análisis en una API | AssemblyAI Universal |
| Mantener un contrato de nube existente | Google Chirp 3 |
Después prueba con tu propio audio antes de comprometerte. Todas las cifras de esta página proceden de grabaciones ajenas; la clasificación que importa es la que produce tu tráfico. Pasa algunas de tus llamadas más difíciles, con acentos, voces superpuestas o una persona deletreando un código de confirmación, por las dos o tres opciones finalistas. Compara los resultados, incluidos los errores que tu producto no puede permitirse.
Si necesitas agentes de voz en inglés, prueba Ink 2 en el Playground sin configuración, o lee cómo crear un agente de voz para ver dónde encaja la transcripción en el sistema.
Documentación relacionada
- Anuncio de Ink 2: resultados de precisión, detección de turnos y latencia que sustentan la clasificación
- La tasa de error de palabras, explicada: por qué el WER es un diagnóstico, no un veredicto
- Detección de actividad de voz para agentes: por qué falla la detección del final del habla basada en silencio
- Crear un agente de voz con Pipecat y Cartesia: un sistema de streaming funcional con finales de turno anticipados de Ink
- Clasificación de voz a texto en streaming de Artificial Analysis: posiciones actuales de los proveedores