Aprende

Qué revela la prueba de STT en streaming de Coval sobre la latencia de inferencia

Rene 
Qué revela la prueba de STT en streaming de Coval sobre la latencia de inferencia

Creo que la prueba de STT en streaming de Coval es útil porque vuelve a situar la infraestructura de inferencia en el debate, donde realmente funcionan los productos conversacionales. Si solo comparas pesos de modelos, pierdes la parte de latencia que más sienten los usuarios: el recorrido de despliegue, la región y el endpoint que colocas detrás del modelo.

Qué mide realmente la prueba de STT en streaming de Coval

En la consulta del 14 de septiembre de 2026, la página WER de Coval enumera 30 modelos STT y 28 TTS en una ventana móvil de 30 días. La tabla STT muestra la tasa de error de palabras junto con la latencia de transcripción y el número de muestras. Algunas filas tienen decenas de miles de muestras y otras muchas menos. Esas diferencias importan al interpretar una clasificación. Clasificación WER de Coval

La página también ofrece varias vistas de latencia, incluido el tiempo hasta el segmento final, hasta el primer token y hasta la transcripción final. Resulta útil porque cada producto prioriza un momento distinto. Una herramienta de subtitulado en directo necesita rapidez en la transcripción final; un agente de voz necesita saber cuándo puede volver a hablar con seguridad. Descripción de las pruebas de Coval Clasificación WER de Coval

Coval ejecuta la prueba pública desde una región fija. Eso hace más uniforme la comparación porque se accede a cada modelo desde el mismo lugar. También significa que la cifra pertenece a la prueba, no representa la latencia que verán tus usuarios desde sus ciudades o redes. Descripción de las pruebas de Coval

Esa configuración importa porque la clasificación mide el tramo de inferencia de extremo a extremo. Si un modelo está detrás de un endpoint compartido o un despliegue mal ubicado, las cifras absorben ese coste. La prueba evalúa los pesos y también el recorrido que sigue el audio para llegar a ellos y volver. Clasificación WER de Coval Descripción de las pruebas de Coval

Dónde está Baseten en la clasificación STT de Coval

En la tabla de Coval consultada el 14 de septiembre, el endpoint Qwen3 ASR 1.7b de Baseten registra 39 ms de TTFS y un WER del 3,9 % en 1.192 muestras. Son medidas de ese endpoint en las condiciones de prueba de Coval. Clasificación WER de Coval

El propio artículo de Baseten afirma que el despliegue es aproximadamente cinco veces más rápido que el de OpenAI. Las filas originales de Coval son más precisas que ese titular y muestran por qué la proporción exacta depende del endpoint de OpenAI elegido. Las filas de OpenAI no tienen todas el mismo TTFS. Artículo de Baseten sobre la prueba Clasificación WER de Coval

El artículo de Baseten del 9 de septiembre describe su resultado de acceso anticipado como aproximadamente cinco veces más rápido que el de OpenAI. Trátalo como una afirmación de proveedor fechada y con una base concreta. Antes de aplicar esa proporción a una compra, comprueba el modelo, el endpoint, la fecha de medición y la definición de latencia de ambos lados. Artículo de Baseten sobre la prueba Clasificación WER de Coval

Cómo la inferencia dedicada y el despliegue producen esas diferencias

Coval marca algunas filas como inferencia dedicada y otras como compartida. Muchas gráficas de modelos omiten esa parte, que también puede desplazar un despliegue a la izquierda en el gráfico de Pareto sin cambiar los pesos del modelo. Clasificación WER de Coval

El artículo de Baseten atribuye su resultado a la inferencia dedicada y al escalado automático ajustado. Eso encaja con el comportamiento de producción. La capacidad reservada reduce la variación causada por otros usuarios del hardware y una mejor ubicación acorta el tiempo de red antes de que el modelo empiece a trabajar. Artículo de Baseten sobre la prueba

Un endpoint compartido puede parecer adecuado en una demo y funcionar peor en producción. La consistencia de latencia importa tanto como la mediana cuando hay carga. Si p95 se desplaza o se amplía la banda p25-p75, el usuario experimenta vacilación, no solo una fila más lenta en una prueba. Artículo de Baseten sobre la prueba Clasificación WER de Coval

Por eso importa la proximidad. Situar la inferencia cerca del usuario reduce el tiempo de ida y vuelta. En productos conversacionales, esa reducción se aprecia aunque el modelo no cambie. Descripción de las pruebas de Coval

Qué controla la prueba y dónde puede distorsionar decisiones de producto

La región y el ejecutor fijos de Coval eliminan una fuente de ruido. Hacen la prueba más reproducible, pero también facilitan confundir la igualdad de condiciones con la realidad del producto, que es otra cosa. Descripción de las pruebas de Coval

El número de muestras importa por el mismo motivo. Coval lo muestra en cada fila. Algunas tienen muchas y otras bastantes menos. Así sabes cuándo una estimación puntual se apoya en decenas de miles de enunciados y cuándo no. Clasificación WER de Coval

Por eso las comparaciones de proveedores que ignoran la capa de inferencia suelen inducir a error. Un modelo puede ser fácil de alojar en un laboratorio y volverse caro o inconsistente al añadir coordinación, escalado automático y la red entre quien llama y el servidor. Artículo de Baseten sobre la prueba Descripción de las pruebas de Coval

La metodología también cambia cómo comparas clasificaciones. TTFS, TTFT y el tiempo de transcripción final no son intercambiables. Si los tratas como equivalentes, compararás cifras que responden preguntas distintas. Clasificación WER de Coval

Cómo reproducir un flujo STT de baja latencia y bajo WER con Cartesia Ink-2

Si intentas acelerar las respuestas de un agente de voz, empieza eligiendo un modelo STT diseñado para gestionar turnos, además de transcribir. Ink-2 de Cartesia expone detección de turnos configurable e indicaciones de términos clave. Puedes ajustar cuándo decide que el usuario ha terminado e indicarle los nombres y la jerga que debe esperar. Documentación de Cartesia Ink-2

La detección de final forma parte de la capacidad de respuesta. Si el modelo tarda demasiado en confirmar un turno, el resto del sistema espera; si termina demasiado pronto, interrumpes al usuario. El ajuste adecuado no es añadir más modelo, sino controlar el detector de turnos. Documentación de Cartesia Ink-2 LiveKit Agents

El mismo modelo puede dar resultados distintos según el despliegue. Coval lo muestra al separar inferencia dedicada y compartida. El artículo de Baseten presenta el mismo patrón desde el proveedor: las decisiones de despliegue cambian la latencia sin exigir otros pesos. Entrada de Ink-2 en Coval Artículo de Baseten sobre la prueba

Si la precisión de la transcripción final importa más que los primeros resultados parciales, prioriza la finalización semántica. Si el producto necesita hablar antes, unos resultados parciales más rápidos pueden ser preferibles. En ese caso aceptas explícitamente algo más de riesgo de transcripción a cambio de una pausa conversacional menor. AA-WER Streaming de Artificial Analysis

El informe de Artificial Analysis del 1 de junio de 2026 midió Ink-2 con detección semántica de final y obtuvo un WER del 3,59 % y 0,21 segundos hasta la primera transcripción final tras detectar el fin del habla. Distintos conjuntos de datos, ajustes de finalización y definiciones de tiempo pueden producir resultados distintos para el mismo modelo. AA-WER Streaming de Artificial Analysis Entrada de Ink-2 en Coval

Las indicaciones de términos clave son otro ajuste que conviene probar antes de cambiar de modelo. Si la transcripción confunde nombres de productos o jerga interna, indicar al STT qué debe esperar suele ser más barato y específico que cambiar de proveedor. Documentación de Cartesia Ink-2

Para ajustar producción también importa la compatibilidad del framework. LiveKit Agents expone puntos de configuración del proveedor donde encajan los ajustes de detección de turnos y términos clave. El objetivo es conectar el modelo al recorrido real de la llamada que publicas. LiveKit Agents

Compromisos prácticos: las transcripciones más rápidas suelen sacrificar precisión, y viceversa

Los resultados de Artificial Analysis del 1 de junio de 2026 sitúan a Deepgram Flux en un WER del 7,36 % y 0,020 segundos hasta la primera transcripción final tras detectar el fin del habla. Ink-2 con detección semántica de final registró un WER del 3,59 % y 0,21 segundos en esa medida. Flux devolvió antes la transcripción final; Ink-2 cometió menos errores en esta prueba. Los resultados describen las configuraciones y el conjunto de datos evaluados. AA-WER Streaming de Artificial Analysis

Así debe interpretarse una prueba de STT en streaming. No dice qué modelo es mejor en abstracto. Un modelo que gana en velocidad puede perder en errores importantes para un agente real, como dirigir una llamada al destino equivocado o no reconocer un nombre de producto. Clasificación WER de Coval AA-WER Streaming de Artificial Analysis

La latencia de cola convierte un sistema normalmente bueno en uno molesto. Una mediana baja con colas amplias en p95 o p99 significa que a veces los usuarios soportan pausas que hacen parecer inseguro al agente, aunque el caso medio sea adecuado. Clasificación WER de Coval

Prueba por separado la ubicación del despliegue, la capacidad del endpoint, la detección de turnos y las indicaciones de términos clave. Registra el efecto de cada cambio sobre los errores y la latencia antes de combinarlos. Así obtienes evidencia de qué mejora tu aplicación. Artículo de Baseten sobre la prueba Documentación de Cartesia Ink-2

Qué deben medir los ingenieros en su sistema antes de elegir proveedor

La cifra que importa es la medida en tu propio recorrido. Para STT, significa medir desde la detección del final del habla hasta la llegada del segmento final en tus condiciones reales de telefonía o WebRTC. No sirve una ruta limpia de laboratorio que evite tu red real. Descripción de las pruebas de Coval

También necesitas percentiles, no solo una mediana. Si p50 es excelente, pero p95 y p99 se dispersan, el usuario oye un sistema a veces rápido y a veces incómodo. Suele ser peor que uno algo más lento, pero consistente. Clasificación WER de Coval

Reproduce audio representativo de producción, incluidos los acentos, el ruido de fondo y el vocabulario especializado que debe procesar la aplicación. Conserva un conjunto de evaluación separado para que los ajustes no optimicen simplemente las grabaciones usadas durante el desarrollo.

Usa la clasificación pública para seleccionar candidatos, no como respuesta definitiva. Después ejecútalos en tu región, con tu concurrencia y a través de tu sistema antes de decidir qué oirán tus usuarios. Descripción de las pruebas de Coval Artículo de Baseten sobre la prueba

Empieza con pocos endpoints candidatos y un corpus de evaluación fijo. Registra errores de transcripción, retraso de finalización y latencia desde el fin del habla hasta el primer audio con la concurrencia prevista. Elige la configuración que cumpla los objetivos de error y respuesta de tu aplicación y repite la prueba cuando cambie el modelo o el despliegue.

Preguntas frecuentes

¿Que Baseten gane en Coval significa que es el mejor STT para mis usuarios?

No automáticamente. Coval mide precisión mediante WER y latencia posterior al habla desde una región fija con conjuntos de datos y endpoints concretos. Las cifras muestran lo que Baseten logró con ese ejecutor y configuración, pero la latencia de producción depende de tu región, concurrencia, coordinación e inferencia compartida o dedicada.

¿Por qué algunos proveedores muestran mucha menos latencia que otros?

Las pruebas que miden la capa de inferencia y la latencia posterior al habla exponen diferencias de despliegue. Endpoints dedicados, hardware reservado, regiones próximas y escalado automático ajustado reducen la dispersión de latencia. Los modelos optimizados para velocidad o servidos en hardware dedicado asumen compromisos de ingeniería y coste distintos de los endpoints compartidos.

¿Qué métrica debo medir para saber si un modelo parecerá rápido al conversar?

Mide desde el final del habla del usuario hasta el primer audio de respuesta reproducible del agente completo. Mide por separado desde la solicitud TTS hasta el primer audio. Para STT, registra desde el fin del habla hasta la primera transcripción parcial utilizable y hasta la final. Sigue p50, p95 y p99 con la concurrencia y las condiciones de red previstas.