Creo que la prueba de STT en streaming de Coval es útil porque vuelve a situar la infraestructura de inferencia en el debate, donde realmente funcionan los productos conversacionales. Si solo comparas pesos de modelos, pierdes la parte de latencia que más sienten los usuarios: el recorrido de despliegue, la región y el endpoint que colocas detrás del modelo.
Qué mide realmente la prueba de STT en streaming de Coval
En la consulta del 14 de septiembre de 2026, la página WER de Coval enumera 30 modelos STT y 28 TTS en una ventana móvil de 30 días. La tabla STT muestra la tasa de error de palabras junto con la latencia de transcripción y el número de muestras. Algunas filas tienen decenas de miles de muestras y otras muchas menos. Esas diferencias importan al interpretar una clasificación. Clasificación WER de Coval
La página también ofrece varias vistas de latencia, incluido el tiempo hasta el segmento final, hasta el primer token y hasta la transcripción final. Resulta útil porque cada producto prioriza un momento distinto. Una herramienta de subtitulado en directo necesita rapidez en la transcripción final; un agente de voz necesita saber cuándo puede volver a hablar con seguridad. Descripción de las pruebas de Coval Clasificación WER de Coval
Coval ejecuta la prueba pública desde una región fija. Eso hace más uniforme la comparación porque se accede a cada modelo desde el mismo lugar. También significa que la cifra pertenece a la prueba, no representa la latencia que verán tus usuarios desde sus ciudades o redes. Descripción de las pruebas de Coval
Esa configuración importa porque la clasificación mide el tramo de inferencia de extremo a extremo. Si un modelo está detrás de un endpoint compartido o un despliegue mal ubicado, las cifras absorben ese coste. La prueba evalúa los pesos y también el recorrido que sigue el audio para llegar a ellos y volver. Clasificación WER de Coval Descripción de las pruebas de Coval
Dónde está Baseten en la clasificación STT de Coval
En la tabla de Coval consultada el 14 de septiembre, el endpoint Qwen3 ASR 1.7b de Baseten registra 39 ms de TTFS y un WER del 3,9 % en 1.192 muestras. Son medidas de ese endpoint en las condiciones de prueba de Coval. Clasificación WER de Coval
El propio artículo de Baseten afirma que el despliegue es aproximadamente cinco veces más rápido que el de OpenAI. Las filas originales de Coval son más precisas que ese titular y muestran por qué la proporción exacta depende del endpoint de OpenAI elegido. Las filas de OpenAI no tienen todas el mismo TTFS. Artículo de Baseten sobre la prueba Clasificación WER de Coval
El artículo de Baseten del 9 de septiembre describe su resultado de acceso anticipado como aproximadamente cinco veces más rápido que el de OpenAI. Trátalo como una afirmación de proveedor fechada y con una base concreta. Antes de aplicar esa proporción a una compra, comprueba el modelo, el endpoint, la fecha de medición y la definición de latencia de ambos lados. Artículo de Baseten sobre la prueba Clasificación WER de Coval
Cómo la inferencia dedicada y el despliegue producen esas diferencias
Coval marca algunas filas como inferencia dedicada y otras como compartida. Muchas gráficas de modelos omiten esa parte, que también puede desplazar un despliegue a la izquierda en el gráfico de Pareto sin cambiar los pesos del modelo. Clasificación WER de Coval
El artículo de Baseten atribuye su resultado a la inferencia dedicada y al escalado automático ajustado. Eso encaja con el comportamiento de producción. La capacidad reservada reduce la variación causada por otros usuarios del hardware y una mejor ubicación acorta el tiempo de red antes de que el modelo empiece a trabajar. Artículo de Baseten sobre la prueba
Un endpoint compartido puede parecer adecuado en una demo y funcionar peor en producción. La consistencia de latencia importa tanto como la mediana cuando hay carga. Si p95 se desplaza o se amplía la banda p25-p75, el usuario experimenta vacilación, no solo una fila más lenta en una prueba. Artículo de Baseten sobre la prueba Clasificación WER de Coval
Por eso importa la proximidad. Situar la inferencia cerca del usuario reduce el tiempo de ida y vuelta. En productos conversacionales, esa reducción se aprecia aunque el modelo no cambie. Descripción de las pruebas de Coval
Qué controla la prueba y dónde puede distorsionar decisiones de producto
La región y el ejecutor fijos de Coval eliminan una fuente de ruido. Hacen la prueba más reproducible, pero también facilitan confundir la igualdad de condiciones con la realidad del producto, que es otra cosa. Descripción de las pruebas de Coval
El número de muestras importa por el mismo motivo. Coval lo muestra en cada fila. Algunas tienen muchas y otras bastantes menos. Así sabes cuándo una estimación puntual se apoya en decenas de miles de enunciados y cuándo no. Clasificación WER de Coval
Por eso las comparaciones de proveedores que ignoran la capa de inferencia suelen inducir a error. Un modelo puede ser fácil de alojar en un laboratorio y volverse caro o inconsistente al añadir coordinación, escalado automático y la red entre quien llama y el servidor. Artículo de Baseten sobre la prueba Descripción de las pruebas de Coval
La metodología también cambia cómo comparas clasificaciones. TTFS, TTFT y el tiempo de transcripción final no son intercambiables. Si los tratas como equivalentes, compararás cifras que responden preguntas distintas. Clasificación WER de Coval
Cómo reproducir un flujo STT de baja latencia y bajo WER con Cartesia Ink-2
Si intentas acelerar las respuestas de un agente de voz, empieza eligiendo un modelo STT diseñado para gestionar turnos, además de transcribir. Ink-2 de Cartesia expone detección de turnos configurable e indicaciones de términos clave. Puedes ajustar cuándo decide que el usuario ha terminado e indicarle los nombres y la jerga que debe esperar. Documentación de Cartesia Ink-2
La detección de final forma parte de la capacidad de respuesta. Si el modelo tarda demasiado en confirmar un turno, el resto del sistema espera; si termina demasiado pronto, interrumpes al usuario. El ajuste adecuado no es añadir más modelo, sino controlar el detector de turnos. Documentación de Cartesia Ink-2 LiveKit Agents
El mismo modelo puede dar resultados distintos según el despliegue. Coval lo muestra al separar inferencia dedicada y compartida. El artículo de Baseten presenta el mismo patrón desde el proveedor: las decisiones de despliegue cambian la latencia sin exigir otros pesos. Entrada de Ink-2 en Coval Artículo de Baseten sobre la prueba
Si la precisión de la transcripción final importa más que los primeros resultados parciales, prioriza la finalización semántica. Si el producto necesita hablar antes, unos resultados parciales más rápidos pueden ser preferibles. En ese caso aceptas explícitamente algo más de riesgo de transcripción a cambio de una pausa conversacional menor. AA-WER Streaming de Artificial Analysis
El informe de Artificial Analysis del 1 de junio de 2026 midió Ink-2 con detección semántica de final y obtuvo un WER del 3,59 % y 0,21 segundos hasta la primera transcripción final tras detectar el fin del habla. Distintos conjuntos de datos, ajustes de finalización y definiciones de tiempo pueden producir resultados distintos para el mismo modelo. AA-WER Streaming de Artificial Analysis Entrada de Ink-2 en Coval
Las indicaciones de términos clave son otro ajuste que conviene probar antes de cambiar de modelo. Si la transcripción confunde nombres de productos o jerga interna, indicar al STT qué debe esperar suele ser más barato y específico que cambiar de proveedor. Documentación de Cartesia Ink-2
Para ajustar producción también importa la compatibilidad del framework. LiveKit Agents expone puntos de configuración del proveedor donde encajan los ajustes de detección de turnos y términos clave. El objetivo es conectar el modelo al recorrido real de la llamada que publicas. LiveKit Agents
Compromisos prácticos: las transcripciones más rápidas suelen sacrificar precisión, y viceversa
Los resultados de Artificial Analysis del 1 de junio de 2026 sitúan a Deepgram Flux en un WER del 7,36 % y 0,020 segundos hasta la primera transcripción final tras detectar el fin del habla. Ink-2 con detección semántica de final registró un WER del 3,59 % y 0,21 segundos en esa medida. Flux devolvió antes la transcripción final; Ink-2 cometió menos errores en esta prueba. Los resultados describen las configuraciones y el conjunto de datos evaluados. AA-WER Streaming de Artificial Analysis
Así debe interpretarse una prueba de STT en streaming. No dice qué modelo es mejor en abstracto. Un modelo que gana en velocidad puede perder en errores importantes para un agente real, como dirigir una llamada al destino equivocado o no reconocer un nombre de producto. Clasificación WER de Coval AA-WER Streaming de Artificial Analysis
La latencia de cola convierte un sistema normalmente bueno en uno molesto. Una mediana baja con colas amplias en p95 o p99 significa que a veces los usuarios soportan pausas que hacen parecer inseguro al agente, aunque el caso medio sea adecuado. Clasificación WER de Coval
Prueba por separado la ubicación del despliegue, la capacidad del endpoint, la detección de turnos y las indicaciones de términos clave. Registra el efecto de cada cambio sobre los errores y la latencia antes de combinarlos. Así obtienes evidencia de qué mejora tu aplicación. Artículo de Baseten sobre la prueba Documentación de Cartesia Ink-2
Qué deben medir los ingenieros en su sistema antes de elegir proveedor
La cifra que importa es la medida en tu propio recorrido. Para STT, significa medir desde la detección del final del habla hasta la llegada del segmento final en tus condiciones reales de telefonía o WebRTC. No sirve una ruta limpia de laboratorio que evite tu red real. Descripción de las pruebas de Coval
También necesitas percentiles, no solo una mediana. Si p50 es excelente, pero p95 y p99 se dispersan, el usuario oye un sistema a veces rápido y a veces incómodo. Suele ser peor que uno algo más lento, pero consistente. Clasificación WER de Coval
Reproduce audio representativo de producción, incluidos los acentos, el ruido de fondo y el vocabulario especializado que debe procesar la aplicación. Conserva un conjunto de evaluación separado para que los ajustes no optimicen simplemente las grabaciones usadas durante el desarrollo.
Usa la clasificación pública para seleccionar candidatos, no como respuesta definitiva. Después ejecútalos en tu región, con tu concurrencia y a través de tu sistema antes de decidir qué oirán tus usuarios. Descripción de las pruebas de Coval Artículo de Baseten sobre la prueba
Empieza con pocos endpoints candidatos y un corpus de evaluación fijo. Registra errores de transcripción, retraso de finalización y latencia desde el fin del habla hasta el primer audio con la concurrencia prevista. Elige la configuración que cumpla los objetivos de error y respuesta de tu aplicación y repite la prueba cuando cambie el modelo o el despliegue.