Historias de clientes

La evaluación de IA de voz de Speko recomienda Sonic 3.5 con mayor frecuencia

Speko enruta IA de voz. Los desarrolladores crean y ejecutan agentes con una API y Speko elige los modelos de voz a texto, LLM y texto a voz de cada llamada según idioma y uso. La elección procede de una prueba que repite cada dos o tres días con aproximadamente una docena de proveedores. En texto a voz, Sonic 3.5 de Cartesia es el modelo que gana más a menudo.

Básicamente creamos un enrutador abierto de IA de voz. Intentamos ser esa capa neutral que ayuda a elegir la combinación adecuada de modelos.

Beknazar AbdikamalovFundador de Speko

Tres decisiones de modelo y nadie neutral a quien preguntar

Aproximadamente el 95 % de la IA de voz funciona en cascada: voz a texto, LLM y texto a voz. Son tres decisiones por agente, y la mayoría de los proveedores que opinan tiene interés en la respuesta. Llegan nuevos proveedores y hay más opciones cada mes, sin mayor claridad sobre cuáles funcionan bien.

Fuera del inglés es más difícil. Un modelo que lee bien en inglés puede perder estabilidad o expresividad en otro idioma y apenas hay datos públicos al respecto. Las empresas capaces de evaluarlo por su cuenta ya saben qué combinaciones funcionan en cada caso. Las demás eligen por páginas comerciales.

Una evaluación que se renueva cada dos o tres días

Speko evalúa por fases para que un modelo nuevo pase comprobaciones automáticas baratas antes de invertir más. Sus agentes vigilan X y Hugging Face en busca de lanzamientos prometedores, que pasan primero esas pruebas. Los buenos resultados avanzan a evaluación humana y pruebas de mayor presupuesto. En cada momento sigue aproximadamente una docena de proveedores.

Repetir cada dos o tres días mantiene las cifras vinculadas a versiones actuales en lugar de lanzamientos del trimestre anterior. Cada categoría tiene criterios propios. Texto a voz tiene tres:

  • Inteligibilidad. ¿Lee el texto de forma sensata, teniendo en cuenta el contexto y con calidad utilizable en producción, además de pronunciar las palabras correctas?
  • Estabilidad. ¿La voz se mantiene consistente durante la generación o varían la calidad, el tono y el ritmo?
  • Naturalidad. ¿Suena humana o hay rasgos robóticos que rompen la experiencia?

Puntuar cada aspecto por separado permite recomendar según el uso. Abdikamalov divide a la mayoría de los clientes en dos grupos. Los agentes de soporte priorizan latencia y resolución rápida y precisa. Los productos de orientación y terapia necesitan voces humanas. La mayoría de los proveedores destaca en uno u otro.

Por qué Speko eligió Cartesia

Sonic 3.5 lidera la clasificación general TTS de Speko con la mejor combinación de velocidad y naturalidad y un precio competitivo frente a los otros modelos evaluados. Esos dos ejes cubren gran parte de lo que crean sus clientes: latencia para soporte y naturalidad para orientación y terapia. Destacar en ambos es poco habitual y hace que Sonic 3.5 sea su recomendación más frecuente.

Aquí, predeterminado significa recomendado con mayor frecuencia, no seleccionado automáticamente. Si los requisitos apuntan a otro proveedor, Speko dirige allí al cliente. La recomendación sigue al caso de uso y Sonic gana en muchos con los criterios que importan.

Hacer invisible la selección de modelos

Speko trabaja en dos frentes. El primero es que los clientes no tengan que pensar en seleccionar modelos. Abdikamalov no quiere que acertar dependa de cuánto entiendan la tecnología subyacente.

Queremos que no tengan que saber de selección de modelos. Idealmente, ni siquiera deberían necesitar conocer qué hay por debajo.

Beknazar AbdikamalovFundador de Speko

El segundo es convertirse en la evaluación de confianza del sector. Muchas clasificaciones no publican metodología suficiente para comprobar los resultados; otras usan demos limitadas que dicen poco de producción. Speko quiere pruebas que se renueven según un calendario, publiquen su funcionamiento y evalúen lo que los clientes realmente construyen.

Abdikamalov estima que hoy alrededor del 1 % de las empresas usa IA de voz. A medida que crezca, aumentarán los modelos. El reto seguirá siendo saber en cuáles confiar y para qué.