Speko est un routeur pour l’IA vocale. Les développeurs créent et exploitent leurs agents via une seule API. Speko choisit les modèles de transcription, de langage et de synthèse vocale pour chaque appel selon sa langue et son usage. Ces choix reposent sur un benchmark relancé tous les deux à trois jours auprès d’une douzaine de fournisseurs. Pour la synthèse vocale, Sonic 3.5 de Cartesia arrive le plus souvent en tête.
Nous construisons en quelque sorte un routeur ouvert pour l’IA vocale. Nous voulons être une couche neutre qui aide les gens à choisir la bonne combinaison de modèles.
Le défi : trois choix de modèles, sans interlocuteur neutre
Environ 95 % de l’IA vocale fonctionne en cascade : transcription, puis LLM, puis synthèse vocale. Cela fait trois choix distincts par agent, et les fournisseurs qui donnent leur avis ont généralement un intérêt dans la réponse. De nouveaux acteurs arrivent sans cesse. Les options augmentent chaque mois, sans que les performances deviennent plus claires.
Hors de l’anglais, le choix se complique. Une voix convaincante en anglais peut dériver ou devenir monotone dans une autre langue, avec très peu de données publiques pour le savoir. Les entreprises assez grandes pour mener leurs propres évaluations savent quelles combinaisons fonctionnent. Les autres choisissent à partir des pages marketing.
La solution : un benchmark actualisé tous les deux à trois jours
Speko évalue par étapes. Un nouveau modèle passe d’abord des contrôles automatisés peu coûteux. Des agents surveillent X et Hugging Face pour repérer les sorties prometteuses et les soumettre à ces contrôles. Les meilleurs passent ensuite à l’évaluation humaine et à des tests plus coûteux. Une douzaine de fournisseurs sont suivis à tout moment.
En relançant les tests tous les deux à trois jours, Speko mesure les versions actuelles plutôt que celles du trimestre précédent. Chaque catégorie a ses critères. La synthèse vocale en a trois :
- L’intelligibilité : le modèle lit-il le texte de façon cohérente, adaptée au contexte et utilisable en production, au-delà de la simple exactitude des mots ?
- La dérive : la voix reste-t-elle constante pendant une génération, ou la qualité, le ton et le rythme changent-ils ?
- Le naturel : la voix semble-t-elle humaine, ou des caractéristiques robotiques perturbent-elles l’expérience ?
Évaluer ces critères séparément permet de recommander un modèle selon l’usage. Abdikamalov distingue surtout deux groupes de clients. L’assistance se concentre sur la latence et mesure la réussite par une résolution rapide et exacte. Le coaching et les produits de thérapie ont besoin de voix humaines. La plupart des fournisseurs sont bons dans l’un ou l’autre.
Pourquoi Speko a choisi Cartesia
Sonic 3.5 domine le classement global de synthèse vocale de Speko avec la meilleure combinaison de rapidité et de naturel, tout en restant compétitif sur le prix. Ces deux axes couvrent la plupart des usages de ses clients : la latence pour l’assistance, le naturel pour le coaching et la thérapie. Réussir les deux est rare, d’où la fréquence des recommandations de Sonic 3.5.
Ici, “par défaut” signifie le plus souvent recommandé, pas automatiquement sélectionné. Si les besoins du client pointent ailleurs, Speko l’oriente vers un autre modèle. La recommandation suit l’usage, et Sonic gagne souvent sur les critères importants.
La suite : rendre le choix des modèles invisible
Speko travaille sur deux objectifs. Le premier est de faire du choix des modèles une question à laquelle les clients n’ont plus à penser. Pour Abdikamalov, la bonne combinaison ne doit pas dépendre de leur connaissance des modèles sous-jacents.
Faire en sorte que les gens n’aient pas à connaître la sélection des modèles. Idéalement, ils ne devraient même pas savoir ce qu’il y a sous le capot.
Le second est de devenir le benchmark de confiance du secteur. Beaucoup de classements ne publient pas assez de méthode pour vérifier les résultats. D’autres s’appuient sur des démos étroites qui renseignent peu sur la production. Speko veut des tests réguliers, une méthode publiée et des usages correspondant à ce que les clients construisent réellement.
Abdikamalov estime qu’environ 1 % des entreprises utilisent l’IA vocale aujourd’hui. Avec leur nombre, celui des modèles augmentera. La difficulté restera de savoir auxquels se fier et pour quels usages.