Je trouve le benchmark STT en continu de Coval utile parce qu’il remet l’infrastructure d’inférence au centre du débat, là où les produits conversationnels fonctionnent réellement. Comparer uniquement les poids des modèles fait manquer la latence la plus perceptible : le parcours de déploiement, la région et le point de terminaison derrière le modèle.
Ce que mesure réellement le benchmark STT en continu de Coval
Lors de la consultation du 14 septembre 2026, la page WER de Coval recensait 30 modèles STT et 28 modèles TTS sur une fenêtre glissante de 30 jours. Le tableau STT indique WER, latence de transcription et nombre d’échantillons. Certaines lignes comptent des dizaines de milliers d’échantillons, d’autres bien moins. Ces différences comptent pour lire le classement. Classement WER de Coval
La page propose plusieurs vues de latence, dont le délai du segment final, du premier token et de la transcription finale. C’est utile car les produits attendent des moments différents : un sous-titrage en direct privilégie la transcription finale rapide, tandis qu’un agent doit savoir quand reprendre la parole sans risque. Présentation des benchmarks Coval Classement WER de Coval
Coval exécute le benchmark public depuis une région fixe. La comparaison est plus homogène, chaque modèle étant appelé du même endroit. Mais le chiffre reste celui du benchmark, pas la latence que vos utilisateurs verront depuis leur ville ou réseau. Présentation des benchmarks Coval
Cette configuration compte car le classement mesure tout le trajet d’inférence. Un point de terminaison partagé ou un déploiement mal placé ajoute son coût aux chiffres. Le test mesure donc les poids et le parcours de l’audio pour les atteindre et en revenir. Classement WER de Coval Présentation des benchmarks Coval
La position de Baseten dans le classement STT de Coval
Dans le tableau consulté le 14 septembre, Qwen3 ASR 1.7b de Baseten affiche 39 ms de TTFS et 3,9 % de WER sur 1 192 échantillons. Ce sont les mesures de ce point de terminaison dans les conditions de Coval. Classement WER de Coval
L’article de Baseten annonce un déploiement environ cinq fois plus rapide que celui d’OpenAI. Les lignes brutes de Coval sont plus précises et montrent pourquoi le ratio dépend du point de terminaison OpenAI retenu : leurs TTFS ne sont pas tous identiques. Article de Baseten sur le benchmark Classement WER de Coval
L’article du 9 septembre de Baseten décrit son résultat en accès anticipé comme environ cinq fois plus rapide qu’OpenAI. Traitez-le comme une affirmation fournisseur datée avec une référence précise. Avant d’en faire un critère d’achat, vérifiez modèle, point de terminaison, date de mesure et définition de latence des deux côtés. Article de Baseten sur le benchmark Classement WER de Coval
Comment l’inférence dédiée et le déploiement créent ces écarts
Coval distingue les lignes en inférence dédiée et partagée. Beaucoup de graphiques de modèles omettent cette dimension, qui peut pourtant déplacer un déploiement vers la gauche du graphique de Pareto sans changer les poids. Classement WER de Coval
Baseten attribue son résultat à l’inférence dédiée et à l’ajustement de l’autoscaling. Cela correspond à la production : la capacité réservée réduit la variance causée par les autres utilisateurs du matériel, et un meilleur emplacement réduit le réseau avant même le début du calcul. Article de Baseten sur le benchmark
Un point de terminaison partagé peut sembler bon en démonstration et moins bon en production. Sous charge, la régularité compte autant que la médiane. Si le p95 dérive ou que la bande p25-p75 s’élargit, l’utilisateur ressent une hésitation, pas seulement une ligne plus lente dans un benchmark. Article de Baseten sur le benchmark Classement WER de Coval
La proximité compte donc. Placer l’inférence près de l’utilisateur réduit l’aller-retour, et cette réduction se ressent dans une conversation même si le modèle reste identique. Présentation des benchmarks Coval
Ce que contrôle le benchmark et ce qui peut fausser une décision produit
La région et l’exécuteur fixes de Coval éliminent une source de bruit. Ils rendent le test reproductible, mais facilitent aussi la confusion entre équité du benchmark et réalité du produit, qui sont différentes. Présentation des benchmarks Coval
Les nombres d’échantillons comptent pour la même raison. Coval les affiche par ligne, parfois très grands, parfois faibles. Ils indiquent quand une estimation repose sur des dizaines de milliers d’énoncés et quand ce n’est pas le cas. Classement WER de Coval
C’est pourquoi les comparaisons qui ignorent l’inférence trompent souvent. Un modèle facile à héberger au laboratoire peut devenir coûteux ou irrégulier avec orchestration, autoscaling et réseau entre appelant et serveur. Article de Baseten sur le benchmark Présentation des benchmarks Coval
La méthodologie change aussi les comparaisons entre classements. TTFS, TTFT et délai de transcription finale ne sont pas interchangeables. Les traiter comme tels revient à comparer des réponses à des questions différentes. Classement WER de Coval
Reproduire une chaîne STT à faible latence et faible WER avec Ink-2
Pour accélérer un agent, choisissez d’abord un STT conçu pour les tours de parole autant que pour la transcription. Ink-2 de Cartesia propose détection configurable et indications de termes clés. Vous pouvez ajuster le moment où il conclut que l’utilisateur a terminé et préciser les noms et le jargon attendus. Documentation Ink-2 de Cartesia
La fin de tour fait partie de la réactivité. Trop attendre bloque le reste de la chaîne ; finir trop tôt interrompt l’utilisateur. Le bon réglage n’est pas davantage de modèle, mais un détecteur de tours réellement contrôlable. Documentation Ink-2 de Cartesia LiveKit Agents
Un même modèle donne des résultats différents selon le déploiement. Coval le montre en séparant dédié et partagé. Baseten présente le même phénomène côté fournisseur : les choix de déploiement changent la latence sans exiger de nouveaux poids. Entrée Ink-2 de Coval Article de Baseten sur le benchmark
Si l’exactitude finale prime sur les premiers résultats partiels, privilégiez la finalisation sémantique. Si le produit doit parler plus tôt, des résultats partiels rapides peuvent gagner, mais vous acceptez explicitement plus de risque de transcription contre une pause plus courte. AA-WER Streaming d’Artificial Analysis
Le rapport Artificial Analysis du 1er juin 2026 mesure Ink-2 avec fins sémantiques à 3,59 % de WER et 0,21 seconde jusqu’à la première transcription finale après détection de fin de parole. Jeux de données, réglages et définitions temporelles différents peuvent produire d’autres résultats pour le même modèle. AA-WER Streaming d’Artificial Analysis Entrée Ink-2 de Coval
Les indications de termes clés méritent aussi un test avant de changer de modèle. Si les noms de produits ou le jargon interne sont déformés, indiquer les termes attendus coûte généralement moins cher et cible mieux le problème qu’un changement de fournisseur. Documentation Ink-2 de Cartesia
La compatibilité du framework compte aussi en production. LiveKit Agents expose des points de configuration fournisseur où placer les réglages de tours et de termes clés. L’objectif est de relier le modèle au parcours d’appel réellement déployé. LiveKit Agents
Les compromis entre vitesse et exactitude
Les résultats Artificial Analysis du 1er juin 2026 donnent à Deepgram Flux 7,36 % de WER et 0,020 seconde jusqu’à la première transcription finale après détection de fin de parole. Ink-2 avec fins sémantiques obtient 3,59 % et 0,21 seconde. Flux finalise plus tôt ; Ink-2 fait moins d’erreurs dans ce test. Ces résultats décrivent les configurations et données évaluées. AA-WER Streaming d’Artificial Analysis
C’est ainsi qu’il faut lire un benchmark STT en continu. Il ne désigne pas le meilleur modèle dans l’absolu. Le gagnant en vitesse peut perdre sur des erreurs importantes pour un agent, comme une mauvaise orientation d’appel ou un nom de produit manqué. Classement WER de Coval AA-WER Streaming d’Artificial Analysis
Les latences extrêmes rendent agaçant un système habituellement bon. Une médiane faible avec de longues queues au p95 ou p99 signifie que certains utilisateurs subissent des pauses donnant l’impression d’un agent incertain, même si la moyenne convient. Classement WER de Coval
Testez séparément emplacement, capacité, détection des tours et termes clés. Consignez l’effet de chaque changement sur erreurs et latence avant de les combiner. Vous saurez ainsi ce qui améliore votre application. Article de Baseten sur le benchmark Documentation Ink-2 de Cartesia
Ce que les ingénieurs doivent mesurer avant de choisir
Le chiffre pertinent vient de votre propre parcours. Pour le STT, mesurez de la détection de fin de parole à l’arrivée du segment final, dans vos conditions réelles de téléphonie ou WebRTC, pas sur un trajet de laboratoire qui évite votre réseau. Présentation des benchmarks Coval
Il faut des percentiles, pas seulement une médiane. Un p50 excellent avec des p95 et p99 dispersés produit un système tantôt rapide, tantôt gênant, souvent moins agréable qu’un système un peu plus lent mais constant. Classement WER de Coval
Rejouez un audio représentatif de production avec vos accents, bruits et vocabulaire. Gardez un jeu d’évaluation séparé pour éviter d’optimiser simplement les enregistrements de développement.
Le classement public sert à présélectionner, pas à conclure. Exécutez ensuite les candidats dans votre région, avec votre concurrence et votre chaîne, avant de choisir ce que les utilisateurs entendront. Présentation des benchmarks Coval Article de Baseten sur le benchmark
Commencez par quelques points de terminaison et un corpus fixe. Consignez erreurs de transcription, délai de finalisation et délai de fin de parole au premier audio sous la concurrence prévue. Choisissez la configuration qui atteint vos objectifs, puis recommencez quand modèle ou déploiement change.