Apprendre

Ce que le benchmark STT en continu de Coval révèle sur la latence d'inférence

Rene 
Ce que le benchmark STT en continu de Coval révèle sur la latence d'inférence

Je trouve le benchmark STT en continu de Coval utile parce qu’il remet l’infrastructure d’inférence au centre du débat, là où les produits conversationnels fonctionnent réellement. Comparer uniquement les poids des modèles fait manquer la latence la plus perceptible : le parcours de déploiement, la région et le point de terminaison derrière le modèle.

Ce que mesure réellement le benchmark STT en continu de Coval

Lors de la consultation du 14 septembre 2026, la page WER de Coval recensait 30 modèles STT et 28 modèles TTS sur une fenêtre glissante de 30 jours. Le tableau STT indique WER, latence de transcription et nombre d’échantillons. Certaines lignes comptent des dizaines de milliers d’échantillons, d’autres bien moins. Ces différences comptent pour lire le classement. Classement WER de Coval

La page propose plusieurs vues de latence, dont le délai du segment final, du premier token et de la transcription finale. C’est utile car les produits attendent des moments différents : un sous-titrage en direct privilégie la transcription finale rapide, tandis qu’un agent doit savoir quand reprendre la parole sans risque. Présentation des benchmarks Coval Classement WER de Coval

Coval exécute le benchmark public depuis une région fixe. La comparaison est plus homogène, chaque modèle étant appelé du même endroit. Mais le chiffre reste celui du benchmark, pas la latence que vos utilisateurs verront depuis leur ville ou réseau. Présentation des benchmarks Coval

Cette configuration compte car le classement mesure tout le trajet d’inférence. Un point de terminaison partagé ou un déploiement mal placé ajoute son coût aux chiffres. Le test mesure donc les poids et le parcours de l’audio pour les atteindre et en revenir. Classement WER de Coval Présentation des benchmarks Coval

La position de Baseten dans le classement STT de Coval

Dans le tableau consulté le 14 septembre, Qwen3 ASR 1.7b de Baseten affiche 39 ms de TTFS et 3,9 % de WER sur 1 192 échantillons. Ce sont les mesures de ce point de terminaison dans les conditions de Coval. Classement WER de Coval

L’article de Baseten annonce un déploiement environ cinq fois plus rapide que celui d’OpenAI. Les lignes brutes de Coval sont plus précises et montrent pourquoi le ratio dépend du point de terminaison OpenAI retenu : leurs TTFS ne sont pas tous identiques. Article de Baseten sur le benchmark Classement WER de Coval

L’article du 9 septembre de Baseten décrit son résultat en accès anticipé comme environ cinq fois plus rapide qu’OpenAI. Traitez-le comme une affirmation fournisseur datée avec une référence précise. Avant d’en faire un critère d’achat, vérifiez modèle, point de terminaison, date de mesure et définition de latence des deux côtés. Article de Baseten sur le benchmark Classement WER de Coval

Comment l’inférence dédiée et le déploiement créent ces écarts

Coval distingue les lignes en inférence dédiée et partagée. Beaucoup de graphiques de modèles omettent cette dimension, qui peut pourtant déplacer un déploiement vers la gauche du graphique de Pareto sans changer les poids. Classement WER de Coval

Baseten attribue son résultat à l’inférence dédiée et à l’ajustement de l’autoscaling. Cela correspond à la production : la capacité réservée réduit la variance causée par les autres utilisateurs du matériel, et un meilleur emplacement réduit le réseau avant même le début du calcul. Article de Baseten sur le benchmark

Un point de terminaison partagé peut sembler bon en démonstration et moins bon en production. Sous charge, la régularité compte autant que la médiane. Si le p95 dérive ou que la bande p25-p75 s’élargit, l’utilisateur ressent une hésitation, pas seulement une ligne plus lente dans un benchmark. Article de Baseten sur le benchmark Classement WER de Coval

La proximité compte donc. Placer l’inférence près de l’utilisateur réduit l’aller-retour, et cette réduction se ressent dans une conversation même si le modèle reste identique. Présentation des benchmarks Coval

Ce que contrôle le benchmark et ce qui peut fausser une décision produit

La région et l’exécuteur fixes de Coval éliminent une source de bruit. Ils rendent le test reproductible, mais facilitent aussi la confusion entre équité du benchmark et réalité du produit, qui sont différentes. Présentation des benchmarks Coval

Les nombres d’échantillons comptent pour la même raison. Coval les affiche par ligne, parfois très grands, parfois faibles. Ils indiquent quand une estimation repose sur des dizaines de milliers d’énoncés et quand ce n’est pas le cas. Classement WER de Coval

C’est pourquoi les comparaisons qui ignorent l’inférence trompent souvent. Un modèle facile à héberger au laboratoire peut devenir coûteux ou irrégulier avec orchestration, autoscaling et réseau entre appelant et serveur. Article de Baseten sur le benchmark Présentation des benchmarks Coval

La méthodologie change aussi les comparaisons entre classements. TTFS, TTFT et délai de transcription finale ne sont pas interchangeables. Les traiter comme tels revient à comparer des réponses à des questions différentes. Classement WER de Coval

Reproduire une chaîne STT à faible latence et faible WER avec Ink-2

Pour accélérer un agent, choisissez d’abord un STT conçu pour les tours de parole autant que pour la transcription. Ink-2 de Cartesia propose détection configurable et indications de termes clés. Vous pouvez ajuster le moment où il conclut que l’utilisateur a terminé et préciser les noms et le jargon attendus. Documentation Ink-2 de Cartesia

La fin de tour fait partie de la réactivité. Trop attendre bloque le reste de la chaîne ; finir trop tôt interrompt l’utilisateur. Le bon réglage n’est pas davantage de modèle, mais un détecteur de tours réellement contrôlable. Documentation Ink-2 de Cartesia LiveKit Agents

Un même modèle donne des résultats différents selon le déploiement. Coval le montre en séparant dédié et partagé. Baseten présente le même phénomène côté fournisseur : les choix de déploiement changent la latence sans exiger de nouveaux poids. Entrée Ink-2 de Coval Article de Baseten sur le benchmark

Si l’exactitude finale prime sur les premiers résultats partiels, privilégiez la finalisation sémantique. Si le produit doit parler plus tôt, des résultats partiels rapides peuvent gagner, mais vous acceptez explicitement plus de risque de transcription contre une pause plus courte. AA-WER Streaming d’Artificial Analysis

Le rapport Artificial Analysis du 1er juin 2026 mesure Ink-2 avec fins sémantiques à 3,59 % de WER et 0,21 seconde jusqu’à la première transcription finale après détection de fin de parole. Jeux de données, réglages et définitions temporelles différents peuvent produire d’autres résultats pour le même modèle. AA-WER Streaming d’Artificial Analysis Entrée Ink-2 de Coval

Les indications de termes clés méritent aussi un test avant de changer de modèle. Si les noms de produits ou le jargon interne sont déformés, indiquer les termes attendus coûte généralement moins cher et cible mieux le problème qu’un changement de fournisseur. Documentation Ink-2 de Cartesia

La compatibilité du framework compte aussi en production. LiveKit Agents expose des points de configuration fournisseur où placer les réglages de tours et de termes clés. L’objectif est de relier le modèle au parcours d’appel réellement déployé. LiveKit Agents

Les compromis entre vitesse et exactitude

Les résultats Artificial Analysis du 1er juin 2026 donnent à Deepgram Flux 7,36 % de WER et 0,020 seconde jusqu’à la première transcription finale après détection de fin de parole. Ink-2 avec fins sémantiques obtient 3,59 % et 0,21 seconde. Flux finalise plus tôt ; Ink-2 fait moins d’erreurs dans ce test. Ces résultats décrivent les configurations et données évaluées. AA-WER Streaming d’Artificial Analysis

C’est ainsi qu’il faut lire un benchmark STT en continu. Il ne désigne pas le meilleur modèle dans l’absolu. Le gagnant en vitesse peut perdre sur des erreurs importantes pour un agent, comme une mauvaise orientation d’appel ou un nom de produit manqué. Classement WER de Coval AA-WER Streaming d’Artificial Analysis

Les latences extrêmes rendent agaçant un système habituellement bon. Une médiane faible avec de longues queues au p95 ou p99 signifie que certains utilisateurs subissent des pauses donnant l’impression d’un agent incertain, même si la moyenne convient. Classement WER de Coval

Testez séparément emplacement, capacité, détection des tours et termes clés. Consignez l’effet de chaque changement sur erreurs et latence avant de les combiner. Vous saurez ainsi ce qui améliore votre application. Article de Baseten sur le benchmark Documentation Ink-2 de Cartesia

Ce que les ingénieurs doivent mesurer avant de choisir

Le chiffre pertinent vient de votre propre parcours. Pour le STT, mesurez de la détection de fin de parole à l’arrivée du segment final, dans vos conditions réelles de téléphonie ou WebRTC, pas sur un trajet de laboratoire qui évite votre réseau. Présentation des benchmarks Coval

Il faut des percentiles, pas seulement une médiane. Un p50 excellent avec des p95 et p99 dispersés produit un système tantôt rapide, tantôt gênant, souvent moins agréable qu’un système un peu plus lent mais constant. Classement WER de Coval

Rejouez un audio représentatif de production avec vos accents, bruits et vocabulaire. Gardez un jeu d’évaluation séparé pour éviter d’optimiser simplement les enregistrements de développement.

Le classement public sert à présélectionner, pas à conclure. Exécutez ensuite les candidats dans votre région, avec votre concurrence et votre chaîne, avant de choisir ce que les utilisateurs entendront. Présentation des benchmarks Coval Article de Baseten sur le benchmark

Commencez par quelques points de terminaison et un corpus fixe. Consignez erreurs de transcription, délai de finalisation et délai de fin de parole au premier audio sous la concurrence prévue. Choisissez la configuration qui atteint vos objectifs, puis recommencez quand modèle ou déploiement change.

FAQ

La première place de Baseten chez Coval en fait-elle le meilleur STT pour mes utilisateurs ?

Pas automatiquement. Coval mesure WER et latence après parole depuis une région fixe, avec des données et points de terminaison précis. Ces chiffres décrivent le résultat de Baseten dans ce cadre. En production, la latence dépend de votre région, concurrence, orchestration et inférence dédiée ou partagée.

Pourquoi certains fournisseurs ont-ils une latence bien plus faible ?

Les tests de la couche d'inférence révèlent les différences de déploiement. Points de terminaison dédiés, matériel réservé, proximité et autoscaling ajusté réduisent la dispersion. Les modèles optimisés pour la vitesse ou servis sur matériel dédié impliquent d'autres compromis techniques et financiers que les services partagés.

Quelle mesure indique si un modèle semblera rapide en conversation ?

Mesurez de la fin de parole utilisateur au premier audio de réponse lisible pour l'agent complet. Mesurez séparément la requête TTS au premier audio. En STT, mesurez la fin de parole jusqu'au premier résultat partiel exploitable et jusqu'au final. Suivez p50, p95 et p99 avec la concurrence et le réseau prévus.