Apprendre

Taux d'erreur sur les mots : ce que le WER manque en IA vocale

Rene, Kabir Goel 
Taux d'erreur sur les mots : ce que le WER manque en IA vocale

Le taux d’erreur sur les mots (WER) compte les différences entre une transcription et une référence. Il aide à détecter les mots manquants ou incorrects. Il ne dit pas si une voix convient à votre produit.

Deux extraits peuvent prononcer exactement les mêmes mots et créer des expériences opposées. L’un rassure, l’autre semble ravi que votre vol soit annulé. La transcription réussit ; la conversation échoue.

Notre approche, décrite dans Ce modèle TTS est-il bon ?, part de l’expérience souhaitée. Pour un agent en temps réel, cela signifie comprendre dès la première écoute, entendre une interprétation adaptée et converser sans délais ou interruptions gênants. Le WER est un diagnostic parmi d’autres, pas un score à optimiser seul.

Ce que mesure réellement le WER

Il utilise le nombre minimal de modifications de mots pour aligner la transcription et sa référence :

WER = (substitutions + deletions + insertions) / reference words

Multipliez par 100 pour obtenir un pourcentage. Ici, la transcription remplace « Tuesday », mardi, par « Thursday », jeudi :

Reference:  please move my appointment to next Tuesday morning
Transcript: please move my appointment to next Thursday morning

WER = 1 / 8 = 12.5%

Une seule erreur de mot peut donc déplacer le rendez-vous. Le WER lui donne le même poids qu’à toute autre substitution. Sa conséquence doit entrer dans l’évaluation produit.

La documentation Microsoft explique le calcul, et des outils comme JiWER calculent l’alignement. Gardez des règles de référence et de normalisation cohérentes. Pour un corpus, divisez les modifications totales par les mots de référence totaux, plutôt que moyenner discrètement les pourcentages des extraits. Les insertions peuvent dépasser 100 %. Une référence vide exige une convention documentée, car la formule divise alors par zéro.

Le calcul s’applique à deux protocoles :

ÉvaluationComparaisonInformation obtenue
Reconnaissance STT/ASRTranscription du modèle contre référence humaineFréquence des mots différents de la référence
Synthèse TTSTranscription ASR de l’audio contre mots prévusPréservation des mots par la synthèse et la reconnaissance ensemble

Dans le second cas, vous évaluez la parole au travers d’un autre modèle. Une erreur TTS apparente peut venir de l’ASR. Une transcription propre peut masquer une parole peu claire. Il faut écouter pour savoir.

Pourquoi le WER peut tromper l’évaluation TTS

Des mots identiques peuvent sonner très différemment

Un texte ne définit pas une interprétation unique. « Je n’arrive pas à y croire » exprime enthousiasme, colère, tristesse ou sarcasme. Reconnaître tous les mots ne prouve pas l’adéquation à la situation.

Les exemples audio comparés de notre article le rendent audible : le WER peut être identique malgré des interprétations différentes. Quand les modèles prononcent déjà fiablement les mots du jeu de test, de petits écarts disent peu sur les qualités qui comptent pour l’auditeur. Ajouter des décimales ne récupère pas une information jamais mesurée.

La reconnaissance peut inventer ou masquer des erreurs

L’ASR peut avoir du mal avec un accent, une langue ou un nom peu familier alors que la parole est claire pour son public. Cela augmente le WER sans prouver un défaut de synthèse.

L’inverse existe aussi. L’ASR peut déduire un mot peu clair du contexte et renvoyer le texte attendu. Une personne qui essaie de saisir un code de compte au téléphone n’a pas forcément cette chance.

Fixez le système de reconnaissance et la politique de score pour les tests de régression. Écoutez les extraits signalés avant d’accuser le TTS. Échantillonnez aussi ceux qui réussissent, sinon vous manquerez les cas où l’ASR répare la sortie. Un système fixe rend les comparaisons cohérentes sans supprimer ses angles morts.

L’exactitude dépend du contexte

La transcription contient « read » que le modèle l’ait prononcé au présent ou au passé. Les mots concordent, mais la prononciation peut être incorrecte dans la phrase.

Les dates écrites posent un problème voisin. « 07/08/2026 » peut signifier le 8 juillet aux États-Unis ou le 7 août au Royaume-Uni. Le produit doit définir la région attendue avant que la référence puisse définir l’exactitude. Aucune lecture ne doit perdre uniquement parce que l’auteur de la référence supposait l’autre.

Certaines différences sont sans conséquence : « $25 » et « twenty-five dollars » désignent le même montant. D’autres changent le sens. Définissez les lectures acceptables, puis distinguez mise en forme différente et mauvaise date, somme ou identifiant. La normalisation ne doit pas effacer une erreur importante pour l’appelant.

L’apport du WER sémantique

Le WER sémantique distingue les formulations qui préservent le sens des erreurs qui le changent. « Twenty-five dollars » et « $25 » sont équivalents, mais pas « fifteen dollars ». Un score sensible au sens complète donc le WER littéral lorsque celui-ci surestime des différences inoffensives.

La méthode compte : définissez l’équivalence et vérifiez la détection des changements de noms, montants et négations. Ne supposez pas deux implémentations de WER sémantique comparables. Même un sens parfaitement conservé ne dit rien sur une voix rassurante, une adresse lue trop vite ou un défaut entre fragments. C’est un diagnostic supplémentaire, pas un verdict conversationnel.

Partir de la conversation visée

Avant de comparer, décrivez la situation. Qui écoute ? Quelle langue et quelle région attend-il ? Entend-il une adresse au téléphone ou une réponse courte au casque ? Que doit-il comprendre ou faire ensuite ?

Pour une confirmation de rendez-vous, vous pouvez exiger une date et une heure comprises dès la première écoute, un ton calme et des pauses suffisantes entre détails. Un WER global inférieur ne prouve aucun de ces points.

Construisez l’évaluation autour de ces exigences. Pour le TTS conversationnel, nous utilisons notamment :

DimensionQuestionPreuves
Exactitude et clartéLes auditeurs récupèrent-ils noms, nombres, adresses et codes ?Transcriptions humaines et détails critiques, avec WER diagnostique
Exactitude contextuellePrononciation et développement sont-ils adaptés ?Revue selon région, domaine et lectures acceptables explicites
Interprétation adaptéeRythme, insistance et émotion conviennent-ils ?Comparaisons d’écoute avec scénario fourni
RéactivitéL’appelant attend-il trop ou se fait-il interrompre ?Mesure complète et observation des tours
CohérenceLe locuteur reste-t-il stable entre les tours ?Conversations complètes, changements de voix, d’accent et d’interprétation
Diffusion continueY a-t-il raccords, répétitions ou sons coupés ?Audio capturé via le chemin réel de diffusion et de lecture

Certains tests évaluent le TTS, d’autres l’agent entier. Gardez cette distinction pour diagnostiquer. Une interruption peut venir des tours, une pause longue d’une recherche serveur. L’appelant vit tout, mais la correction dépend de l’origine.

Écouter en contexte et tester le parcours direct

L’écoute humaine est indispensable, mais la préférence n’est pas non plus une vérité universelle. Expliquez la tâche de la voix. Recrutez des personnes qui comprennent langue et région, puis signalez leurs désaccords au lieu de réduire chaque public à une moyenne.

Pour comparer les modèles, contrôlez volume, codec, fréquence et ordre de présentation. Limitez la durée des sessions pour réduire la fatigue. Pour tester le produit complet, gardez ses conditions réelles de téléphonie ou de lecture et précisez ce périmètre. Sinon, vous pouvez attribuer au modèle un défaut du codec, ou éliminer un problème de production pendant la préparation du test.

Utilisez extraits courts et conversations entières. Un enregistrement hors ligne soigné ne révèle pas tous les défauts d’une génération pendant l’arrivée du texte. Écoutez les raccords brusques, syllabes répétées et interprétations qui partent mal sans se reprendre. Sur les conversations longues, vérifiez les dérives de voix et d’accent.

Ventilez les résultats par région et type d’échec. Un modèle peut améliorer la prononciation d’une langue et dégrader le rythme d’une autre. Un score global masque les deux. Les prédicteurs automatiques aident à filtrer les régressions, mais doivent être validés dans vos langues et conditions. Remplacer le WER par un autre chiffre unique ne résout pas le problème.

Utiliser le WER pour enquêter

Le WER reste utile pour suivre les régressions de mots et trouver les extraits à revoir. La fidélité des noms et codes alphanumériques peut être essentielle. Gardez ces contrôles, avec des preuves d’intelligibilité et d’adéquation à la conversation réelle.

Quand un score progresse, demandez ce qui a changé pour l’auditeur. Une adresse est-elle plus claire ? Un mot manquant est-il revenu ? Ou une nouvelle mise en forme a-t-elle simplement fait concorder référence et transcription ? Ce sont des résultats différents, même si le tableau de bord affiche la même flèche verte.

Écoutez les exemples de Ce modèle TTS est-il bon ?, puis testez Sonic avec vos textes conversationnels et votre diffusion. Choisissez le modèle qui satisfait les dimensions importantes pour vos utilisateurs. Un score de transcription seul ne peut pas décider.

FAQ

Qu'est-ce que le taux d'erreur sur les mots ?

Le WER compte les substitutions, suppressions et insertions nécessaires pour aligner une transcription sur une référence, puis divise par le nombre de mots de référence. En reconnaissance, il compare la sortie à une transcription humaine. En TTS, il compare généralement la transcription ASR de l'audio généré aux mots prévus. Il ne mesure pas la qualité vocale globale.

Un WER plus bas signifie-t-il un meilleur modèle TTS ?

Pas nécessairement. Il signifie moins de modifications de mots dans un protocole précis. À WER égal, rythme, expression, prononciation contextuelle et stabilité peuvent varier. L'ASR peut aussi introduire des erreurs ou deviner des mots difficiles à comprendre pour un humain.

Quel WER est bon ?

Aucun seuil universel ne prouve qu'un produit est prêt. Le WER dépend du jeu, de la langue, de la référence et de la normalisation. Évaluez aussi exactitude contextuelle, clarté, interprétation, latence et diffusion, avec des auditeurs qui comprennent la langue et la situation.

Comment calculer le WER ?

Un alignement à nombre minimal de modifications compte substitutions, suppressions et insertions. Additionnez-les, divisez par le nombre de mots de référence et multipliez par 100. Une substitution sur huit mots donne 12,5 %. Les insertions peuvent dépasser 100 % ; la formule habituelle est indéfinie pour une référence vide.