Un mean opinion score (MOS) est la moyenne des notes qu’un groupe d’auditeurs attribue à un extrait audio, généralement sur une échelle de 1 (mauvais) à 5 (excellent). Il est né dans la téléphonie pour mettre un chiffre sur la qualité d’un appel, et c’est aujourd’hui le chiffre de qualité par défaut dans les articles de synthèse vocale et les comparatifs de fournisseurs.
Si vous choisissez un modèle vocal ou réglez un agent vocal, le MOS vaut surtout la peine d’être compris pour repérer quand il est mal utilisé. Voici ce qu’il y a derrière le chiffre, ce qu’est un bon score pour les appels et pour la voix de synthèse, et les questions à poser avant de s’y fier.
L’échelle MOS
La plupart des tests MOS utilisent l’échelle Absolute Category Rating (ACR) définie dans la Recommandation UIT-T P.800. Les auditeurs écoutent un échantillon à la fois et choisissent une étiquette :
| Note | Étiquette |
|---|---|
| 5 | Excellent |
| 4 | Bon |
| 3 | Passable |
| 2 | Médiocre |
| 1 | Mauvais |
Le MOS est la moyenne arithmétique de ces notes. Si dix personnes notent un extrait 5, 4, 4, 5, 3, 4, 4, 5, 4, 3, le MOS est de 4,1.
La P.800 date de 1996 et a été écrite pour les réseaux téléphoniques. Elle précise les conditions du test jusqu’à la pièce, qui doit être calme, avec une réverbération inférieure à 500 ms et un bruit de fond sous 30 dBA, comme le rappelle le résumé de la norme sur Wikipédia. Une norme complémentaire, l’UIT-T P.800.1, définit des étiquettes selon l’origine d’un score. C’est important, car « MOS » sur une page produit peut désigner plusieurs mesures différentes.
Un sigle, trois chiffres
Quand quelqu’un cite un MOS, cherchez de quel type il s’agit.
| Ce que c’est | Comment il est produit | Où vous le verrez |
|---|---|---|
| MOS subjectif | Des personnes écoutent et notent | Articles sur le TTS, lancements de modèles, tests d’écoute de codecs |
| MOS prédit (parole) | Un modèle compare ou écoute l’audio : PESQ, POLQA, DNSMOS, NISQA, UTMOS | Tests de codecs et de réseaux, tableaux de bord d’entraînement TTS |
| MOS estimé (appels) | Calculé à partir de statistiques réseau comme la gigue, la latence et la perte de paquets | Tableaux de bord VoIP et de centres de contact |
Le MOS subjectif est l’original. Il est lent et coûte de l’argent, car il faut recruter et rémunérer des auditeurs.
Le MOS prédit remplace les auditeurs par un modèle entraîné sur leurs notes passées. PESQ (UIT-T P.862) compare l’enregistrement dégradé d’un appel à une référence propre. L’UIT l’a retiré en janvier 2024 au profit de POLQA (UIT-T P.863). Pour la voix de synthèse, il n’existe pas de référence propre à laquelle comparer, donc les chercheurs utilisent des prédicteurs sans référence comme DNSMOS, NISQA et UTMOS.
Le MOS estimé d’un tableau de bord de qualité d’appel n’est généralement l’avis de personne. Des modèles de planification réseau comme l’E-model de l’UIT-T G.107 convertissent le délai, la gigue et la perte de paquets en une note sur l’échelle MOS. Le glossaire de Dialpad décrit ainsi son MOS : un chiffre qui « tient compte de la gigue, de la latence et de la perte de paquets ».
Les trois s’expriment sur la même échelle de 1 à 5. Ils ne mesurent pas la même chose.
Qu’est-ce qu’un bon score MOS ?
Cela dépend du chiffre que vous regardez.
Pour les appels téléphoniques et la VoIP, il existe des conventions de travail. Le glossaire de Twilio considère qu’environ 4,3 à 4,5 est un objectif de qualité excellent et que les appels deviennent inacceptables en dessous d’environ 3,5. Les notes atteignent rarement 5, car les gens évitent de donner des notes parfaites. Si le tableau de bord de votre centre de contact est au-dessus de 4, le réseau n’est probablement pas votre problème.
Pour la synthèse vocale, il n’y a pas de seuil universel, et celui qui vous en donne un saute une étape. Un MOS de TTS décrit un système par rapport à tout ce qui figurait dans le même test. Placez un bon modèle à côté de références faibles et il obtiendra une bonne note. Placez le même modèle à côté de parole humaine enregistrée et sa note baissera, alors que l’audio n’a pas changé.
Lisez donc un MOS de TTS comme un classement au sein d’un test. La question utile n’est pas « 4,3, c’est bien ? ». C’est « 4,3 comparé à quoi, et noté par qui ? ».
Pourquoi deux MOS ne se comparent généralement pas
C’est la partie que la plupart des textes sur le MOS passent sous silence, et c’est d’elle que viennent la plupart des mauvaises décisions.
Les auditeurs utilisent toute l’échelle qu’on leur donne. Les évaluateurs répartissent leurs notes entre 1 et 5 au sein d’un test, un phénomène appelé biais d’égalisation de l’étendue. Un système noté parmi des échantillons nettement moins bons est tiré vers le haut, et le même système noté parmi de meilleurs est tiré vers le bas. L’UIT-T P.800.2, la norme sur la publication des MOS, indique que les scores d’expériences séparées ne doivent pas être comparés directement, sauf si les expériences ont été conçues pour l’être.
Le dispositif change le chiffre. Les consignes, les phrases utilisées, le volume de lecture, un casque ou le haut-parleur d’un ordinateur portable et la fatigue des évaluateurs font bouger les notes. Notre article Ce modèle TTS est-il bon ? montre quatre auditeurs attribuant quatre notes différentes à la même forme d’onde selon leur dispositif.
Les gens ne veulent pas la même chose. Une voix chaleureuse et posée qui obtient une bonne note pour une appli de méditation peut sonner faux sur la ligne de renouvellement d’ordonnances d’une pharmacie. Le MOS vous donne une moyenne, et une moyenne peut cacher deux groupes d’auditeurs en désaccord.
Les petits échantillons sont bruités. Pour les dix notes ci-dessus, l’intervalle de confiance à 95 % est d’environ ±0,5. Avec cet échantillon, impossible de distinguer un 4,1 d’un 4,5. Avec 100 notes et la même dispersion, l’intervalle se resserre à environ ±0,15. Si un MOS publié n’est accompagné ni du nombre de notes ni de l’intervalle, partez du principe qu’il est moins précis qu’il n’en a l’air.
La règle pratique : ne comparez que des MOS issus du même test. Une annonce de modèle qui cite un 4,4 face au 4,2 d’un concurrent, tiré de l’article du concurrent, vous apprend très peu.
Le MOS prédit : utile, avec des angles morts
Faire passer des tests d’écoute humains à chaque point de contrôle d’entraînement n’est pas réaliste, alors les équipes utilisent des prédicteurs. Ils sont bons sur ce pour quoi ils ont été entraînés : le bruit, la distorsion et les artefacts de codec.
Ils sont bien moins bons sur une mauvaise accentuation, une émotion inadaptée ou un accent qui dérive. Un article d’Interspeech 2026, Investigating Human-Model Discrepancies in Speech Quality Assessment, a ajouté des proportions croissantes d’accent tonal japonais erroné à de la parole de synthèse. Les notes humaines ont baissé de 1,84 point MOS. UTMOS, UTMOSv2, NISQA et DNSMOS ont tous bougé de moins de 0,1, et certains ont même légèrement mieux noté la parole la plus dégradée. Les auteurs ont constaté que tous les modèles étaient « insensibles aux erreurs prosodiques malgré de fortes baisses des notes subjectives ».
Cela ne rend pas les prédicteurs inutiles. Si UTMOS perd 0,3 sur un nouveau point de contrôle, quelque chose s’est probablement cassé. S’il reste stable, vous savez seulement que rien ne s’est cassé d’une façon qu’UTMOS peut entendre. Utilisez les prédicteurs pour repérer les régressions, et des personnes pour décider.
Comment mener un test MOS qui vous apprend quelque chose
Si vous comparez des modèles vocaux pour un vrai produit, un petit test bien conçu vaut mieux qu’un grand test générique.
- Écrivez d’abord le cas d’usage. « Lit des numéros de commande à un client au téléphone » est un test que vous pouvez concevoir. « Sonne naturel » ne l’est pas. Notre guide pour choisir des modèles d’IA vocale propose un cadre pour cela.
- Utilisez votre propre texte. Incluez les passages difficiles : noms, adresses, dates, prix, codes et le jargon de votre domaine. La lecture propre cache la plupart des défauts.
- Diffusez l’audio comme vos utilisateurs l’entendront. Pour un agent téléphonique, cela veut dire du μ-law à 8 kHz, pas un WAV de studio. Égalisez le volume entre les systèmes pour que l’extrait le plus fort ne gagne pas d’office.
- Notez tous les systèmes dans la même session. Mélangez l’ordre, masquez quel système est lequel et ajoutez quelques extraits répétés ou de référence comme ancres pour repérer les évaluateurs négligents.
- Choisissez des auditeurs qui ressemblent à vos utilisateurs. Pour une ligne d’assistance en espagnol au Mexique, il faut des locuteurs natifs de l’espagnol mexicain. La P.808 de l’UIT décrit comment mener ces tests par crowdsourcing.
- Recueillez assez de notes et publiez l’intervalle. Visez des dizaines de notes par système, pas une poignée, et publiez l’intervalle de confiance avec la moyenne.
- Posez une seconde question. Un test de préférence côte à côte (« lequel de ces deux préféreriez-vous entendre ? ») départage souvent mieux deux systèmes proches que deux notes absolues.
Le MOS pour les agents vocaux : nécessaire, pas suffisant
Le MOS note un extrait isolé. Un agent vocal, c’est une conversation, et beaucoup des défauts qui font raccrocher n’apparaissent jamais dans un extrait. L’agent met trop de temps à répondre, parle par-dessus l’appelant, lit un code de confirmation trop vite ou prononce « 2026 » d’une façon que personne n’attendait.
Le point de vue de notre équipe de recherche, exposé dans Ce modèle TTS est-il bon ?, est que les notes d’écoute sont une donnée parmi d’autres. Les autres sont la précision au niveau des mots, la prononciation des noms et des nombres, la stabilité de la voix sur un long appel et son comportement sur le vrai chemin de streaming. Le guide sur le taux d’erreur sur les mots couvre la partie précision.
Si vous comparez des modèles, le test honnête le plus rapide est votre propre script, lu par chaque modèle et diffusé sur le canal où vos utilisateurs l’entendront. Vous pouvez essayer Sonic dans le playground avec votre propre texte, ou passer le même script par l’API avec pcm_mulaw à 8000 Hz pour l’entendre comme un appelant.