Un mean opinion score (MOS) è la media dei voti che un gruppo di ascoltatori dà a un brano audio, di solito su una scala da 1 (pessimo) a 5 (eccellente). È nato nella telefonia per dare un numero alla qualità di una chiamata, e oggi è il numero di qualità predefinito negli articoli sulla sintesi vocale e nei confronti tra fornitori.
Se stai scegliendo un modello vocale o mettendo a punto un agente vocale, vale la pena capire il MOS soprattutto per accorgerti di quando viene usato male. Ecco cosa c’è dietro il numero, cos’è un buon punteggio per le chiamate e per la voce sintetica, e le domande da fare prima di fidarti.
La scala MOS
La maggior parte dei test MOS usa la scala Absolute Category Rating (ACR) definita nella Raccomandazione ITU-T P.800. Gli ascoltatori sentono un campione alla volta e scelgono un’etichetta:
| Voto | Etichetta |
|---|---|
| 5 | Eccellente |
| 4 | Buono |
| 3 | Discreto |
| 2 | Scarso |
| 1 | Pessimo |
Il MOS è la media aritmetica di quei voti. Se dieci persone valutano una clip 5, 4, 4, 5, 3, 4, 4, 5, 4, 3, il MOS è 4,1.
La P.800 risale al 1996 ed è stata scritta per le reti telefoniche. Specifica le condizioni del test fino alla stanza, che deve essere silenziosa, con riverbero sotto i 500 ms e rumore di fondo sotto i 30 dBA, come riporta il riassunto della norma su Wikipedia. Una norma complementare, la ITU-T P.800.1, definisce le etichette in base alla provenienza di un punteggio. È importante, perché “MOS” sulla pagina di un prodotto può indicare diverse misurazioni.
Una sigla, tre numeri
Quando qualcuno cita un MOS, scopri di che tipo è.
| Cos’è | Come si ottiene | Dove lo vedrai |
|---|---|---|
| MOS soggettivo | Persone ascoltano e danno un voto | Articoli sul TTS, lanci di modelli, test di ascolto dei codec |
| MOS previsto (parlato) | Un modello confronta o ascolta l’audio: PESQ, POLQA, DNSMOS, NISQA, UTMOS | Test di codec e reti, dashboard di addestramento TTS |
| MOS stimato (chiamate) | Calcolato da statistiche di rete come jitter, latenza e perdita di pacchetti | Dashboard VoIP e dei contact center |
Il MOS soggettivo è l’originale. È lento e costa, perché bisogna reclutare e pagare gli ascoltatori.
Il MOS previsto sostituisce gli ascoltatori con un modello addestrato sui loro voti passati. PESQ (ITU-T P.862) confronta la registrazione degradata di una chiamata con un riferimento pulito. La ITU l’ha ritirato a gennaio 2024 in favore di POLQA (ITU-T P.863). Per la voce sintetica non c’è un riferimento pulito con cui confrontare, quindi i ricercatori usano predittori senza riferimento come DNSMOS, NISQA e UTMOS.
Il MOS stimato di una dashboard sulla qualità delle chiamate di solito non è l’opinione di nessuno. Modelli di pianificazione della rete come l’E-model della ITU-T G.107 trasformano ritardo, jitter e perdita di pacchetti in un punteggio sulla scala MOS. Il glossario di Dialpad descrive così il suo MOS: un numero che “tiene conto di jitter, latenza e perdita di pacchetti”.
Tutti e tre sono espressi sulla stessa scala da 1 a 5. Non misurano la stessa cosa.
Qual è un buon punteggio MOS?
Dipende da quale numero stai guardando.
Per le chiamate telefoniche e VoIP esistono convenzioni di lavoro. Il glossario di Twilio considera circa 4,3–4,5 un obiettivo di qualità eccellente e dice che le chiamate diventano inaccettabili sotto circa 3,5. I voti raramente arrivano a 5, perché le persone evitano di dare punteggi perfetti. Se la dashboard del tuo contact center è sopra 4, probabilmente il problema non è la rete.
Per la sintesi vocale non esiste una soglia universale, e chi te ne dà una sta saltando un passaggio. Un MOS di TTS descrive un sistema rispetto a tutto ciò che c’era nello stesso test. Metti un buon modello accanto a riferimenti deboli e otterrà un voto alto. Metti lo stesso modello accanto a parlato umano registrato e il suo voto scenderà, anche se l’audio non è cambiato.
Quindi leggi un MOS di TTS come una classifica all’interno di un test. La domanda utile non è “4,3 è buono?”. È “4,3 rispetto a cosa, e valutato da chi?”.
Perché di solito due MOS non si possono confrontare
È la parte che quasi tutti i testi sul MOS saltano, ed è da lì che nascono la maggior parte delle decisioni sbagliate.
Gli ascoltatori usano tutta la scala che hanno a disposizione. I valutatori distribuiscono i voti tra 1 e 5 all’interno di un test, un fenomeno chiamato bias di equalizzazione dell’intervallo. Un sistema valutato tra campioni chiaramente peggiori viene spinto in alto, e lo stesso sistema valutato tra campioni migliori viene spinto in basso. La ITU-T P.800.2, la norma su come riportare il MOS, afferma che i punteggi di esperimenti separati non vanno confrontati direttamente, a meno che gli esperimenti non siano stati progettati per esserlo.
La configurazione cambia il numero. Istruzioni, frasi usate, volume di riproduzione, cuffie o altoparlante del portatile e la stanchezza dei valutatori spostano i voti. Il nostro articolo Questo modello TTS è valido? mostra quattro ascoltatori che danno quattro voti diversi alla stessa forma d’onda a seconda della loro configurazione.
Le persone vogliono cose diverse. Una voce calda e lenta che ottiene un buon voto per un’app di meditazione può suonare fuori posto sulla linea per il rinnovo delle ricette di una farmacia. Il MOS ti dà una media, e una media può nascondere due gruppi di ascoltatori in disaccordo.
I campioni piccoli sono rumorosi. Per i dieci voti di sopra, l’intervallo di confidenza al 95% è di circa ±0,5. Con quel campione non puoi distinguere un 4,1 da un 4,5. Con 100 voti e la stessa dispersione, l’intervallo si restringe a circa ±0,15. Se un MOS pubblicato non riporta accanto il numero di voti né l’intervallo, considera che sia meno preciso di quanto sembri.
La regola pratica: confronta solo valori MOS usciti dallo stesso test. L’annuncio di un modello che cita un 4,4 contro il 4,2 di un concorrente preso dall’articolo del concorrente ti dice molto poco.
Il MOS previsto: utile, ma con punti ciechi
Fare test di ascolto con persone a ogni checkpoint di addestramento non è realistico, quindi i team usano i predittori. Funzionano bene su ciò per cui sono stati addestrati: rumore, distorsione e artefatti dei codec.
Funzionano molto peggio con un’enfasi sbagliata, l’emozione sbagliata o un accento che deriva. Un articolo di Interspeech 2026, Investigating Human-Model Discrepancies in Speech Quality Assessment, ha aggiunto quantità crescenti di accento tonale giapponese errato a parlato sintetico. I voti umani sono scesi di 1,84 punti MOS. UTMOS, UTMOSv2, NISQA e DNSMOS si sono mossi tutti di meno di 0,1, e alcuni hanno dato al parlato più corrotto un voto leggermente più alto. Gli autori hanno rilevato che tutti i modelli erano “insensibili agli errori prosodici nonostante grandi cali del punteggio soggettivo”.
Questo non rende inutili i predittori. Se UTMOS scende di 0,3 su un nuovo checkpoint, probabilmente qualcosa si è rotto. Se resta stabile, hai imparato solo che niente si è rotto in un modo che UTMOS riesce a sentire. Usa i predittori per individuare le regressioni e le persone per prendere le decisioni.
Come fare un test MOS che ti dica qualcosa
Se stai confrontando modelli vocali per un prodotto reale, un test piccolo e ben progettato vale più di uno grande e generico.
- Scrivi prima il caso d’uso. “Legge numeri d’ordine a un cliente su una linea telefonica” è un test che puoi progettare. “Suona naturale” no. La nostra guida alla scelta dei modelli di IA vocale offre un quadro per farlo.
- Usa il tuo testo. Includi le parti difficili: nomi, indirizzi, date, prezzi, codici e il gergo del tuo settore. Il parlato letto e pulito nasconde la maggior parte dei difetti.
- Riproduci l’audio come lo sentiranno gli utenti. Per un agente telefonico significa μ-law a 8 kHz, non un WAV da studio. Uniforma il volume tra i sistemi, così la clip più forte non vince in automatico.
- Valuta tutti i sistemi nella stessa sessione. Mescola l’ordine, nascondi quale sistema è quale e includi alcune clip ripetute o di riferimento come ancore per individuare i valutatori distratti.
- Usa ascoltatori simili ai tuoi utenti. Per una linea di assistenza in spagnolo in Messico servono madrelingua di spagnolo messicano. La P.808 della ITU spiega come condurre questi test con il crowdsourcing.
- Raccogli abbastanza voti e riporta l’intervallo. Punta a decine di voti per sistema, non a una manciata, e pubblica l’intervallo di confidenza insieme alla media.
- Fai una seconda domanda. Un test di preferenza affiancato (“quale di questi due preferiresti ascoltare?”) spesso separa meglio due sistemi vicini di due punteggi assoluti.
Il MOS per gli agenti vocali: necessario, non sufficiente
Il MOS valuta una clip isolata. Un agente vocale è una conversazione, e molti dei difetti che fanno chiudere una chiamata non compaiono mai in una clip. L’agente ci mette troppo a rispondere, parla sopra chi chiama, legge un codice di conferma troppo in fretta o pronuncia “2026” in un modo che nessuno si aspettava.
La posizione del nostro team di ricerca, spiegata in Questo modello TTS è valido?, è che i voti di ascolto sono un elemento tra tanti. Gli altri sono la precisione a livello di parola, la pronuncia di nomi e numeri, la stabilità della voce lungo una chiamata lunga e il comportamento sul vero percorso di streaming. La guida al word error rate copre la parte sulla precisione.
Se stai confrontando modelli, il test onesto più veloce è il tuo copione, letto da ogni modello e riprodotto sul canale su cui lo sentiranno i tuoi utenti. Puoi provare Sonic nel playground con il tuo testo, oppure far passare lo stesso copione dall’API con pcm_mulaw a 8000 Hz per sentirlo come lo sentirebbe chi chiama.