O que é o mean opinion score (MOS)?

Rene, Kabir Goel 
O que é o mean opinion score (MOS)?

Um mean opinion score (MOS) é a média das notas que um grupo de ouvintes dá a um trecho de áudio, normalmente numa escala de 1 (péssimo) a 5 (excelente). Ele nasceu na telefonia como uma forma de dar um número à qualidade de uma chamada, e hoje é o número de qualidade padrão em artigos de síntese de voz e em comparações entre fornecedores.

Se você está escolhendo um modelo de voz ou ajustando um agente de voz, vale a pena entender o MOS principalmente para perceber quando ele está sendo mal usado. Veja o que há por trás do número, o que é uma boa pontuação para chamadas e para voz sintética, e as perguntas a fazer antes de confiar em uma.

A escala MOS

A maioria dos testes MOS usa a escala Absolute Category Rating (ACR) definida na Recomendação ITU-T P.800. Os ouvintes escutam uma amostra por vez e escolhem um rótulo:

NotaRótulo
5Excelente
4Bom
3Razoável
2Ruim
1Péssimo

O MOS é a média aritmética dessas notas. Se dez pessoas avaliam um clipe com 5, 4, 4, 5, 3, 4, 4, 5, 4, 3, o MOS é 4,1.

A P.800 é de 1996 e foi escrita para redes telefônicas. Ela especifica as condições do teste até a sala, que deve ser silenciosa, com reverberação abaixo de 500 ms e ruído de fundo abaixo de 30 dBA, como registra o resumo da norma na Wikipédia. Uma norma complementar, a ITU-T P.800.1, define rótulos conforme a origem de uma pontuação. Isso importa, porque “MOS” na página de um produto pode significar várias medições diferentes.

Uma sigla, três números

Quando alguém citar um MOS, descubra de que tipo ele é.

O que éComo é obtidoOnde você vai encontrar
MOS subjetivoPessoas ouvem e dão notasArtigos de TTS, lançamentos de modelos, testes de escuta de codecs
MOS previsto (fala)Um modelo compara ou ouve o áudio: PESQ, POLQA, DNSMOS, NISQA, UTMOSTestes de codecs e redes, painéis de treinamento de TTS
MOS estimado (chamadas)Calculado a partir de estatísticas de rede como jitter, latência e perda de pacotesPainéis de VoIP e de centrais de atendimento

O MOS subjetivo é o original. É lento e custa dinheiro, porque é preciso recrutar e pagar os ouvintes.

O MOS previsto substitui os ouvintes por um modelo treinado com as notas que eles deram antes. O PESQ (ITU-T P.862) compara a gravação degradada de uma chamada com uma referência limpa. A ITU o retirou em janeiro de 2024 em favor do POLQA (ITU-T P.863). Na voz sintética não há uma referência limpa para comparar, então os pesquisadores usam preditores sem referência como DNSMOS, NISQA e UTMOS.

O MOS estimado de um painel de qualidade de chamadas normalmente não é a opinião de ninguém. Modelos de planejamento de rede como o E-model da ITU-T G.107 convertem atraso, jitter e perda de pacotes numa pontuação na escala MOS. O glossário da Dialpad descreve assim o seu MOS: um número que “leva em conta jitter, latência e perda de pacotes”.

Os três usam a mesma escala de 1 a 5. Não medem a mesma coisa.

O que é uma boa pontuação MOS?

Depende de qual número você está olhando.

Em chamadas telefônicas e VoIP existem convenções de trabalho. O glossário da Twilio considera cerca de 4,3 a 4,5 uma meta de qualidade excelente e diz que as chamadas ficam inaceitáveis abaixo de aproximadamente 3,5. As notas raramente chegam a 5, porque as pessoas evitam dar notas perfeitas. Se o painel da sua central de atendimento está acima de 4, provavelmente o problema não é a rede.

Em síntese de voz não existe um limite universal, e quem lhe dá um está pulando uma etapa. Um MOS de TTS descreve um sistema em relação a tudo o que estava no mesmo teste. Coloque um modelo bom ao lado de referências fracas e ele terá uma nota alta. Coloque o mesmo modelo ao lado de fala humana gravada e a nota dele cai, mesmo que o áudio não tenha mudado.

Por isso, leia um MOS de TTS como uma classificação dentro de um teste. A pergunta útil não é “4,3 é bom?”. É “4,3 comparado com o quê, e avaliado por quem?”.

Por que dois MOS normalmente não podem ser comparados

Esta é a parte que a maioria dos textos sobre MOS pula, e é dela que vem a maioria das decisões ruins.

Os ouvintes usam toda a escala que recebem. Os avaliadores espalham as notas entre 1 e 5 dentro de um teste, um padrão chamado viés de equalização da amplitude. Um sistema avaliado entre amostras claramente piores é puxado para cima, e o mesmo sistema avaliado entre amostras melhores é puxado para baixo. A ITU-T P.800.2, a norma sobre como relatar o MOS, diz que pontuações de experimentos separados não devem ser comparadas diretamente, a menos que os experimentos tenham sido planejados para isso.

A configuração muda o número. Instruções, frases usadas, volume de reprodução, fone de ouvido ou alto-falante de notebook e o cansaço dos avaliadores mexem nas notas. Nosso artigo Este modelo TTS é bom? mostra quatro ouvintes dando quatro notas diferentes para a mesma forma de onda, conforme a configuração de cada um.

As pessoas querem coisas diferentes. Uma voz calorosa e lenta que recebe nota alta num app de meditação pode soar errada na linha de renovação de receitas de uma farmácia. O MOS dá uma média, e uma média pode esconder dois grupos de ouvintes que discordam.

Amostras pequenas têm muito ruído. Para as dez notas acima, o intervalo de confiança de 95% é de cerca de ±0,5. Com essa amostra, não dá para distinguir um 4,1 de um 4,5. Com 100 notas e a mesma dispersão, o intervalo cai para cerca de ±0,15. Se um MOS publicado não vem acompanhado do número de notas nem do intervalo, considere que ele é menos preciso do que parece.

A regra prática: compare apenas números MOS que saíram do mesmo teste. Um anúncio de modelo que cita 4,4 contra o 4,2 de um concorrente, tirado do próprio artigo do concorrente, diz muito pouco.

MOS previsto: útil, mas com pontos cegos

Fazer testes de escuta com pessoas a cada checkpoint de treinamento não é realista, então as equipes usam preditores. Eles funcionam bem naquilo para que foram treinados: ruído, distorção e artefatos de codec.

Funcionam muito pior com ênfase errada, emoção errada ou um sotaque que se desvia. Um artigo do Interspeech 2026, Investigating Human-Model Discrepancies in Speech Quality Assessment, adicionou quantidades crescentes de acento tonal japonês incorreto a fala sintética. As notas humanas caíram 1,84 ponto MOS. UTMOS, UTMOSv2, NISQA e DNSMOS mudaram menos de 0,1, e alguns deram à fala mais corrompida uma nota ligeiramente maior. Os autores concluíram que todos os modelos eram “insensíveis a erros prosódicos, apesar de grandes quedas na pontuação subjetiva”.

Isso não torna os preditores inúteis. Se o UTMOS cai 0,3 num novo checkpoint, provavelmente algo quebrou. Se fica estável, você só aprendeu que nada quebrou de um jeito que o UTMOS consegue ouvir. Use preditores para detectar regressões e pessoas para tomar decisões.

Como fazer um teste MOS que diga alguma coisa

Se você está comparando modelos de voz para um produto real, um teste pequeno e bem planejado vale mais do que um grande e genérico.

  1. Escreva primeiro o caso de uso. “Lê números de pedido para um cliente numa linha telefônica” é um teste que você consegue planejar. “Soa natural” não é. Nosso guia para escolher modelos de IA de voz traz uma estrutura para isso.
  2. Use o seu próprio texto. Inclua as partes difíceis: nomes, endereços, datas, preços, códigos e o jargão do seu setor. A leitura limpa esconde a maioria das falhas.
  3. Toque o áudio como os usuários vão ouvir. Para um agente telefônico, isso significa μ-law a 8 kHz, não um WAV de estúdio. Iguale o volume entre os sistemas para que o clipe mais alto não vença por padrão.
  4. Avalie todos os sistemas na mesma sessão. Embaralhe a ordem, esconda qual sistema é qual e inclua alguns clipes repetidos ou de referência como âncoras para identificar avaliadores descuidados.
  5. Use ouvintes parecidos com os seus usuários. Para uma linha de suporte em espanhol no México, isso significa falantes nativos de espanhol mexicano. A P.808 da ITU explica como fazer esses testes por crowdsourcing.
  6. Junte notas suficientes e informe o intervalo. Busque dezenas de notas por sistema, não um punhado, e publique o intervalo de confiança junto com a média.
  7. Faça uma segunda pergunta. Um teste de preferência lado a lado (“qual destes dois você prefere ouvir?”) costuma separar melhor dois sistemas próximos do que duas notas absolutas.

MOS para agentes de voz: necessário, mas não suficiente

O MOS avalia um clipe isolado. Um agente de voz é uma conversa, e muitas das falhas que fazem alguém desligar nunca aparecem num clipe. O agente demora demais para responder, fala por cima de quem ligou, lê um código de confirmação rápido demais ou diz “2026” de um jeito que ninguém esperava.

A visão da nossa equipe de pesquisa, descrita em Este modelo TTS é bom?, é que as notas de escuta são uma informação entre várias. As outras são a precisão no nível das palavras, a pronúncia de nomes e números, a consistência da voz ao longo de uma chamada longa e o comportamento no caminho real de streaming. O guia sobre a taxa de erro de palavras cobre a parte de precisão.

Se você está comparando modelos, o teste honesto mais rápido é o seu próprio roteiro, lido por cada modelo e tocado no canal em que seus usuários vão ouvi-lo. Você pode testar o Sonic no playground com o seu texto ou passar o mesmo roteiro pela API com pcm_mulaw a 8000 Hz para ouvi-lo como quem liga ouviria.

Guias relacionados

Perguntas frequentes

O que é o mean opinion score (MOS)?

O mean opinion score é a média das notas de qualidade que os ouvintes dão numa escala fixa, quase sempre a escala Absolute Category Rating de cinco pontos da ITU-T P.800: 5 Excelente, 4 Bom, 3 Razoável, 2 Ruim, 1 Péssimo. Equipes de telecomunicações usam a escala para a qualidade das chamadas, e pesquisadores de fala, para síntese de voz e conversão de voz. Muitas ferramentas também preveem o MOS com um modelo em vez de perguntar às pessoas, e esse número previsto deve ser identificado como uma estimativa.

O que é uma boa pontuação MOS?

Em chamadas telefônicas e VoIP, a Twilio descreve cerca de 4,3 a 4,5 como uma meta excelente e abaixo de aproximadamente 3,5 como inaceitável. Em síntese de voz não existe um número fixo. Um MOS de TTS só tem sentido ao lado dos outros sistemas avaliados no mesmo teste, pelos mesmos ouvintes, com as mesmas instruções. Um 4,2 de um artigo e um 4,4 de outro não podem ser ordenados.

Como o MOS é calculado?

Somam-se todas as notas dos ouvintes para um clipe ou sistema e divide-se pelo número de notas. Junto com ele, informe o número de notas e um intervalo de confiança de 95%. Com 10 notas e uma dispersão típica, o intervalo fica em cerca de ±0,5 ponto. Com 100 notas, cai para cerca de ±0,15.

É possível comparar pontuações MOS de testes diferentes?

Não diretamente. A ITU-T P.800.2 diz que valores MOS de experimentos separados não devem ser comparados, a menos que os experimentos tenham sido planejados para isso. Os ouvintes usam a escala inteira dentro de cada teste, então a pontuação de um sistema depende do que foi avaliado junto com ele. Compare sistemas dentro de um mesmo teste ou inclua amostras de ancoragem comuns entre os testes.

Qual é a diferença entre MOS e MOS previsto?

O MOS vem de pessoas ouvindo. O MOS previsto vem de um modelo treinado para imitar essas notas: PESQ e POLQA para redes telefônicas, e DNSMOS, NISQA e UTMOS para melhoria e síntese de fala. Os preditores são baratos e úteis para detectar regressões em milhares de clipes, mas não percebem falhas para as quais não foram treinados, como ênfase errada ou acento tonal incorreto.