¿Qué es el mean opinion score (MOS)?

Rene, Kabir Goel 
¿Qué es el mean opinion score (MOS)?

Un mean opinion score (MOS) es la media de las valoraciones que un grupo de oyentes da a un fragmento de audio, normalmente en una escala de 1 (malo) a 5 (excelente). Nació en la telefonía como forma de poner un número a la calidad de una llamada, y hoy es el número de calidad por defecto en los artículos de síntesis de voz y en las comparativas entre proveedores.

Si estás eligiendo un modelo de voz o ajustando un agente de voz, merece la pena entender el MOS sobre todo para saber cuándo se está usando mal. Aquí verás qué hay detrás del número, qué es una buena puntuación para llamadas y para voz sintética, y qué preguntar antes de fiarte de una.

La escala MOS

La mayoría de las pruebas MOS usan la escala Absolute Category Rating (ACR) definida en la Recomendación ITU-T P.800. Los oyentes escuchan una muestra cada vez y eligen una etiqueta:

PuntuaciónEtiqueta
5Excelente
4Buena
3Aceptable
2Mediocre
1Mala

El MOS es la media aritmética de esas valoraciones. Si diez personas puntúan un clip con 5, 4, 4, 5, 3, 4, 4, 5, 4, 3, el MOS es 4,1.

La P.800 es de 1996 y se escribió para redes telefónicas. Especifica las condiciones de la prueba hasta la sala, que debe ser silenciosa, con una reverberación inferior a 500 ms y un ruido de fondo por debajo de 30 dBA, como recoge el resumen de la norma en Wikipedia. Una norma complementaria, la ITU-T P.800.1, define etiquetas según de dónde salió la puntuación. Eso importa, porque “MOS” en la página de un producto puede referirse a varias mediciones distintas.

Una sigla, tres números

Cuando alguien cite un MOS, averigua de qué tipo es.

Qué esCómo se obtieneDónde lo verás
MOS subjetivoPersonas escuchan y puntúanArtículos de TTS, lanzamientos de modelos, pruebas de escucha de códecs
MOS predicho (voz)Un modelo compara o escucha el audio: PESQ, POLQA, DNSMOS, NISQA, UTMOSPruebas de códecs y redes, paneles de entrenamiento de TTS
MOS estimado (llamadas)Se calcula a partir de estadísticas de red como jitter, latencia y pérdida de paquetesPaneles de VoIP y de centros de contacto

El MOS subjetivo es el original. Es lento y cuesta dinero, porque hay que reclutar y pagar a los oyentes.

El MOS predicho sustituye a los oyentes por un modelo entrenado con sus valoraciones anteriores. PESQ (ITU-T P.862) compara la grabación degradada de una llamada con una referencia limpia. La ITU la retiró en enero de 2024 en favor de POLQA (ITU-T P.863). En la voz sintética no hay una referencia limpia con la que comparar, así que los investigadores usan predictores sin referencia como DNSMOS, NISQA y UTMOS.

El MOS estimado de un panel de calidad de llamadas no suele ser la opinión de nadie. Modelos de planificación de redes como el E-model de la ITU-T G.107 convierten el retardo, el jitter y la pérdida de paquetes en una puntuación en la escala MOS. El glosario de Dialpad describe así su MOS: un número que “tiene en cuenta el jitter, la latencia y la pérdida de paquetes”.

Los tres se expresan en la misma escala de 1 a 5. No miden lo mismo.

¿Qué es una buena puntuación MOS?

Depende de qué número estés mirando.

En llamadas telefónicas y VoIP hay convenciones de trabajo. El glosario de Twilio considera que entre 4,3 y 4,5 es un objetivo de calidad excelente y que las llamadas se vuelven inaceptables por debajo de aproximadamente 3,5. Las valoraciones casi nunca llegan a 5, porque la gente evita dar puntuaciones perfectas. Si el panel de tu centro de contacto está por encima de 4, probablemente la red no sea tu problema.

En síntesis de voz no hay un umbral universal, y quien te dé uno se está saltando un paso. Un MOS de TTS describe un sistema en relación con lo demás que había en la misma prueba. Pon un modelo bueno junto a referencias débiles y puntuará alto. Pon el mismo modelo junto a voz humana grabada y su puntuación bajará, aunque el audio no haya cambiado.

Así que lee un MOS de TTS como una clasificación dentro de una prueba. La pregunta útil no es “¿un 4,3 es bueno?”. Es “¿4,3 comparado con qué y puntuado por quién?”.

Por qué dos MOS normalmente no se pueden comparar

Esta es la parte que casi todos los textos sobre MOS se saltan, y de ella salen la mayoría de las malas decisiones.

Los oyentes usan toda la escala que se les da. Los evaluadores reparten sus puntuaciones entre 1 y 5 dentro de una prueba, un patrón llamado sesgo de ecualización del rango. Un sistema evaluado entre muestras claramente peores sube, y el mismo sistema evaluado entre otras mejores baja. La ITU-T P.800.2, la norma para informar del MOS, indica que no deben compararse directamente puntuaciones de experimentos separados salvo que los experimentos se diseñaran para compararse.

La configuración cambia el número. Las instrucciones, las frases usadas, el volumen de reproducción, auriculares frente al altavoz de un portátil y el cansancio de los evaluadores mueven las puntuaciones. Nuestro artículo ¿Es bueno este modelo TTS? muestra a cuatro oyentes dando cuatro puntuaciones distintas a la misma forma de onda según su configuración.

La gente quiere cosas distintas. Una voz cálida y pausada que puntúa bien para una app de meditación puede sonar fuera de lugar en la línea de renovación de recetas de una farmacia. El MOS te da una media, y una media puede ocultar dos grupos de oyentes que no están de acuerdo.

Las muestras pequeñas tienen mucho ruido. Con las diez valoraciones de arriba, el intervalo de confianza del 95 % es de aproximadamente ±0,5. Con esa muestra no puedes distinguir un 4,1 de un 4,5. Con 100 valoraciones y la misma dispersión, el intervalo se estrecha a unos ±0,15. Si un MOS publicado no lleva al lado el número de valoraciones ni el intervalo, asume que es menos preciso de lo que parece.

La regla práctica: compara solo números MOS que salgan de la misma prueba. Un anuncio de modelo que cita un 4,4 frente al 4,2 de un competidor sacado del propio artículo del competidor te dice muy poco.

MOS predicho: útil, pero con puntos ciegos

Hacer pruebas de escucha con personas en cada punto de control del entrenamiento no es realista, así que los equipos usan predictores. Funcionan bien en aquello para lo que se entrenaron: ruido, distorsión y artefactos de códec.

Funcionan mucho peor con cosas como un énfasis equivocado, la emoción equivocada o un acento que se desvía. Un artículo de Interspeech de 2026, Investigating Human-Model Discrepancies in Speech Quality Assessment, añadió cantidades crecientes de acento tonal japonés incorrecto a voz sintética. Las valoraciones humanas cayeron 1,84 puntos MOS. UTMOS, UTMOSv2, NISQA y DNSMOS se movieron menos de 0,1, y algunos puntuaron la voz más dañada ligeramente más alto. Los autores concluyeron que todos los modelos eran “insensibles a los errores prosódicos pese a grandes caídas de la puntuación subjetiva”.

Eso no hace inútiles a los predictores. Si UTMOS baja 0,3 en un nuevo punto de control, probablemente algo se rompió. Si se mantiene estable, lo único que sabes es que nada se rompió de una forma que UTMOS pueda oír. Usa los predictores para detectar regresiones y a las personas para tomar decisiones.

Cómo hacer una prueba MOS que diga algo

Si estás comparando modelos de voz para un producto real, una prueba pequeña y bien diseñada vale más que una grande y genérica.

  1. Escribe primero el caso de uso. “Lee números de pedido a un cliente por una línea telefónica” es una prueba que puedes diseñar. “Suena natural” no lo es. Nuestra guía para elegir modelos de voz con IA tiene un marco para esto.
  2. Usa tu propio texto. Incluye las partes difíciles: nombres, direcciones, fechas, precios, códigos y la jerga de tu sector. La lectura limpia oculta la mayoría de los fallos.
  3. Reproduce el audio como lo oirán los usuarios. Para un agente telefónico, eso significa μ-law a 8 kHz, no un WAV de estudio. Iguala el volumen entre sistemas para que el clip más fuerte no gane por defecto.
  4. Evalúa todos los sistemas en la misma sesión. Mezcla el orden, oculta qué sistema es cuál e incluye algunos clips repetidos o de referencia como anclas para detectar a los evaluadores descuidados.
  5. Usa oyentes parecidos a tus usuarios. Para una línea de soporte en español en México, eso significa hablantes nativos de español de México. La P.808 de la ITU explica cómo hacer estas pruebas mediante crowdsourcing.
  6. Reúne suficientes valoraciones e informa del intervalo. Apunta a decenas de valoraciones por sistema, no a un puñado, y publica el intervalo de confianza junto a la media.
  7. Haz una segunda pregunta. Una prueba de preferencia lado a lado (“¿cuál de estos dos preferirías oír?”) suele separar mejor dos sistemas parecidos que dos puntuaciones absolutas.

El MOS en agentes de voz: necesario, no suficiente

El MOS puntúa un clip aislado. Un agente de voz es una conversación, y muchos de los fallos que hacen colgar una llamada nunca aparecen en un clip. El agente tarda demasiado en responder, habla por encima del cliente, lee un código de confirmación demasiado rápido o dice “2026” de una forma que nadie esperaba.

La visión de nuestro equipo de investigación, expuesta en ¿Es bueno este modelo TTS?, es que las puntuaciones de escucha son una entrada entre varias. Las demás son la precisión a nivel de palabra, cómo se pronuncian los nombres y los números, si la voz se mantiene coherente a lo largo de una llamada larga y cómo se comporta en el camino real de streaming. La guía sobre la tasa de error de palabras cubre la parte de precisión.

Si estás comparando modelos, la prueba honesta más rápida es tu propio guion, leído por cada modelo y reproducido por el canal en el que lo oirán tus usuarios. Puedes probar Sonic en el playground con tu propio texto, o pasar el mismo guion por la API con pcm_mulaw a 8000 Hz para oírlo como lo oiría quien llama.

Guías relacionadas

Preguntas frecuentes

¿Qué es el mean opinion score (MOS)?

El mean opinion score es la media de las valoraciones de calidad que dan los oyentes en una escala fija, normalmente la escala de cinco puntos de Absolute Category Rating de la ITU-T P.800: 5 Excelente, 4 Buena, 3 Aceptable, 2 Mediocre, 1 Mala. Los equipos de telecomunicaciones la usan para la calidad de las llamadas, y los investigadores del habla, para la síntesis de voz y la conversión de voz. Muchas herramientas también predicen el MOS con un modelo en lugar de preguntar a personas, y ese número predicho debería indicarse como una estimación.

¿Qué es una buena puntuación MOS?

En llamadas telefónicas y VoIP, Twilio describe entre 4,3 y 4,5 como un objetivo excelente y por debajo de aproximadamente 3,5 como inaceptable. En síntesis de voz no hay un número fijo. Un MOS de TTS solo significa algo junto a los demás sistemas evaluados en la misma prueba, por los mismos oyentes y con las mismas instrucciones. Un 4,2 de un artículo y un 4,4 de otro no se pueden ordenar.

¿Cómo se calcula el MOS?

Se suman todas las valoraciones de los oyentes para un clip o un sistema y se dividen entre el número de valoraciones. Con él se informa del número de valoraciones y de un intervalo de confianza del 95 %. Con 10 valoraciones y una dispersión típica, el intervalo es de aproximadamente ±0,5 puntos. Con 100 valoraciones se reduce a unos ±0,15.

¿Se pueden comparar puntuaciones MOS de pruebas distintas?

No directamente. La ITU-T P.800.2 indica que no deben compararse valores MOS de experimentos separados salvo que los experimentos se diseñaran para ello. Los oyentes usan toda la escala dentro de cada prueba, así que la puntuación de un sistema depende de con qué otros se evaluó. Compara sistemas dentro de una misma prueba o incluye muestras de anclaje compartidas entre pruebas.

¿Qué diferencia hay entre el MOS y el MOS predicho?

El MOS sale de personas que escuchan. El MOS predicho sale de un modelo entrenado para imitar esas valoraciones: PESQ y POLQA para redes telefónicas, y DNSMOS, NISQA y UTMOS para mejora y síntesis de voz. Los predictores son baratos y útiles para detectar regresiones en miles de clips, pero no ven los fallos para los que no se entrenaron, como un énfasis equivocado o un acento tonal incorrecto.