MOS(평균 의견 점수)란 무엇인가요?

Rene, Kabir Goel 
MOS(평균 의견 점수)란 무엇인가요?

MOS(mean opinion score, 평균 의견 점수)는 청취자 그룹이 어떤 음성에 매긴 평가의 평균으로, 보통 1(매우 나쁨)에서 5(매우 좋음)까지의 척도로 나타냅니다. 원래 통화 품질을 숫자로 나타내기 위해 전화 분야에서 생겨났고, 지금은 음성 합성 논문과 업체 비교에서 기본으로 쓰이는 품질 지표가 되었습니다.

음성 모델을 고르거나 음성 에이전트를 조정할 때 MOS를 이해해 두면 좋은 이유는, 무엇보다 MOS가 잘못 쓰이는 경우를 알아볼 수 있기 때문입니다. 여기서는 이 숫자에 무엇이 들어가는지, 통화와 합성 음성에서 좋은 점수는 어느 정도인지, 그리고 점수를 믿기 전에 확인할 것들을 설명합니다.

MOS 척도

대부분의 MOS 테스트는 ITU-T 권고 P.800에 정의된 절대 범주 평가(ACR) 척도를 사용합니다. 청취자는 샘플을 하나씩 듣고 라벨을 고릅니다.

점수라벨
5매우 좋음
4좋음
3보통
2나쁨
1매우 나쁨

MOS는 이 평가들의 산술 평균입니다. 10명이 어떤 음성을 5, 4, 4, 5, 3, 4, 4, 5, 4, 3으로 평가하면 MOS는 4.1입니다.

P.800은 1996년에 나온 권고로, 전화망을 위해 작성되었습니다. 위키백과의 표준 요약에 나오듯 테스트 조건을 방까지 규정합니다. 방은 조용해야 하고, 잔향 시간은 500ms 미만, 배경 소음은 30dBA 미만이어야 합니다. 관련 표준인 ITU-T P.800.1은 점수의 출처에 따른 라벨을 정의합니다. 제품 페이지의 “MOS”가 여러 가지 서로 다른 측정을 뜻할 수 있기 때문에 이 점이 중요합니다.

약어 하나, 숫자 셋

누군가 MOS를 인용하면 어떤 종류인지 확인하세요.

종류산출 방식주로 보이는 곳
주관 MOS사람이 듣고 평가TTS 논문, 모델 발표, 코덱 청취 테스트
예측 MOS(음성)모델이 음성을 비교하거나 들어서 추정: PESQ, POLQA, DNSMOS, NISQA, UTMOS코덱·네트워크 테스트, TTS 학습 대시보드
추정 MOS(통화)지터, 지연, 패킷 손실 같은 네트워크 통계로 계산VoIP·컨택센터 대시보드

주관 MOS가 원래 형태입니다. 청취자를 모집하고 보수를 지급해야 하므로 시간과 비용이 듭니다.

예측 MOS는 청취자 대신 그들의 과거 평가로 학습한 모델을 씁니다. PESQ(ITU-T P.862)는 품질이 떨어진 통화 녹음을 깨끗한 기준 음성과 비교합니다. ITU는 2024년 1월 PESQ를 폐지하고 POLQA(ITU-T P.863)로 대체했습니다. 합성 음성에는 비교할 깨끗한 기준이 없기 때문에, 연구자들은 DNSMOS, NISQA, UTMOS 같은 무기준 예측기를 사용합니다.

통화 품질 대시보드의 추정 MOS는 대개 누구의 의견도 아닙니다. ITU-T G.107 E-모델 같은 네트워크 설계용 모델이 지연, 지터, 패킷 손실을 MOS 척도의 점수로 환산합니다. Dialpad 용어집도 자사 MOS를 “지터, 지연, 패킷 손실을 고려한” 숫자라고 설명합니다.

세 가지 모두 같은 1~5 척도로 표시되지만, 측정하는 대상은 같지 않습니다.

좋은 MOS 점수란?

어떤 숫자를 보고 있는지에 따라 다릅니다.

전화와 VoIP 통화에는 실무상의 기준이 있습니다. Twilio 용어집은 약 4.3~4.5를 우수한 품질 목표로 보고, 약 3.5 미만이면 통화를 받아들일 수 없다고 말합니다. 사람들은 만점 주기를 꺼리기 때문에 평가가 5에 이르는 일은 드뭅니다. 컨택센터 대시보드가 4를 넘는다면 문제는 아마 네트워크가 아닐 것입니다.

음성 합성에는 보편적인 기준값이 없고, 기준값을 제시하는 사람은 한 단계를 건너뛰고 있는 것입니다. TTS MOS는 같은 테스트에 포함된 다른 대상과의 상대적인 위치를 나타냅니다. 뛰어난 모델을 약한 비교 대상과 나란히 두면 높은 점수를 받습니다. 같은 모델을 사람의 녹음 음성과 나란히 두면, 음성은 그대로인데도 점수가 떨어집니다.

그러니 TTS MOS는 하나의 테스트 안에서의 순위로 읽으세요. 유용한 질문은 “4.3이면 좋은가?”가 아니라 “무엇과 비교해 4.3이고, 누가 평가했는가?”입니다.

두 MOS를 보통 비교할 수 없는 이유

MOS 설명 대부분이 건너뛰는 부분이지만, 잘못된 결정은 대부분 여기서 나옵니다.

청취자는 주어진 척도를 전부 씁니다. 평가자는 한 테스트 안에서 점수를 1~5에 고루 퍼뜨리는 경향이 있는데, 이를 범위 균등화 편향이라고 합니다. 확연히 못한 샘플들 사이에서 평가된 시스템은 점수가 올라가고, 더 나은 샘플들 사이에서 평가된 같은 시스템은 점수가 내려갑니다. MOS 보고 방법을 정한 ITU-T P.800.2는 비교하도록 설계된 실험이 아니라면 별개의 실험에서 나온 점수를 직접 비교해서는 안 된다고 말합니다.

조건이 바뀌면 숫자도 바뀝니다. 지침, 사용한 문장, 재생 음량, 헤드폰인지 노트북 스피커인지, 평가자가 얼마나 지쳤는지가 모두 점수를 움직입니다. 저희 블로그 글 이 TTS 모델은 좋은 모델일까요?에서는 네 명의 청취자가 각자의 환경에 따라 같은 파형에 네 가지 다른 점수를 매기는 사례를 보여 줍니다.

사람마다 원하는 것이 다릅니다. 명상 앱에서는 높은 점수를 받는 따뜻하고 느린 목소리가 약국의 처방전 갱신 전화에서는 어색하게 들릴 수 있습니다. MOS는 평균을 보여 줄 뿐이고, 평균 뒤에는 의견이 갈리는 두 청취자 그룹이 숨어 있을 수 있습니다.

표본이 작으면 오차가 큽니다. 위의 10건 평가에서 95% 신뢰구간은 약 ±0.5입니다. 이 표본으로는 4.1과 4.5를 구별할 수 없습니다. 같은 분산으로 평가가 100건이면 구간은 약 ±0.15로 좁아집니다. 공개된 MOS 옆에 평가 수나 신뢰구간이 없다면 보이는 것보다 정확도가 낮다고 생각하세요.

실무 원칙은 같은 테스트에서 나온 MOS끼리만 비교하는 것입니다. 모델 발표에서 자사의 4.4와 경쟁사 논문에서 가져온 경쟁사의 4.2를 나란히 놓아도 알 수 있는 것은 거의 없습니다.

예측 MOS: 유용하지만 사각지대가 있습니다

학습 체크포인트마다 사람이 듣는 청취 테스트를 하는 것은 현실적이지 않아서, 팀들은 예측기를 씁니다. 예측기는 학습한 대상, 즉 잡음, 왜곡, 코덱 아티팩트에는 강합니다.

반면 잘못된 강세, 잘못된 감정, 어긋나는 억양에는 훨씬 약합니다. Interspeech 2026 논문 Investigating Human-Model Discrepancies in Speech Quality Assessment는 합성 음성에 잘못된 일본어 피치 악센트를 점점 더 많이 넣었습니다. 사람의 평가는 1.84 MOS점 떨어졌습니다. UTMOS, UTMOSv2, NISQA, DNSMOS는 모두 0.1 미만으로만 움직였고, 가장 망가진 음성을 오히려 약간 더 높게 평가한 모델도 있었습니다. 저자들은 모든 모델이 “주관 점수가 크게 떨어졌는데도 운율 오류에 둔감”하다고 결론지었습니다.

그렇다고 예측기가 쓸모없다는 뜻은 아닙니다. 새 체크포인트에서 UTMOS가 0.3 떨어졌다면 아마 무언가가 망가진 것입니다. 그대로라면 알 수 있는 것은 “UTMOS가 들을 수 있는 방식으로는 아무것도 망가지지 않았다”는 것뿐입니다. 예측기는 성능 저하를 잡는 데, 사람은 결정을 내리는 데 쓰세요.

의미 있는 MOS 테스트를 하는 방법

실제 제품을 위해 음성 모델을 비교한다면, 작고 잘 설계된 테스트가 크고 일반적인 테스트보다 낫습니다.

  1. 먼저 사용 사례를 적습니다. “전화 회선으로 고객에게 주문 번호를 읽어 준다”는 설계할 수 있는 테스트입니다. “자연스럽게 들린다”는 그렇지 않습니다. 저희 음성 AI 모델 선택 가이드에 이를 위한 틀이 있습니다.
  2. 직접 쓴 텍스트를 사용합니다. 이름, 주소, 날짜, 가격, 코드, 업계 용어 같은 어려운 부분을 넣으세요. 깔끔한 낭독 문장은 대부분의 실패를 가립니다.
  3. 사용자가 듣는 방식 그대로 재생합니다. 전화 에이전트라면 스튜디오 WAV가 아니라 8kHz μ-law입니다. 소리가 큰 음성이 저절로 이기지 않도록 시스템 간 음량을 맞추세요.
  4. 모든 시스템을 같은 세션에서 평가합니다. 순서를 섞고, 어느 시스템인지 가리고, 반복 음성이나 기준 음성을 몇 개 넣어 성의 없는 평가자를 가려낼 수 있게 하세요.
  5. 사용자와 비슷한 청취자를 씁니다. 멕시코의 스페인어 고객 지원 회선이라면 멕시코 스페인어 원어민이어야 합니다. ITU P.808은 이런 테스트를 크라우드소싱으로 진행하는 방법을 다룹니다.
  6. 충분한 평가를 모으고 신뢰구간을 보고합니다. 시스템당 몇 건이 아니라 수십 건을 목표로 하고, 평균과 함께 신뢰구간을 공개하세요.
  7. 두 번째 질문을 합니다. 두 개를 나란히 들려주고 “어느 쪽을 듣고 싶은가?”를 묻는 선호도 테스트는 두 개의 절대 점수보다 비슷한 시스템을 더 잘 구별하는 경우가 많습니다.

음성 에이전트에서의 MOS: 필요하지만 충분하지 않습니다

MOS는 음성 하나를 따로 떼어 평가합니다. 음성 에이전트는 대화이고, 통화를 끊게 만드는 실패 중 상당수는 음성 하나에는 드러나지 않습니다. 에이전트가 너무 늦게 대답하거나, 상대의 말을 끊고 말하거나, 확인 코드를 너무 빨리 읽거나, 아무도 예상하지 못한 방식으로 “2026”을 읽는 경우입니다.

저희 연구팀은 이 TTS 모델은 좋은 모델일까요?에서 청취 점수는 여러 판단 근거 중 하나일 뿐이라는 관점을 제시했습니다. 다른 근거는 단어 수준의 정확도, 이름과 숫자의 발음, 긴 통화 내내 목소리가 일관되는지, 그리고 실제 스트리밍 경로에서 어떻게 동작하는지입니다. 정확도 부분은 단어 오류율 가이드에서 다룹니다.

모델을 비교한다면 가장 빠르고 정직한 테스트는 직접 쓴 대본을 각 모델이 읽게 하고, 사용자가 실제로 듣는 채널로 재생하는 것입니다. 플레이그라운드에서 Sonic을 사용해 직접 쓴 텍스트로 들어 보거나, 같은 대본을 pcm_mulaw, 8000Hz로 API에 보내 전화를 건 사람이 듣는 그대로 확인할 수 있습니다.

관련 가이드

자주 묻는 질문

MOS(평균 의견 점수)란 무엇인가요?

MOS(mean opinion score)는 청취자가 고정된 척도로 매긴 품질 평가의 평균입니다. 가장 흔히 쓰이는 것은 ITU-T P.800의 5점 절대 범주 평가(ACR) 척도로, 5 매우 좋음, 4 좋음, 3 보통, 2 나쁨, 1 매우 나쁨입니다. 통신 업계는 통화 품질에, 음성 연구자는 음성 합성과 음성 변환 평가에 사용합니다. 사람에게 묻는 대신 모델로 MOS를 예측하는 도구도 많은데, 이렇게 예측한 값은 추정치라고 표시해야 합니다.

좋은 MOS 점수는 몇 점인가요?

전화와 VoIP 통화의 경우 Twilio는 약 4.3~4.5를 우수한 품질 목표로, 약 3.5 미만을 받아들일 수 없는 수준으로 봅니다. 음성 합성에는 정해진 기준값이 없습니다. TTS MOS는 같은 테스트에서, 같은 청취자가, 같은 지침으로 평가한 다른 시스템과 나란히 놓을 때만 의미가 있습니다. 한 논문의 4.2와 다른 논문의 4.4는 순위를 매길 수 없습니다.

MOS는 어떻게 계산하나요?

한 음성이나 시스템에 대한 청취자 전원의 평가를 더한 뒤 평가 수로 나눕니다. 함께 평가 수와 95% 신뢰구간을 보고합니다. 평가가 10건이고 일반적인 분산이라면 구간은 약 ±0.5점입니다. 100건이면 약 ±0.15로 좁아집니다.

서로 다른 테스트의 MOS 점수를 비교할 수 있나요?

직접 비교할 수는 없습니다. ITU-T P.800.2는 비교하도록 설계된 실험이 아니라면 별개의 실험에서 나온 MOS 값을 비교해서는 안 된다고 말합니다. 청취자는 각 테스트 안에서 척도 전체를 사용하므로, 한 시스템의 점수는 함께 평가된 대상에 따라 달라집니다. 시스템은 하나의 테스트 안에서 비교하거나, 테스트 사이에 공통 기준 샘플을 넣으세요.

MOS와 예측 MOS는 무엇이 다른가요?

MOS는 사람이 듣고 매긴 평가입니다. 예측 MOS는 그 평가를 흉내 내도록 학습한 모델이 내놓는 값입니다. 전화망에는 PESQ와 POLQA, 음성 향상과 음성 합성에는 DNSMOS, NISQA, UTMOS가 쓰입니다. 예측기는 저렴하고 수천 개의 음성에서 성능 저하를 잡아내는 데 유용하지만, 잘못된 강세나 잘못된 피치 악센트처럼 학습하지 않은 실패는 놓칩니다.