MOS(mean opinion score、平均オピニオン評点)は、聴取者のグループがある音声につけた評価の平均で、通常は1(非常に悪い)から5(非常に良い)の尺度で表します。もともとは通話品質を数値で表すために電話の世界で生まれ、今では音声合成の論文やベンダー比較で標準的に使われる品質指標になっています。
音声モデルを選ぶときや音声エージェントを調整するときにMOSを理解しておく価値は、主に、MOSが誤用されている場面を見抜けるようになることにあります。ここでは、この数値の中身、通話と合成音声それぞれでのよいスコアの目安、そしてMOSを信用する前に確認すべきことを説明します。
MOSの尺度
ほとんどのMOSテストは、ITU-T勧告P.800で定義された絶対カテゴリ評価(ACR)尺度を使います。聴取者は音声を1つずつ聞き、ラベルを選びます。
| スコア | ラベル |
|---|---|
| 5 | 非常に良い |
| 4 | 良い |
| 3 | 普通 |
| 2 | 悪い |
| 1 | 非常に悪い |
MOSはこれらの評価の算術平均です。10人がある音声を5、4、4、5、3、4、4、5、4、3と評価すれば、MOSは4.1です。
P.800は1996年の勧告で、電話網のために書かれました。Wikipediaの解説にあるとおり、試験条件は部屋まで規定されています。静かな部屋で、残響時間は500ms未満、背景雑音は30dBA未満です。関連する勧告ITU-T P.800.1は、スコアの出どころに応じたラベルを定めています。製品ページの「MOS」は、いくつもの異なる測定を指しうるので、これは重要です。
1つの略語、3つの数値
MOSが引用されていたら、どの種類なのかを確認しましょう。
| 種類 | 求め方 | よく見かける場所 |
|---|---|---|
| 主観MOS | 人が聞いて評価する | TTSの論文、モデル発表、コーデックの聴取試験 |
| 予測MOS(音声) | モデルが音声を比較または聞いて推定する:PESQ、POLQA、DNSMOS、NISQA、UTMOS | コーデックやネットワークの試験、TTS学習のダッシュボード |
| 推定MOS(通話) | ジッター、遅延、パケットロスなどのネットワーク統計から計算する | VoIPやコンタクトセンターのダッシュボード |
主観MOSは本来の形です。聴取者を集めて報酬を払う必要があるので、時間もお金もかかります。
予測MOSは、聴取者の代わりに、過去の評価で学習したモデルを使います。PESQ(ITU-T P.862)は、劣化した通話録音をクリーンな基準音声と比べます。ITUは2024年1月にPESQを廃止し、POLQA(ITU-T P.863)に置き換えました。合成音声には比べるべきクリーンな基準がないため、研究者はDNSMOS、NISQA、UTMOSのような基準不要の予測器を使います。
通話品質ダッシュボードの推定MOSは、たいてい誰の意見でもありません。ITU-T G.107のEモデルのようなネットワーク設計用のモデルが、遅延、ジッター、パケットロスをMOS尺度のスコアに換算します。Dialpadの用語集も、自社のMOSを「ジッター、遅延、パケットロスを考慮した」数値だと説明しています。
3つとも同じ1〜5の尺度で表されますが、測っているものは同じではありません。
よいMOSスコアとは?
どの数値を見ているかによります。
電話やVoIPの通話には、実務上の目安があります。Twilioの用語集は、約4.3〜4.5を優れた品質の目標とし、約3.5を下回ると通話は許容できないとしています。人は満点をつけるのを避けるので、評価が5に届くことはまずありません。コンタクトセンターのダッシュボードが4を超えていれば、問題はおそらくネットワークではありません。
音声合成には普遍的な基準値はなく、基準値を示す人は一段階飛ばしています。TTSのMOSは、同じテストに含まれたほかのものとの相対的な位置を表します。優れたモデルを弱い比較対象と並べれば高く評価されます。同じモデルを人間の録音音声と並べれば、音声そのものは変わっていないのにスコアは下がります。
ですから、TTSのMOSは1つのテスト内での順位として読んでください。役に立つ問いは「4.3はよいのか?」ではなく、「何と比べて4.3で、誰が評価したのか?」です。
2つのMOSが通常は比較できない理由
MOSの解説の多くが飛ばしている部分ですが、悪い判断のほとんどはここから生まれます。
聴取者は与えられた尺度を全部使います。 評価者は1つのテストの中で1〜5に評価を散らばらせる傾向があり、これはレンジ均等化バイアスと呼ばれます。明らかに劣る音声の中で評価されたシステムは押し上げられ、より優れた音声の中で評価された同じシステムは押し下げられます。MOSの報告方法を定めたITU-T P.800.2は、比較できるように設計された実験でない限り、別々の実験のスコアを直接比較すべきではないとしています。
条件が変われば数値も変わります。 指示文、使う文、再生音量、ヘッドホンかノートPCのスピーカーか、評価者の疲れ具合が、どれもスコアを動かします。私たちのブログ記事このTTSモデルはよいモデルか?では、4人の聴取者が条件の違いによって同じ波形に4つの異なるスコアをつける例を紹介しています。
人によって求めるものが違います。 瞑想アプリでは高く評価される温かくゆっくりした声が、薬局の処方箋更新窓口では場違いに聞こえることがあります。MOSが示すのは平均であり、平均の裏には意見の割れる2つの聴取者グループが隠れているかもしれません。
サンプルが少ないと誤差が大きくなります。 上の10件の評価では、95%信頼区間はおよそ±0.5です。このサンプルでは4.1と4.5を区別できません。同じばらつきで評価が100件あれば、区間は約±0.15まで狭まります。公表されたMOSに評価件数や信頼区間が添えられていなければ、見た目より精度が低いと考えてください。
実務上のルールは、同じテストから出たMOSだけを比較することです。モデル発表で自社の4.4と、競合自身の論文から引いた競合の4.2を並べても、ほとんど何もわかりません。
予測MOS:役に立つが死角もある
学習のチェックポイントごとに人による聴取試験を行うのは現実的ではないので、チームは予測器を使います。予測器は、学習した対象、つまり雑音、歪み、コーデックのアーティファクトには強いです。
一方、強調の誤り、感情の誤り、なまりのずれといったものにはずっと弱いです。Interspeech 2026の論文Investigating Human-Model Discrepancies in Speech Quality Assessmentでは、合成音声に誤った日本語のピッチアクセントを段階的に加えました。人の評価は1.84 MOS点下がりました。UTMOS、UTMOSv2、NISQA、DNSMOSはいずれも0.1未満しか動かず、最も崩れた音声をわずかに高く評価したものもありました。著者らは、すべてのモデルが「主観スコアが大きく下がっているにもかかわらず、韻律の誤りに鈍感」だとしています。
だからといって予測器が無意味なわけではありません。新しいチェックポイントでUTMOSが0.3下がれば、おそらく何かが壊れています。変わらなければ、わかるのは「UTMOSに聞こえる形では何も壊れていない」ということだけです。予測器は劣化の検出に、人は意思決定に使いましょう。
意味のあるMOSテストの進め方
実際の製品のために音声モデルを比較するなら、小さくてよく設計されたテストのほうが、大きくて汎用的なテストより役に立ちます。
- まずユースケースを書き出します。 「電話回線で顧客に注文番号を読み上げる」は設計できるテストです。「自然に聞こえる」は設計できません。私たちの音声AIモデルの選び方に、そのための枠組みがあります。
- 自分たちのテキストを使います。 人名、住所、日付、価格、コード、業界用語など、難しい部分を含めてください。きれいな読み上げ文では、ほとんどの失敗が隠れてしまいます。
- ユーザーが聞くのと同じ形で再生します。 電話エージェントなら、スタジオ品質のWAVではなく8kHzのμ-lawです。音量の大きい音声が自動的に勝たないよう、システム間で音量をそろえます。
- すべてのシステムを同じセッションで評価します。 順番をランダムにし、どのシステムかを伏せ、繰り返しや基準の音声をアンカーとしていくつか混ぜて、いい加減な評価者を見つけられるようにします。
- ユーザーに近い聴取者を使います。 メキシコ向けのスペイン語サポート回線なら、メキシコのスペイン語を母語とする人です。ITUのP.808は、こうしたテストをクラウドソーシングで行う方法を定めています。
- 十分な数の評価を集め、信頼区間を報告します。 1システムあたり数件ではなく数十件を目標にし、平均と一緒に信頼区間を公表します。
- 2つ目の質問をします。 2つを並べて「どちらを聞きたいか」を選んでもらう選好テストは、2つの絶対評価よりも、近いシステム同士をうまく分けられることがよくあります。
音声エージェントにとってのMOS:必要だが十分ではない
MOSは1本の音声を単独で評価します。音声エージェントは会話であり、通話を切られる原因になる失敗の多くは、1本の音声には現れません。エージェントの返答が遅すぎる、相手の発話にかぶせて話す、確認コードを速く読みすぎる、誰も予想しない読み方で「2026」と言う、といったことです。
私たちの研究チームはこのTTSモデルはよいモデルか?で、聴取評価は複数ある判断材料の1つにすぎないという考えを示しています。ほかの材料は、単語レベルの正確さ、人名や数字の発音、長い通話を通して声が一貫しているか、そして実際のストリーミング経路での振る舞いです。正確さについては単語誤り率のガイドで扱っています。
モデルを比較するなら、最も手早く誠実なテストは、自分たちの台本を各モデルに読ませ、ユーザーが実際に聞く経路で再生することです。プレイグラウンドでSonicを試すこともできますし、同じ台本をAPIにpcm_mulaw、8000Hzで通せば、電話をかけてきた人と同じ聞こえ方で確認できます。