ブログ / 製品

TTSモデルと声は別のもの

Zubin Pratap 
TTSモデルと声を別々の入力として示す図

音声合成、つまりTTSモデルは音声を生成します。しかし、モデルと、そのモデルが話す声は別のものです。

LLMに詳しい方なら、声はシステムプロンプトに少し似ていると考えるとよいでしょう。モデルが基本的な能力を提供し、入力が生成する内容を形づくります。

TTSでは、声はモデルとは別の入力であることが多く、モデルの応答を左右します。そして音声という応答は、テキストよりはるかに複雑です。音声を生成するモデルは、何を言うかだけでなく、どう言うか、どのくらいの速さと音量で話すか、イントネーション、韻律、強調をどうするかまで扱う必要があります。声の多くの特徴と、「よい声」の評価指標です。本来ならモデルに指定したいことですが、ほとんどのTTSモデルで指定できる入力は、読み上げるテキストと選択した声の一つか二つです。

音声モデルへの入力

話者が固定されたモデルは、読み上げるテキストだけを入力として受け取ります。一つの声で話すように学習されており、その声は学習済みの重みに組み込まれています。声を入力として受け取ることはありません。

そのため、どのテキストを渡しても、毎回同じ話者の声に聞こえる音声を返します。

固定話者モデル + テキスト = 一つの声による音声

モデルに備わっている一つの声しか聞けないと、モデルと声は同じものに見えます。通常の利用では、両者を明確に分けられません。別の話者の声を出すには、モデルの適応や再学習が必要です。

一方、複数話者モデルは、声の選択をもう一つの入力として受け取ります。テキストを渡し、モデルが対応する固定の声の一覧から一つを選びます。

複数話者モデル + テキスト + 選択した話者 = その声による音声

音声合成モデル自体は同じまま、選択した声によって、生成する音声の特徴が変わります。

テキストを変えずに声だけを入れ替えると、別の話者が話しているように聞こえます。次は同じ文を読む英語の音声です。

Same words, different voice, same model.

声A(英語)

声B(英語)

ゼロショットのクローンは新しい話者にも対応する

ゼロショットの声のクローンモデルは、あらかじめ登録された一覧にない話者の声でもTTSで再現できます。テキストと、参照する話者の音声クリップを「プロンプト」として受け取ります。

クローンモデル + テキスト + 話者の音声クリップ = クローンした声

音声にはテキストより多くの情報が含まれるため、音声クリップの「プロンプト」は合成する声を細かく制御できます。学習やファインチューニングで一度も使っていない話者に対応できることが、「ゼロショット」の意味です。

音声の生成時に、参照音声クリップから一般化します。

CartesiaのInstant Voice Cloning、IVCはこの仕組みで動きます。

自分の声の短いクリップを「プロンプト」として渡します。モデルに声の特徴を与えるには、10〜60秒の入力音声があれば十分です。CartesiaのSonicは、クローンにも対応するエンドツーエンドのTTSモデルです。録音から声の特徴を抽出し、それを使って、本人のように聞こえる音声をTTSモデルに生成させます。

Professional Voice Cloning、PVCは、より大きな録音データセットでモデルをファインチューニングします。実行時に声のサンプルで条件付けするだけでなく、入力サンプルに合わせてモデルそのものを更新し、適応させます。IVCと異なり、Professional Voice Cloningには最大で数時間ほどかかります。興味深いことに、CartesiaのPVCは再現性が高く、マイクに当たる破裂音、録音機材に由来するノイズ、背景の雑音など、不要と思われる部分まで再現することがあります。多くの用途では、その再現が好まれるのです。

録音には話者の特徴以外も含まれる

お客様からは、「ざらついた声」「温かい声」「自信を感じる声」といった要望が寄せられます。参照クリップには、話す速さ、間、部屋の雑音、口の音、そのときの話し方の細部も含まれます。システムは、どれが話者自身の特徴で、どれが録音に由来するものかを見分ける必要があります。

長い間は、生成される音声の速さに影響することがあります。背景の雑音は低減、無視、再現のいずれかになる可能性があります。同じ素材でも、モデルによって反応は異なります。

Cartesiaの声のクローンのガイドでは、雑音のない音声、短い間、目的の用途に合った話し方の素材を推奨しています。

落ち着いて要点を伝える声はカスタマーサポートに適していますが、請求をめぐるトラブルでは、突き放している、共感がないと受け取られることもあります。明るい声は、製品の操作説明や初期設定のアシスタントに活気を与えられます。これらは異なる音声の特徴を持つ声ですが、一つのモデルで生成できます。

「声をどう選ぶか」と「このTTSモデルはよいか」は別の問いです。混同すると、音声エージェントの声に違和感があるとき、間違った対象を調べることになります。