ニューラル音声合成(ニューラルTTS)は、何時間分もの人の話し声で学習したニューラルネットワークが音声を生成する方式です。それ以前のコンピューターは、録音した音声の断片を貼り合わせるか、人が書いたルールから声を計算していました。ニューラルTTSは発音、リズム、イントネーションをデータから学びます。だからこそ「ルートを再検索します」と告げるカーナビではなく、人のように聞こえるのです。
設定メニューやクラウドのコンソールで「ニューラル」音声を勧められてここに来たのなら、それを選んでください。ずっと自然に聞こえます。クラウドの請求では、標準音声のおよそ4倍の料金になることが多く、詳しくは下の料金のセクションで説明します。
製品のために音声モデルを選んでいるのなら、2026年に考えるべきなのは「どのニューラルTTSにするか」です。比較する音声はほぼすべてニューラルです。違いは、音声の生成方法、話し始めるまでの速さ、そして製品が実際に送るテキストをどう扱うかにあります。
ニューラルTTS以前の方式
多くのクラウドプラットフォームの「標準」音声は、今も2つの古い方式で動いています。
波形接続型(コンカテネーティブ)合成は、実在の話者の録音を小さな単位に切り分け、つなぎ直します。Amazon Pollyのドキュメントは、標準エンジンを「録音した音声の音素を連結する」と説明しており、単位どうしの継ぎ目が自然さの限界になります。
パラメトリック合成は、再生時に録音を使いません。モデルが音響パラメータを予測し、信号処理のボコーダーがそれを音に変えます。Google Cloudの音声タイプのページによると、同社の標準音声の多くはこの方式の一種を使っています。柔軟で軽量ですが、昔の読み上げ音声に感じる、少しブーンとしたロボットっぽさの原因でもあります。
ニューラルTTSの仕組み
一般的なニューラルTTSには3つの段階があります。
- テキスト前処理で入力を正規化します。「Dr. Lee, 221B Baker St., $4.50」は話者が実際に読む言葉に変える必要があり、モデルは略語や数字を文脈に合わせてどう読むかを知っていなければなりません。
- 音響モデルが音声の聞こえ方を予測します。通常はメルスペクトログラム、つまり時間とともに周波数ごとのエネルギーがどう分布するかを表す画像として出力します。タイミング、強勢、音の高さはここで決まります。
- ニューラルボコーダーが、そのスペクトログラムを再生できる波形に変換します。
各社が今も製品名に使っているので、主な節目を知っておくと役立ちます。DeepMindのWaveNet(2016年)は音声を1サンプルずつ生成し、当時最高のパラメトリック方式や波形接続方式より自然だと評価されました。GoogleのTacotron 2(2017年)はスペクトログラム予測器とWaveNetボコーダーを組み合わせ、平均オピニオン評点4.53を記録しました(プロの録音は4.58)。HiFi-GAN(2020年)は高品質なボコーダーを安く動かせるほど高速にしました。Amazonのニューラルエンジンも、スペクトログラムを出力するシーケンス・ツー・シーケンスのネットワークとニューラルボコーダーという同じ2段構成です。
新しい世代:音声をトークンとして扱う
2023年ごろから、多くのシステムがスペクトログラムを使わなくなりました。MetaのEnCodecのようなニューラル音声コーデックが、音声を離散トークンの列に圧縮します。モデルは言語モデルが単語を予測するようにそのトークンを予測し、コーデックがそれを音に戻します。MicrosoftのVALL-Eはその利点を示しました。6万時間の英語で学習し、3秒の録音から新しい話者の声をまねることができました。
クラウド各社が今「生成(Generative)」や「HD」音声として販売しているのがこれです。Amazonは生成エンジンを、テキストを音声コードに変換する10億パラメータのトランスフォーマーと、それを音声としてストリーミング出力するデコーダーの組み合わせだと説明しています。こうしたモデルは、意図どおりのトーンで読み、ふさわしい場面で笑い、会話らしく聞こえる点で優れています。ただし代償もあります。MicrosoftはHD音声が出力ごとにわずかに変化すると述べており、Amazonはモデルの更新で声の聞こえ方が変わりうると注意しています。ポッドキャストを1シーズン分制作するなら重要です。電話応対なら、ほとんど問題になりません。
状態空間モデルの位置づけ
リアルタイムの音声生成は長い系列の問題です。数秒の音声でも数千ステップになります。トランスフォーマーのアテンションはそれまでに生成したすべてを見返すため、音声が長くなるほど1ステップのコストが増えます。状態空間モデルは過去を固定サイズの要約として持ち運ぶので、1ステップのコストは一定です。
Cartesiaの創業者たちは、Cartesiaを始める前からこのアイデアに取り組んでいました。Albert GuとKaran GoelはS4の共著者で、GuはTri DaoとともにMambaの共著者でもあります。CartesiaのTTSモデルであるSonicは、このアーキテクチャの系統に基づいています。90ミリ秒未満のモデルレイテンシで生成しながら音声をストリーミングし、44言語を話します。Sonic 3.6は2026年8月の公開時に、Artificial Analysisの2つの音声合成ランキングの両方で1位になりました。私たちは、通話相手が1ミリ秒の遅れも感じ取る音声エージェントのためにSonicを作りました。
料金ページでの「ニューラル」の意味
クラウド各社はこの言葉を料金区分として使っています。2026年10月3日時点のAmazonとGoogleの料金(100万文字あたり)は次のとおりです。
| 提供元 | 従来の音声 | ニューラル | 最新の区分 |
|---|---|---|---|
| Amazon Polly | Standard:4ドル | Neural:16ドル | Generative:30ドル、Long-Form:100ドル |
| Google Cloud | Standard:4ドル | Neural2:16ドル | Chirp 3: HD:30ドル |
目を引く点が2つあります。まず、名称は各社でそろっていないので、ラベルではなくアーキテクチャと実際の聞こえ方で比べてください。Googleは2016年のニューラルの画期となったWaveNet音声を、今では標準音声と同じ4ドルで提供しています。次に、最新の区分はニューラルの約2倍の料金です。それに見合うかどうかは、あなたのテキストと聞き手によって決まり、試してみるまでわかりません。
ニューラル音声の良し悪しを見分けるには
どの提供元も、自社の音声は人間のようだと言います。役に立つのは、自分の製品に近い条件でのテストです。
- ユーザーが実際に聞く文字列を送ってください。注文番号、メールアドレス、日付、価格、名前などです。ニューラルモデルは、こうした文字列で普通の文とは違う間違い方をします。
- 文脈の中で聞いてください。単体ではよく聞こえる一文も、謝罪の後では場違いなトーンになることがあります。
- ユーザーが体験する経路で測ってください。リアルタイムの会話なら、完成したファイルの生成時間ではなく、ストリーミング接続で最初の音声が届くまでの時間です。
- 長い文章と、提供予定のすべての言語で試してください。短いデモでは見えない形で、ペースがずれたりなまりが混じったりします。
この話題については、私たちの研究チームがIs this TTS model good?という長めの記事を書いており、単一のスコアでは結論が出ない理由を説明しています。
オープンソースのニューラルTTS
ニューラルTTSは自分のハードウェアで無料で動かすこともできます。Piperはホームオートメーションでよく使われる高速なローカルエンジンです。KokoroはApacheライセンスの8,200万パラメータのモデルです。どちらも、ネットワークにつながっていない端末でテキストを読み上げる用途に向いています。一方で、コールセンター規模の低レイテンシなストリーミング向けには作られていません。それはSonicの役目です。
違いを自分の耳で確かめるには、製品で実際に話す一文をCartesiaのプレイグラウンドに貼り付けてみてください。無料プランには、自分のテキストで試すのに十分なクレジットが含まれています。