ブログ / 製品

Sonic-3.6のご紹介

Cartesia TTS Research 
3.6と書かれた緑の水彩の吹き出しに重なる、手描きの紙の輪郭

Cartesiaは、AIアーキテクチャとアルゴリズムの基礎的な進歩に力を注いでいます。それがモデルの能力を大きく変える原動力だからです。

Sonic-3.6は、事前学習と事後学習の両方で多言語音声から効率よく学ぶアーキテクチャにおける、最新の成果をまとめたモデルです。 Sonic-3.6は、Sonic-3.5から自然さと品質が大きく向上しました。15のロケールにわたるブラインド比較では、最大93%の割合でリスナーに選ばれています。

年初、既存の枠組みを少しずつ調整するのではなく、すべてを根本から考え直すことこそ、世界最高の研究につながると判断しました。それ以来、新しいアイデアをもとに、データ、モデルのアーキテクチャ、学習、評価を一から構築し直してきました。その成果が現れています。

Sonic-3.6はSonic-3.5からわずか2か月後に登場し、Artificial Analysisの同条件の声と各社の声の両ランキングで、_再び_1位になりました。同条件のランキングで超えた従来の首位は、Sonic-3.5です。他社が差を縮められない中で自社モデルを上回れたことは、研究の進展が加速していることを示しています。

Artificial Analysisの同条件の声のランキング。15のTTSモデルをEloで比較。Cartesia Sonic 3.6が1120で1位、Sonic 3.5が1095で2位、ElevenLabs Eleven v3が1066
最も近い競合である3位との差は、3位から12位までの差より大きくなっています。
Artificial Analysisの各社の声のランキング。15のTTSモデルをEloで比較。Cartesia Sonic 3.6が1285で1位、SpeechifyAI Simba 3.2が1238、Alibaba Qwen-Audio-3.0-TTS-Plusが1237
2位との差は、2位から11位までの差より大きくなっています。

自然な音声との差を縮める

音声を大規模に運用する企業にとって、自然さは顧客が通話を続けるかどうかを左右します。少しでも合成音声らしく聞こえると、発信者は信頼を失い、人への交代を求めます。Sonic-3.6は、44言語で会話が続くよう、自然で母語話者らしく聞こえることを目指して開発しました。

米国英語のブラインド比較では、リスナーは92%の割合でEleven v3よりSonic-3.6を選びました。イントネーション、声の品質、文脈に応じた感情表現が向上したためです。Sonic-3.6は文の意図に合った読み方をし、人間のように会話の文脈に合わせて話し方を変えます。次は英語の音声です。

I understand things are difficult right now. We can start with a smaller amount, around $35 a month, and adjust it later. There's no pressure to commit to more than you can manage.

Eleven v3

Sonic-3.6

¿Hablas español?

英語への対応は出発点です。他の言語やアクセントでも母語話者らしく聞こえるかどうかが、音声AIを主に英語の技術にとどめるのか、世界中の人が話しかけられるものにするのかを決めます。多くのモデルは外国語でも意味が通じますが、アクセント、声の調子、人名や地名の現地での発音まで自然に再現できるモデルは多くありません。

お客様と同じように、言語ごとに有力な競合モデルと音声を聴き比べてSonic-3.6を評価しました。評価したすべての主要言語で、母語話者のパネルはSonic-3.6を選びました。

母語話者による支持率

各ロケールの有力な競合モデルとのブラインド比較。

Cartesiaによる評価2026年8月
比較対象
Sonic-3.6
English Eleven v3と比較4%4%92%92%
English Eleven v3と比較13%13%72%72%
English Eleven v3と比較3%3%77%77%
Spanish Eleven v3と比較16%16%70%70%
Spanish Eleven v3と比較6%6%91%91%
Portuguese Eleven v3と比較27%27%67%67%
French Eleven v3と比較12%12%86%86%
Hindi Gemini 3.1と比較25%25%55%55%

評価方法:言語ごとに有力な競合モデルを選び、その声に近いSonic-3.6の声を用意しました。同じテキストから音声を生成し、母語話者のパネルがモデル名を知らずに各組を評価しました。 得票率 = モデルの勝利数 ÷ 有効票の総数

多言語で次のことが可能になりました。

  • 対応範囲の拡大。61のロケール、そのうち11はインド系言語と、500以上のプリセット音声を利用できます。オディア語とウルドゥー語も新たに加わり、どちらもテキストに対する正確さが96%を超えています。
  • ヒングリッシュ対応。デーヴァナーガリー文字、ラテン文字、または両方を使ったテキストから、ヒンディー語と英語を一回の生成で切り替えられます。
  • Instant Voice Cloningのアクセント再現が向上。広く使われていないアクセントも含め、話者のアクセントをSonic-3.6がより忠実に保ちます。
  • ロケールに応じた読み上げ。任意のlocaleフィールドを設定すると、日付、時刻、数字を現地の人と同じ読み方で発音します。

ヒンディー語と英語を自然に切り替える音声:

हमारी टीम ने पिछले quarter में customer feedback के आधार पर 12/08/2026 को नया mobile app launch किया, जिससे revenue में लगभग पंद्रह प्रतिशत की growth देखी गई।

オーストラリアの人と同じ読み方で日付を読む英語の音声:

Right, so I've confirmed your Qantas booking, QF11, departing Sydney on 21/07/2026. You're in seat 32A, you've got one checked bag at twenty-three kilos, and check-in opens three hours before the 9:50am departure.

本番運用のための開発

デモで自然さが評価されても、真価が問われるのは実際の通話です。大規模な企業の処理に対応するSonic-3.6は、次の能力を備えています。

  • 90ミリ秒未満で応答し、v3 Conversationalの毎秒68文字に対して毎秒132文字と、ほぼ2倍の速度で生成します。
  • 大規模な運用に対応。クラウド、オンプレミス、地域別のエンドポイントで動作し、稼働率99.9%のSLAで支えます。
  • 数百万件の本番通話を支援し、その規模に必要な信頼性を提供しています。
  • 自社クラウドへの導入に対応。 Baseten, Amazon SageMaker, or Together AIを通じて導入でき、音声を自社のインフラの外に出す必要がありません。
  • 企業のコンプライアンス要件に対応。SOC 2、PCI、HIPAA、GDPRをカバーします。
  • ブランドに合う声を、チームの直接の支援を受けながら開発し、見つけられます。

実際に聴いてみる

Sonic-3.6は、PlaygroundまたはAPIで一般提供を開始しました。

ぜひ早めにお試しください。このペースなら、導入が終わる前に次のモデルが登場するかもしれません。

Sonic-3.6の声をお聴きください

Cartesiaを試す(英語)