音声合成で1位。 音声認識でも1位。

Sonic-3.6とInk-2のご紹介。

音声合成と音声認識の両方で第1位を獲得した唯一のモデルプロバイダーで、音声スタック全体を構築。品質も速度も妥協する必要はありません。

対話型インテリジェンスのためのフルスタック。

Inkの音声認識から、エージェント設定、LLM、API、ガードレール、ツールを経てSonicの音声合成へつながるリアルタイム処理の構成図。図中のラベルは英語です。

音声エージェントのために全体を一体設計

リアルタイム処理のパイプライン全体で最適化された、唯一のSTTとTTS。

1つのAPIで導入完了

1回の連携で両方のモデルを導入。ベンダー間の接続にかける手間を減らし、開発に集中できます。

音声対話の応答をさらに短く

ターン検出を内蔵し、TTSの遅延90ms未満、文字起こしの遅延100msを実現。

Cartesiaの状態空間モデルは、企業向けの速度と品質を当社のAI Voice Agentsにもたらします。企業は、リアルタイムに理解し、行動し、適応する、安全で拡張性のある音声エージェントを導入できるようになります。

Ravi Krishnamurthy, プロダクト担当VP

Cartesiaは、現在の音声AIにあるトレードオフ、

速度と自然さ、

精度とコストの両立を阻むものは、

多くの場合アーキテクチャに由来し、避けられないものではないと考えています。

適切な基礎技術は制約を回避するのではなく取り除く。その考えから、私たちは長年にわたり状態空間モデルの開発とスケーリングに取り組んできました。

Sonic-3.6とInk-2も、既存の限界の中で最適化するのではなく、その限界自体が必要なのかを問い直して開発しました。

信頼できる最速のモデルで開発。

大規模基盤モデルの新たな基礎となる状態空間モデル(SSM)を採用。超低遅延、長いコンテキストでの推論、大規模運用での高い効率を実現します。

企業が選ぶ、Cartesia. 導入企業の声.

導入事例を見る
2X Solutions logo
arini logo
toby logo

お客様の声(日本語訳)

“Sonicに切り替えたのは、少し優れていたからではありません。他の製品とは比較にならなかったからです。コンバージョンは2.9%、顧客エンゲージメントは12.2%向上しました。”

Akshay Ramaswamy

スタッフプロダクトマネージャー