導入事例

Cartesiaが世界で最も応答性の高いAIアバターを支える仕組み

企業について

Cerebriumは、AIチームが数分でアプリケーションをデプロイできる、サーバーレスのインフラを構築しています。チームは、リアルタイムAIと、それによって極めてリアルな人間同士のやり取りを再現できる可能性に期待を寄せています。

営業トレーニングとユーザーインタビューのために作成したこのデモでは、AIアバターの実用的な用途を紹介しました。

Cerebriumのデモをご覧ください。

世界で最も応答性の高いAIアバターを構築する

Cerebriumが目指したのは、本物の人間のような応答性で、営業担当者をトレーニングし、求職者を指導するAIアバターでした。

人は待つことが苦手であり、長い間が空くと、相手がAIであることがすぐに分かります。そのため、遅延は1ミリ秒でも重要です。Cerebriumは、このデモの技術構成をつくる際、人間との自然な会話の品質を保ちながら、遅延を最適化しようとしました。

Cerebriumは、三つの主要な技術を組み合わせて、このデモを作成しました。

  1. Mistral:7B言語モデル
  2. Tavus:AIアバター
  3. Cartesia:低遅延で非常にリアルな音声API

モデルの初回音声遅延が100 ms未満のCartesiaは、市場で最速の生成音声ソリューションです。また、主要なテキスト読み上げプロバイダーすべてを対象に、人によるブラインドの好みの比較を行うArtificial Analysisなど、複数の第三者のモデル評価プラットフォームでも、最もリアルで自然な声が確認されています。

Cartesiaは、速度や感情といった音声設計を細かく制御できる唯一のプロバイダーでもあります。このデモでは、話し相手が怒っている、話すのが速すぎるなど、さまざまな営業や面接の場面を練習できます。

速度と品質を両立できる唯一のプロバイダーである理由は、AIモデルにとって根本的に効率の高いアーキテクチャである状態空間モデル(SSM)を基盤に、音声APIを構築したことにあります。

その結果、人間のコーチと話すのと区別できない音声のやり取りが生まれました。次のことができます。

  • ユーザーの入力に、エンドツーエンドで500ms未満で応答する
  • 怒っている顧客から、支えてくれるコーチまで、話し方を変える
  • 文脈を踏まえた複雑な会話に対応する

実際にお試しください:https://coaching.cerebrium.ai/

遅延が重要な理由

  1. 関心の維持:応答が速いほど会話は自然になり、ユーザーは長く関わり続けます。
  2. 拡張性:遅延が小さければ、品質を損なわずに、より多くのユーザーを同時に処理できます。
  3. ユーザー体験:すぐに結果を求める環境では、小さな遅れでも、いら立ちや離脱につながります。

カスタマーサービスのボット、バーチャルアシスタント、次世代の教育技術など、どのようなものを構築する場合でも、リアルな体験には速度が欠かせません。

Cartesiaの音声でAIを強化する

Cerebriumのデモは、ほんの始まりです。コミュニティでは今、Cartesiaの音声を使って次のようなものも構築しています。

発音の誤りにすぐに応答する言語学習アプリ。

感情の手がかりをリアルタイムに捉えるメンタルヘルスのチャットボット。

難しい研究論文の内容をクイズで出題する学習パートナー。

Cerebriumがアバターを構築した技術的な詳細については、同社の詳しいブログ記事をご覧ください。