Tavusは生成AI動画の研究企業です。使いやすいAPIを通じて、開発者がデジタルツインの動画体験を構築できるようにします。AIデジタルツインのための世界最速の会話型ビデオインターフェース(CVI)を開発し、人とAIのやり取りを変えています。AIの分身と、没入感のあるリアルタイムの会話を可能にする技術は、マーケティングの自動化、eコマース、企業研修、顧客との関係構築、エンターテインメントに新たな可能性を開きます。
CartesiaがTavusの創業者に出会ったとき、同社はすでにAI性能の限界に挑んでいました。それまでの構成では、自動スケーリングとネットワーク遅延に課題がありました。
Cartesiaとの提携は転機となりました。一貫して90ms未満の遅延を実現するCartesiaのSonicモデルにより、Tavusは厳しい性能要件を満たしながら、インフラを簡素化できました。ユーザーは品質を評価し、テキスト読み上げエンジンとしてCartesiaを指定する人もいました。
CEOのHassaanによる発表をご覧ください。開発者は、詳しいAPIドキュメントを利用して、Tavusの技術を容易に組み込めます。
課題
Tavusは、AIデジタルツインと自然なリアルタイムのビデオ会話ができるプラットフォームを目指しました。その大きな目標には、いくつかの技術的課題を乗り越える必要がありました。
- 途切れないやり取りのため、超低遅延を実現する
- 自然に聞こえる高品質な声をリアルタイムに生成する
- 見て、聞いて、自然に応答できる、説得力のあるAIの分身を作る
- 複数のユーザーを同時に処理する、拡張可能なシステムを開発する
ソリューション
Tavusは、音声生成システムの中核にCartesiaのSonicモデルを選びました。Sonicの状態空間モデルの能力が、高品質かつ低遅延の音声生成というTavusの要件に合致しました。
- 超低遅延:Sonicの90 ms未満の遅延により、Tavusはエンドツーエンドの応答時間を1秒未満に抑え、会話らしい体験を実現します。
- 自然な音声品質:Sonicの高度な音声生成は、リアルな話し声を生み出します。説得力のあるAIデジタルツインには不可欠です。
- 音声設計とクローン:Sonicの即時音声クローンと設計機能により、TavusはAIの分身ごとに独自の声を作成し、個々の利用者に合わせた体験を強化できます。
- 多言語対応:複数の言語に対応するSonicにより、Tavusはプラットフォームを世界に展開できます。
- 拡張性:Cartesiaのインフラは、複数の同時ユーザーというTavusの要件に容易に対応し、利用のピーク時も安定した性能を維持します。
成果
CartesiaのSonicモデルを統合し、Tavusは大きな成果を上げました。
- 1秒未満の遅延:CVIは現在、エンドツーエンドで1秒未満の遅延で動作し、自然な会話の流れを生み出します。
- リアルさの向上:ユーザーから、AIデジタルツインとの会話が非常にリアルで、没入感があるという声が寄せられています。
- 用途の拡大:Tavusは、教育、企業研修、エンターテインメントなど、さまざまな分野で技術を導入しました。
- 拡張性:プラットフォームは複数のユーザーを同時に処理し、広い普及への道を開いています。
TavusはAIとのやり取りの可能性を広げ続け、CVI技術を新たな市場や用途へと展開する計画です。
CartesiaのSonicモデルは、当社の会話型ビデオインターフェースにとって大きな転換点となりました。90msという超低遅延と高品質な音声生成により、AIデジタルツインとの、没入感のあるリアルタイム会話を実現できました。自然な声と音声設計の機能が、製品を新しい水準に引き上げてくれました。
TavusがAIと人のやり取りで実現していることには驚かされます。限界を押し広げることに長けたチームの会話型ビデオインターフェースを、Sonicで支えられるのはうれしいことです。デジタルツインが自然にリアルタイムで会話する姿を見ると、未来に踏み込んだように感じます。その歩みに参加できることを光栄に思います。