Cartesiaは、Together AIのVoice Platformの専任モデルパートナーになりました。テキスト読み上げモデルSonicが、Togetherの法人顧客向けにネイティブエンドポイントとして提供されます。Togetherで開発する450K+のチームと開発者は、世界最速のTTSをスイッチ一つのような手軽さで組み込めるようになりました。
Together AIがCartesiaを選んだ理由は、状態空間モデルを基盤とする先駆的なアーキテクチャにあります。AI開発を大幅に高速化し、費用効率を高め、本番利用を可能にします。この提携は一つの層だけでなく、音声スタック全体を最適化します。企業向けのリアルタイム音声は、次のように実現されます。
- 極めて低い遅延:Together AIのVoice Platformは、STT、LLM、TTSを単一の高性能インフラに配置し、プラットフォーム間の遅延をなくします。人のまばたきより速い100ms未満のCartesiaモデルが、音声処理のボトルネックを防ぎます。その結果、リアルタイムの音声アプリケーションで対話性を実現するエンドツーエンド遅延が得られます。
- 優れた精度と信頼性:Cartesiaモデルは、他のモデルが取りこぼす英数字、専門用語、例外的な入力も高い精度で処理します。42言語と数百種類の多様な音声に対応し、ベンチマークだけでなく実際の現場でも機能します。
- 企業規模への拡張性:本番対応のインフラが開発期間と大規模導入の運用コストを削減します。コンタクトセンター、医療、金融サービス、規制対象業界のTogetherの顧客は、厳しい環境のために構築された、本番対応の音声スタックを利用できます。
Together AIは、リアルタイム音声にCartesiaを標準採用する世界有数のAIインフラプラットフォームの一員となります。この提携は、Sonicの提供開始以来、本番環境で続いてきた関係を発展させるものです。TogetherのGPUクラスターでは、毎日数百万分の音声を処理しています。
業界をリードするCartesiaのモデルをTogether AIに迎えられることをうれしく思います。これらのモデルを同じ場所に配置することで、リアルタイム音声エージェントの妨げとなっていた遅延を取り除き、お客様が従来以上に速く、流れるような会話体験を構築できるようにします。