CartesiaとDeepgramの比較

CartesiaはDeepgramのどちらのモデルよりもレイテンシーのばらつきが小さくなっています。

通話相手が体験するのは平均値ではなく、遅い応答です。

2X Solutions logo
arini logo
toby logo

レイテンシーの安定性

Sonic 3.5は最も遅い応答も最速の応答に近い

  • 平均値では、会話を途切れさせる応答が見えません。通話相手が実際に体験するのは 応答時間のばらつきです。
  • Sonic 3.5は測定された最も遅い応答でも0.5秒未満です。Deepgramの両モデルは それを超えています。

レイテンシーのばらつき:TTFA値の分布

低いほど良い

Coval2026年8月
0ms100ms200ms300ms400ms500ms600ms700ms800ms
Sonic 3.5
Cartesia
Aura-2
Deepgram
Flux
Deepgram
遅延の測定値を見る

最初の音声までの時間をミリ秒で表示しています。箱はリクエストの中央50%、線は中央値を示します。ひげは絶対的な最小値・最大値ではありません。

  • Sonic 3.5:中央値 267ms、中央50% 234〜297ms、ひげ 140〜391ms。
  • Aura-2:中央値 304ms、中央50% 213〜424ms、ひげ 93〜740ms。
  • Flux:中央値 245ms、中央50% 201〜500ms、ひげ 100〜658ms。

遅いリクエストの遅延

特に重要な場面でCartesiaがリード

  • P95は20人に1人が体験する応答であり、会話が止まる頻度を左右します。
  • そのパーセンタイルでSonic 3.5はDeepgramの両モデルより速く応答し、 3つの中で唯一、ばらつきが予測可能な範囲に収まっています。

P95のレイテンシー

低いほど良い

Coval2026年8月
370ms
547ms
590ms
Sonic 3.5
Cartesia
Aura-2
Deepgram
Flux
Deepgram

認識精度

Sonic 3.6は単語の誤りが少ない、Deepgramの両モデルと比較

  • Covalは各モデルが生成したすべてのクリップを文字起こしして台本と比較します。 誤り率が低いほど、台本どおりに読み上げられた割合が高いことを意味します。
  • Sonic 3.6はFluxやAura-2より単語の読み違いが少なく、名前、数字、コードを 記載どおりに伝えます。

単語誤り率

低いほど良い

Coval2026年9月
1.99%
2.2%
2.78%
Sonic 3.6
Cartesia
Flux
Deepgram
Aura-2
Deepgram

企業がDeepgramではなくCartesiaを選ぶ理由

CartesiaDeepgram
  1. 安定性

    Coval
    Cartesia
    四分位範囲63ms
    Deepgram
    四分位範囲211msAura-2四分位範囲300msFlux

    2026年8月

  2. 認識精度

    Coval
    Cartesia
    単語誤り率1.99%Sonic 3.6
    Deepgram
    単語誤り率2.20%Flux単語誤り率2.78%Aura-2

    2026年9月

  3. 言語一覧

    Cartesia
    1つのモデルで44言語に対応し、地域ごとにアクセントを調整
    Deepgram
    7言語
  4. 声の選択肢

    Cartesia
    豊富な音声ライブラリ、10秒からのインスタントクローン、30分からのプロフェッショナルクローン
    Deepgram
    88種類のプリセット音声
  5. 導入形態

    Cartesia
    VPC、オンプレミス、オンデバイス、エアギャップ環境に対応し、稼働率99.9%のSLAを提供
    Deepgram
    セルフホスティングにはEnterpriseプランが必要

よくある質問

Cartesiaの音声品質は第三者が評価していますか?

はい。Sonic 3.6はArtificial Analysis Provider Voice Arenaで94モデル中1位です。モデル名を伏せて2つのクリップを比較するブラインド試聴テストです。また、すべてのモデルに同じクローン音声を使うControlled Voice Arenaでも1位です。

このページのレイテンシーはどのように測定していますか?

Covalは独立した評価プラットフォームです。各社の公開APIを呼び出し、代表値1つではなく、返された結果の分布全体を公開しています。このページの数値は、同じ期間に測定したCartesiaの478回と、Aura-2およびFluxを合わせたDeepgramの951回の実行に基づきます。

平均値よりばらつきが重要なのはなぜですか?

通話相手が体験するのは平均値ではなく、その時点の応答です。普段は速くても時々遅くなるモデルでは、相手がエージェントの発話にかぶせて話し始め、通話を切ってしまう原因になります。遅い応答と速い応答の差を小さくすることが、音声エージェントを自然な会話に近づけます。

自社のインフラでCartesiaを実行できますか?

はい。Cartesiaはオンプレミスとエアギャップ環境にデプロイできます。医療、金融、政府機関のチームが音声を自社ネットワーク内に保つために利用しており、稼働率99.9%のSLAが適用されます。

Deepgramからの移行にはどれくらいかかりますか?

多くのチームで1〜2週間です。Cartesiaは主要な音声エージェントプラットフォームと統合され、すべてのモデルを公開APIで利用できます。別のプラットフォームに移る必要も、後から依存関係を解く手間もありません。

今すぐ始める

専門家に相談する。

音声体験の開発にCartesiaをどう活用できるか、私たちのチームにご相談ください。

営業に問い合わせる

開発を始める。

APIでモデルにアクセスし、数分で音声エージェントを本番環境に導入できます。

Cartesiaを試す