AI音声エージェントプラットフォーム比較(2026年)

Rene 
AI音声エージェントプラットフォーム比較(2026年)

AI音声エージェントプラットフォームは、あなたの代わりに電話に出ます。相手の話を聞き、用件を理解し、社内システムを照会し、声で答え、その分を1分単位で請求します。いまや数十社あり、どこも料金ページは横並びで比べにくい書き方になっています。このページでは、候補に挙がりやすい8つを、それぞれが何を担ってくれるか、そして1分が実際いくらかかるかで比較します。

要点だけ先に言うと、モデル込みの一括料金がよければBland。モデルをすべて自分で選びたいならVapiかRetell。エージェントをコードで書きたいならLiveKit AgentsかPipecat。音声の品質と応答速度で通話相手が離れるかどうかが決まるなら、独立系ランキングで1位の音声モデルを動かすCartesia Managed Agentsを試してください。

私たちはCartesiaを開発しているので、その立場を割り引いて読んでください。以下の競合の料金はすべて、2026年10月3日に各社の料金ページで確認したものです。

音声エージェントプラットフォームがすること

どの音声エージェントも同じループで動きます。ストリーミング音声認識が、相手が話している最中から文字に起こします。ターン検出器が、相手が話し終えたかを判断します。言語モデルが返答を組み立て、カレンダーや注文検索などのツールを呼び出します。音声合成が答えをストリーミングで返します。ループの詳細は音声エージェントの仕組みのガイドで解説しています。

プラットフォームはこのループをホストし、誰も二度と作りたくない部分を足してくれます。電話番号、通話の転送、設定画面、通話ログ、評価です。フレームワークは同じループをコードとして提供し、デプロイは自分で行います。大事なのは、どのベンダーを選ぶかよりも、スタックのどこまでを自分で持つかです。

プラットフォームを一つずつ

Cartesia Managed Agents

Managed Agentsのドキュメントによると、Managed Agentsは音声認識のInk 2、好きなLLM、音声合成のSonic 3.6を組み合わせています。2つの音声モデルはどちらも私たちのものです。Ink 2は2026年6月時点でArtificial Analysisのストリーミングランキングの単語誤り率で1位となり、別の音声区間検出器なしで、自らターンの終わりを予測します。Sonic 3.6は2026年8月時点でArtificial Analysis Provider Voice Arenaの94モデル中1位でした。

エージェントはプレイグラウンドかAPIで設定し、ツール、ナレッジベース、電話番号を持たせられます。通話はどのプランでも1分$0.06で、Cartesiaが提供する電話番号を使うと1分$0.014が加わります。期間限定で、プレイグラウンドで作ったエージェントのLLM利用料は含まれています(料金)。同時通話数はFreeの8件からScaleの60件までです。

音声そのものが製品になる場面に向いています。サポート窓口、受付、そして遅い返答やロボットのような声で相手が電話を切ってしまうあらゆる通話です。使っているCRMや予約システムに連携があるか確認してください。なければ、Webhookツール経由でエージェントからアクセスできます。

Vapi

Vapiは、自分で選んだ部品でエージェントを組み立てる開発者向けプラットフォームです。Vapiの料金ページによると、ホスティングは1分$0.05で、モデル(音声認識、LLM、音声)は原価で請求されるため、実際の単価は選択次第です。Vapi自身の見積もりでは1,000分で月$82〜$129、1分あたり約$0.08〜$0.13になります。無料枠には$5のクレジットと同時通話4件が付きます。Vapiは2024年にCartesiaをデフォルトの音声プロバイダーに選びました。

すべてのモデルを自分で選びたく、請求書3〜4枚分の明細を読むのが苦にならないなら向いています。

Retell AI

Retellはコールセンターの自動化を狙ったローコードのプラットフォームです。料金ページでは従量課金で1分$0.07〜$0.31、同時通話20件が含まれます。デフォルトの見積もりの内訳は、Retellの音声インフラ$0.055、LLM $0.04、電話回線$0.015で、合計約$0.11です。RetellはCartesiaを含む複数のプロバイダーの音声を提供しており、自社プラットフォーム上の次点のプロバイダーと比べてCartesiaの最初の音声までの時間が2〜3倍速いと報告しています。

エンジニアではないメンバーが通話フローを作って保守するなら向いています。

Bland AI

Blandはすべてを一つの数字で請求します。Blandの料金ページではStartが1分$0.14、Build(プラットフォーム料月$299)が1分$0.12で、LLM、音声認識、音声合成が含まれ、電話回線は別料金です。Enterpriseプランでは、オンプレミスやVPCでの導入と、チームに伴走するエンジニアが加わります。

モデルを選べることより、請求額が予測しやすいことを重視するなら向いています。

Synthflow

Synthflowは、ノーコードのビルダー、自社の電話回線、導入支援で大企業のコンタクトセンターを狙っています。料金ページによると、企業向け契約は年$30,000からで、通話量、同時通話数、連携内容に応じて見積もられます。

導入をベンダーと一緒に進めたく、年間契約の予算があるなら向いています。

ElevenLabs Agents

ElevenLabsのエージェント料金によると、ElevenAgentsは通話分数で課金されます。各プランに一定の分数が含まれ、超過分は1分$0.08、同時通話の上限を超えると1分$0.16です。LLMは別途請求されます。ElevenLabsの料金解説では、1万分の利用で試算しています。

チームがすでにクリエイティブ用途でElevenLabsを使っていて、同じアカウントでエージェントも動かしたいなら向いています。遅延に敏感な通話なら、先に比較してください。Covalの2026年8月の測定では、Sonic 3.5のP90での最初の音声までの時間は351msで、テストされたElevenLabsのモデルはすべて1秒を超えました。

LiveKit Agents

LiveKitは多くの音声製品の土台にあるオープンソースのWebRTCインフラで、LiveKit AgentsはエージェントのループをPythonやNodeで書くためのフレームワークです。セルフホストもできますし、LiveKit Cloudにデプロイすることもできます。LiveKit Cloudは含まれる枠を超えるとエージェントのセッション1分につき$0.01を課金し、主要なモデルの推論も同じ請求にまとめられます。

エンジニアがいて、メディアサーバーを運用せずに完全な制御が欲しいなら向いています。LiveKitはCartesiaと提携しており、SonicとInkは同社の推論課金から利用できます。

Pipecat

Pipecatは、Dailyが始めたオープンソースのPythonフレームワークで、音声・マルチモーダルのエージェントをサービスのパイプラインとして構築します。無料で、モデルのプロバイダーに支払い、好きな場所でホストします。

最大限の制御が欲しく、プラットフォームの決まりごとは最小限にしたいなら向いています。Pipecatのチュートリアルでは、InkとSonicで動くエージェントを作り、早めのターン終了検出で返答ごとに約0.5秒短縮できることを示しています。

一覧比較

プラットフォーム種類公表されている1分単価(2026年10月3日)モデル
Cartesia Managed Agentsホスト型プラットフォーム$0.06、Cartesiaの番号は+$0.014Ink 2+任意のLLM+Sonic 3.6
Vapiホスト型プラットフォームホスティング$0.05+モデル原価自由に選択
Retell AIホスト型プラットフォーム$0.07〜$0.31自由に選択
Bland AIホスト型プラットフォーム$0.12〜$0.14、モデル込み込み
Synthflow企業向けプラットフォーム契約、年$30,000から込み
ElevenLabs Agentsホスト型プラットフォーム$0.08+LLMElevenLabs+任意のLLM
LiveKit Agentsフレームワーク+クラウドセッション$0.01+モデル自由に選択
Pipecatオープンソースのフレームワーク無料+モデルとホスティング自由に選択

公表単価だけでは判断材料になりません。高品質な音声と大きなLLMを載せた「$0.05」のプラットフォームが、「$0.14」の一括料金より高くつくこともあります。候補ごとに同じ条件、つまり同じLLM、同じ音声品質、同じ電話回線で通話1本の費用を計算してください。

選び方

ほとんどの判断は4つの問いで決まります。

  1. エージェントを保守するのは誰か? 運用チームなら、ビジュアルビルダーのあるプラットフォーム(Retell、Synthflow、Bland、Managed Agents)を選びましょう。エンジニアなら、Vapi、LiveKit、Pipecatのほうが窮屈に感じません。
  2. エージェントはどれだけ速く答えるか? 人は約200ミリ秒で話者を交代し、1秒の間があると回線が切れたように感じます。相手の最後の言葉からエージェントの最初の音声までの時間を、実際の電話回線で90パーセンタイルで測ってください。きれいな音声での中央値は、遅い通話を隠してしまいます。
  3. 難しい文字列をどう扱うか? 確認コード、住所、電話番号を各候補に読み上げてみてください。これらの書き起こしミスが、間違った予約につながります。
  4. 自社の通話量でいくらかかるか? 想定する月間分数に、LLMと電話回線を含めた総額の単価を掛け、プランの同時通話数を超えたときにどうなるかも確認してください。

そのうえでパイロットを実施しましょう。AIコールセンターのガイドにパイロット計画を、AI受付のガイドに小規模事業者のケースをまとめています。

Cartesia Managed Agentsを試す

Cartesiaのプレイグラウンドなら、無料プランでエージェントを作ってテスト通話できます。無料プランには、エージェントに使える$1のプリペイド残高が毎月含まれます。今のプラットフォームを使い続けたい場合も、Vapi、Retell、LiveKit、PipecatはいずれもエージェントのボイスとしてSonicに対応しています。

関連ガイド

よくある質問

AI音声エージェントプラットフォームとは何ですか?

電話やアプリでの会話のループ全体を代わりに動かすソフトウェアです。音声認識、ターン検出、言語モデル、音声合成、電話回線、エージェントが呼び出すツールまでを含みます。ユーザーはエージェントを設定し、プラットフォームがそれをホストして通話分数ごとに課金します。LiveKit AgentsやPipecatのようなフレームワークは一段下のレイヤーで、ループをコードとして提供し、ホスティングは自分で行います。

最適なAI音声エージェントプラットフォームはどれですか?

スタックのどこまでを自分で持ちたいかによります。Blandはモデル込みの1分単価です。VapiとRetellは各モデルを選べて、それぞれ別に課金されます。Synthflowは大企業のコンタクトセンター向けです。Cartesia Managed Agentsは自社の音声モデル(Ink 2とSonic 3.6)に好きなLLMを組み合わせて動かします。LiveKitとPipecatはエージェントを自分で書きたいチーム向けです。契約の前に、実際の通話を2つの候補で試してください。

AI音声エージェントの1分あたりの費用はいくらですか?

2026年10月3日に各社の料金ページで確認した数字は次のとおりです。Cartesiaは1分$0.06、ElevenLabsは$0.08+LLM、Blandはモデル込みで$0.12〜$0.14、Retellはモデル次第で$0.07〜$0.31、Vapiはホスティング$0.05+モデル原価。電話回線は多くの場合別料金で、1分あたり約1〜1.5セントです。料金は頻繁に変わるため、予算を組む前に各ページを確認してください。

プラットフォームを使うべきか、LiveKitやPipecatで作るべきか?

エージェントの仕事が標準的な通話フロー(応答、情報の照会、予約、転送)で、今週中に稼働させたいならプラットフォームを使いましょう。独自の音声処理、珍しいモデルの組み合わせ、端末内やネットワークから隔離された環境での運用、あるいは自社の通話量でプラットフォームより安い1分単価が必要なら、フレームワークで作るのが向いています。多くのチームはまずプラットフォームで始め、通話量の多いフローを後からフレームワークに移しています。

音声エージェントプラットフォームはどの音声モデルを使っていますか?

ほとんどのプラットフォームは他社のモデルを再販しています。VapiとRetellでは、CartesiaやElevenLabsの音声を含め、部品ごとにプロバイダーを選べます。Vapiは2024年にCartesiaをデフォルトの音声プロバイダーに選び、Retellは自社プラットフォーム上で次点のプロバイダーと比べてCartesiaの最初の音声までの時間が2〜3倍速いと報告しています。Cartesia Managed Agentsは、Cartesia自社の音声認識Ink 2と音声合成Sonic 3.6で動きます。