「音声AI」は、音声モデルの提供、モデルをエージェントに組み合わせるプラットフォーム、クラウド音声サービス、オープンソースという4つの事業を指す言葉になりました。このガイドでは2026年後半の各社の位置づけを整理します。十数社を試す代わりに、用途に合う2、3社に絞るための資料です。
私たち自身もこの一覧に含まれる企業です。その立場を明示したうえで、重要な主張には、読者が確認できるランキングや製品ページへのリンクを付けています。
音声モデルの提供企業
これらの企業は自社で音声モデルを学習し、APIで提供しています。製品に音声を組み込む場合に利用する層です。
Cartesiaは私たちの会社です。創業チームがStanford AI Labで先駆けて研究したState Space Modelアーキテクチャを使い、リアルタイム音声モデルを開発しています。テキスト読み上げモデルのSonicは、音声を生成しながらストリーミングします。モデルのレイテンシーは90ms未満、対応言語は40以上で、VoiceArenaとArtificial Analysisのブラインド聴取テストで1位です。Inkはターン検出を内蔵したストリーミング音声認識モデル、Managed Agentsは本番用音声エージェントの構築ツールです。Decagon、ServiceNow、Quora、Retell、EliseAIがこのプラットフォームを利用しています。導入事例と料金をご覧ください。
ElevenLabsは、この分野で消費者向けに最も知られたブランドです。音声ライブラリ、音声クローン、吹き替え、クリエイター向けスタジオを提供しています。現在のホームページでは音声エージェントも前面に出しています。強みはクリエイティブ制作です。リアルタイムのエージェント用途では初回音声応答時間を直接比較してください。ElevenLabsとの比較では、プラットフォームの違いを解説しています。
Deepgramは企業向けに音声認識とテキスト読み上げのAPIを提供しています。大量の音声を高速に文字起こしする点で評価されています。TTSはSTTとは別に評価してください。
PlayHTは長年TTS APIを提供してきました。2026年9月24日に確認した際はサイトを読み込めませんでした。採用前に、サービスが稼働していてサポートを受けられるか確認してください。
Speechifyは、文書を音声で聞くための読み上げアシスタントとして知られています。同社によると利用者は6,000万人以上です。スタジオとAPIは、読み上げアプリとは別製品です。
Murf AIとWellSaid Labsはいずれもナレーション制作向けです。Murfはスクリプトからナレーションを作るエディターを提供し、現在は対話型エージェントも訴求しています。WellSaidは企業のナレーション制作ワークフローに重点を置いています。
音声エージェントプラットフォーム
これらの企業の多くは、音声モデル自体の学習を行いません。音声認識、言語モデル、音声合成を組み合わせて電話やアプリのエージェントを作ります。提供するのは、電話接続、処理の連携、可観測性といった基盤です。
Vapiは、特定の事業者に依存しない部品を組み合わせて音声エージェントを作る開発者向けプラットフォームです。Retell AIは本番用の音声エージェントを構築し、Cartesiaの音声を採用しています。Bland AIは大量の発信と着信に対応するエージェントに注力しています。LiveKitは、多くの音声製品を支えるWebRTCを含むリアルタイム音声・映像基盤を提供しています。
パイプラインを自分で組まずにエージェントを作りたいなら、この分類から検討してください。モデルそのものを制御する必要があるなら、上のモデル提供企業を利用し、自分で接続します。
クラウド音声サービス
Google CloudのSpeech-to-TextとText-to-Speech、Microsoft Azure AI Speech、Amazon Pollyは、既存の主要な音声サービスです。広い顧客基盤、充実したコンプライアンス対応ツール、長い実績を持っています。一方、音声品質と会話のレイテンシーでは、スタートアップが先行してきました。すでに特定のクラウドを使っている組織にとっては、導入しやすい選択肢です。
OpenAIは、音声間の対話セッション用Realtime APIなどを通じて音声を提供しています。同社のモデルはChatGPTの音声モードにも使われています。
オープンソース
Fish Audioはホステッドのプラットフォームに加え、重みを公開した音声モデルFish Speechを提供しています。Whisperは引き続きオープンな音声認識モデルの定番で、PiperやF5-TTSなどはセルフホスト型のテキスト読み上げを担っています。オープンソースでは制御権とデータの配置場所を選べますが、基盤の運用は自分で行う必要があります。レイテンシーと音声品質は構成によって大きく変わります。
選び方
ランキングより先に、用途と事業者を合わせてください。リアルタイムエージェントには、ストリーミング対応のエンドポイントと短い初回音声応答時間が必要です。自分たちのスクリプトを使い、実際のデプロイ先リージョンとネットワーク経路でテストします。録音ナレーションでは、90ミリ秒より編集ワークフローと商用利用権のほうが重要です。
次に、実際の条件で比べます。口座番号、略語、途中で遮られる応答も含め、両システムに同じスクリプトを使ってください。音声エージェントのガイドにエージェント用途の評価項目を、比較ページに各競合との比較をまとめています。
もう1本比較記事を読む前に、1位のTTSを聞いてみたい方は、音声ジェネレーターをお試しください。登録なしで、ブラウザーからSonicを使えます。