音声認識モデルを比較するきっかけは、後続の処理で何かがうまくいかなかったことかもしれません。エージェントが別の日に予約した、電話番号の文字起こしを間違えた、バッチ処理の費用が製品自体の価値を上回った。この記事では、2026年に検討すべきモデルを用途ごとに整理し、それぞれの限界を説明します。
要点を先に述べると、音声エージェント用に英語のライブ音声を文字起こしするなら、Ink 2が最有力の出発点です。2026年6月時点で、Artificial Analysisのストリーミング音声認識ランキングの単語誤り率で首位に立ち、別のモデルなしでターン検出を行います。現時点の多言語ストリーミングでは、Deepgram Nova-3とAssemblyAIのUniversalモデルの方が対応言語が多くなっています。自分たちが管理するハードウェアで録音ファイルを文字起こしするなら、OpenAIのWhisper large-v3がオープンソースの定番です。順位は変わります。このページを含め、一つのページに頼らず最新のランキングを確認してください。
全体像:ストリーミングとバッチは別の仕事
最初に分けるべきなのはベンダーではなく、二つの処理方式です。
- ストリーミング、つまりリアルタイム文字起こしは、話し手がまだ話している間にテキストを返します。音声エージェント、ライブ字幕、通話の振り分けに必要です。まだ一部しか聞いていない単語を確定するため、精度に加えて、遅延と、話し手が一つの考えを言い終えたかどうかを判断する能力も評価されます。
- バッチ文字起こしは、録音全体を受け取ってから文字起こしを返します。ポッドキャストの後処理、議事録、コンプライアンス確認などが該当します。遅延の重要性は低く、精度と1時間あたりの費用が重視されます。
一方の用途向けに作られたモデルが、もう一方でも優れているとは限りません。Whisperが分かりやすい例です。公開モデルとしてはバッチ精度に優れていますが、ストリーミングには標準対応していません。両方を混ぜた一つのランキングで選ぶと、この違いを見落とします。以下では用途ごとに比較します。
音声認識モデルの評価方法
リアルタイム導入の多くでは、次の三つが判断を左右します。
- **精度、特に製品にとって重要な文字列の精度。**平均単語誤り率(WER)は、損害の大きい誤りを隠します。全体のWERが良好でも、確認コードやメールアドレスを間違えたり、発話された数値を気づかれないまま落としたりすることがあります。これこそ、エージェントの予約処理を壊す誤りです。単語誤り率の解説でも述べたように、WERは診断指標であり、最終判断ではありません。参照用の文字起こしに左右され、聞き手がどの誤りを許容するかは示さないためです。
- **ターン検出。**会話では、ユーザーが話し終えた時点を誰かが判断する必要があります。多くの構成では音声区間検出器と無音タイムアウトを追加しますが、この組み合わせは発話中の間を誤判定します。さらに、処理経路にモデルを追加するたびに遅延が増えます。発話終了の予測を内蔵するモデルなら、この追加処理をなくせます。
- **実環境での遅延。**ベンダーのページには、雑音のない音声での中央値が載っています。実際の音声には訛り、重なった発話、背景雑音があり、通話相手が体験するのはp95の遅延です。実際のトラフィックに近い録音で、最終的な文字起こしが出るまでの時間を測ってください。
第四の軸は価格です。正直な答えは地味です。分単価の差は1セントの数分の一程度で、頻繁に変わり、顧客の発話を聞き違えないモデルを選ぶことほど重要ではありません。読む時点での最新料金を確認してください。
比較すべきモデル
2026年に音声認識の候補を絞る開発者が検討するモデルを紹介します。各主張はベンダー自身の資料か独立したランキングに基づき、出典の種類を明示しています。
Cartesia Ink 2:音声エージェント向けの英語ストリーミング
Ink 2はリアルタイムエージェント向けのストリーミングモデルで、私たちが開発しているモデルです。公開時の記事と、2026年6月時点で単語誤り率の首位だったArtificial Analysisのストリーミングランキングに基づく強みは次の通りです。
- 本番音声での精度。電話回線の録音、さまざまな訛り、雑音環境、決算説明会で、これらの試験ではDeepgram Flux、Soniox RT-V4、AssemblyAIのリアルタイムモデル、ElevenLabs Scribe-2-realtimeを上回っています。電話番号、メール、UUID、日付などの構造化されたエンティティは、列全体を受け取ってから確定します。
- ターン検出を内蔵。発話終了の予測がモデルに含まれるため、Sileroや別のターン制御サービスを動かす必要がありません。Pipecatの処理構成では、Inkの早期ターン終了予測によって、ユーザーのターンが正式に終了する前にエージェントが応答を開始でき、応答時間が約0.5秒短縮されました。
- 前処理フィルターなしの雑音耐性。Krispのような処理段階と、その費用や遅延を構成から除けます。
現時点の制約として、Ink 2の文字起こしは英語のみで、多言語モデルはプレビュー段階です。現在スペイン語やヒンディー語の通話を扱うなら、以下の多言語対応モデルを選び、後で再検討してください。Cartesiaはクラウド、オンプレミス、ネットワークから隔離した環境での導入に対応しており、PlaygroundでInkを無料で試せます。
OpenAI Whisper large-v3:オープンソースのバッチ処理の定番
Whisperは自社GPUでのバッチ文字起こしの基準となるモデルです。公開ウェイト、約99言語、明瞭な音声での良好な精度、ベンダーへの依存がないことが特徴です。プライバシーや費用を重視する処理で、チームが自ら運用しています。
弱点は、このページの主題にある用途です。Whisperはバッチ専用で、標準のストリーミングもターン検出もなく、無音や非音声の区間で存在しないフレーズを生成することが知られています。AssemblyAIの解説が注意点として挙げる問題で、Whisperを包むストリーミング処理もこれを引き継ぎます。音声を分割して流す方式では約500ミリ秒の遅延が加わり、発話終了の判定も自分たちで担います。Whisperはファイルに使ってください。リアルタイムエージェントの耳には使わないでください。
Deepgram Nova-3:大規模な多言語ストリーミング
DeepgramのNova-3は、多言語導入で実績のあるストリーミングAPIです。ベンダー公表のストリーミング遅延は300ミリ秒未満で、10言語間のリアルタイムなコードスイッチングと分野別のカスタマイズに対応します。Nova-3の公開記事では、ストリーミング音声でのWER中央値を6.84%としています。これはベンダーの数値で、独立した指標ではより高い値になっています。自分で再現するまでは、ベンダーの数値をマーケティング資料として読むべき理由です。Deepgramは、音声エージェント向けに発話終了検出を加えたFluxも提供しています。従来のSTTだけではターン制御を解決できないことを認めたモデルです。
今すぐ多くの言語を本番で扱う必要があり、別のターン検出層やFluxの併用を受け入れられるなら、Nova-3を選びます。
AssemblyAI Universal:音声分析をまとめたストリーミング
AssemblyAIのUniversalシリーズは、ストリーミング文字起こし、要約、エンティティ検出、感情分析、個人情報のマスキングを一つのAPIで提供します。リアルタイムモデルは音声エージェントの評価でも直接競合しています。同社の資料では、英語音声エージェントのベンチマークでUniversal-3.6 Pro RealtimeのWERが5.19%となり、同じ試験のScribe v2とNova-3を上回っています。ベンダー自身の試験である点は踏まえる必要がありますが、文字起こしと音声分析を一社にまとめるという立ち位置は明確です。文字起こしをエージェントだけでなく分析にも使うなら、有力な候補です。
Google Chirp 3:すでにGoogle Cloudを使うチーム向け
GoogleのChirp 3は、幅広い言語対応と、多くのチームがすでに利用するクラウド内で運用を完結できる手軽さを備えたマネージドサービスです。英語ストリーミングの独立した精度ランキングで首位に立つことは多くありませんが、既存契約、コンプライアンス要件、請求の一本化といった調達の現実が、実際の導入を支えています。
Ink対Whisper:オープンソースの定番が不利になる用途
よくある比較はCartesia InkとOpenAI Whisperなので、個別に答える価値があります。表面上はどちらのモデルが優れているかという質問ですが、本当の問いは、どの仕事をさせたいかです。
ファイル、多くの言語、自社GPUがあるならWhisperが有利です。録音済み通話、ポッドキャスト、アーカイブを、ベンダーへの分単位の支払いなしで安く大量に処理できます。
ライブの会話ならInkが有利です。ユーザーが話している間に出力し、単語をより早く確定し、別のモデルなしで発話終了を予測します。数値、ID、訛りのある発話でも精度を保ちます。これらは予約ミスにつながる誤りです。Whisperにストリーミングのラッパーを付けると、分割処理、発話終了判定、無音時のハルシネーションを自ら管理し、その代償を往復遅延として払うことになります。
判断に迷う場合の基準があります。現在の構成にSilero、Krisp、再試行でつなぎ合わせた無音タイムアウトの状態機械が入っているなら、それはバッチモデルをストリーミング用途に使うための補完です。ストリーミング向けのモデルなら、その仕組みを置き換えられます。
どの音声認識モデルを選ぶべきか
用途に合わせて選びます。
| 用途 | 最初の候補 |
|---|---|
| 英語のライブ音声エージェント | Ink 2 |
| 多言語のライブ文字起こし | Deepgram Nova-3、AssemblyAI Universal realtime |
| 自社運用でのファイルのバッチ処理 | Whisper large-v3 |
| 一つのAPIで文字起こしと分析 | AssemblyAI Universal |
| 既存のクラウド契約を維持 | Google Chirp 3 |
決定する前に、自分たちの音声でテストしてください。このページの数値はすべて他者の録音から得られたものです。重要なのは実際のトラフィックでの順位です。訛り、発話の重なり、確認コードを一文字ずつ読み上げる相手など、難しい通話を二つか三つの最終候補に通してください。製品が許容できない誤りも含め、返ってくる結果を比べます。
英語の音声エージェントが目的なら、設定不要でPlaygroundのInk 2を試すか、音声エージェントの作り方を読み、全体の処理の中で文字起こしが担う役割を確認してください。
関連ドキュメント
- Ink 2の公開記事:順位の根拠となる精度、ターン検出、遅延の結果
- 単語誤り率の解説:WERが最終判断ではなく診断指標である理由
- 音声エージェント向けの音声区間検出:無音に基づく発話終了判定が失敗する理由
- PipecatとCartesiaで音声エージェントを作る:Inkの早期ターン終了を使うストリーミング構成
- Artificial Analysisのストリーミング音声認識ランキング:各ベンダーの最新順位