学ぶ

音声認識モデルの比較と選び方(2026年)

Rene 
音声認識モデルの比較と選び方(2026年)

音声認識モデルを比較するきっかけは、後続の処理で何かがうまくいかなかったことかもしれません。エージェントが別の日に予約した、電話番号の文字起こしを間違えた、バッチ処理の費用が製品自体の価値を上回った。この記事では、2026年に検討すべきモデルを用途ごとに整理し、それぞれの限界を説明します。

要点を先に述べると、音声エージェント用に英語のライブ音声を文字起こしするなら、Ink 2が最有力の出発点です。2026年6月時点で、Artificial Analysisのストリーミング音声認識ランキングの単語誤り率で首位に立ち、別のモデルなしでターン検出を行います。現時点の多言語ストリーミングでは、Deepgram Nova-3とAssemblyAIのUniversalモデルの方が対応言語が多くなっています。自分たちが管理するハードウェアで録音ファイルを文字起こしするなら、OpenAIのWhisper large-v3がオープンソースの定番です。順位は変わります。このページを含め、一つのページに頼らず最新のランキングを確認してください。

全体像:ストリーミングとバッチは別の仕事

最初に分けるべきなのはベンダーではなく、二つの処理方式です。

  • ストリーミング、つまりリアルタイム文字起こしは、話し手がまだ話している間にテキストを返します。音声エージェント、ライブ字幕、通話の振り分けに必要です。まだ一部しか聞いていない単語を確定するため、精度に加えて、遅延と、話し手が一つの考えを言い終えたかどうかを判断する能力も評価されます。
  • バッチ文字起こしは、録音全体を受け取ってから文字起こしを返します。ポッドキャストの後処理、議事録、コンプライアンス確認などが該当します。遅延の重要性は低く、精度と1時間あたりの費用が重視されます。

一方の用途向けに作られたモデルが、もう一方でも優れているとは限りません。Whisperが分かりやすい例です。公開モデルとしてはバッチ精度に優れていますが、ストリーミングには標準対応していません。両方を混ぜた一つのランキングで選ぶと、この違いを見落とします。以下では用途ごとに比較します。

音声認識モデルの評価方法

リアルタイム導入の多くでは、次の三つが判断を左右します。

  1. **精度、特に製品にとって重要な文字列の精度。**平均単語誤り率(WER)は、損害の大きい誤りを隠します。全体のWERが良好でも、確認コードやメールアドレスを間違えたり、発話された数値を気づかれないまま落としたりすることがあります。これこそ、エージェントの予約処理を壊す誤りです。単語誤り率の解説でも述べたように、WERは診断指標であり、最終判断ではありません。参照用の文字起こしに左右され、聞き手がどの誤りを許容するかは示さないためです。
  2. **ターン検出。**会話では、ユーザーが話し終えた時点を誰かが判断する必要があります。多くの構成では音声区間検出器と無音タイムアウトを追加しますが、この組み合わせは発話中の間を誤判定します。さらに、処理経路にモデルを追加するたびに遅延が増えます。発話終了の予測を内蔵するモデルなら、この追加処理をなくせます。
  3. **実環境での遅延。**ベンダーのページには、雑音のない音声での中央値が載っています。実際の音声には訛り、重なった発話、背景雑音があり、通話相手が体験するのはp95の遅延です。実際のトラフィックに近い録音で、最終的な文字起こしが出るまでの時間を測ってください。

第四の軸は価格です。正直な答えは地味です。分単価の差は1セントの数分の一程度で、頻繁に変わり、顧客の発話を聞き違えないモデルを選ぶことほど重要ではありません。読む時点での最新料金を確認してください。

比較すべきモデル

2026年に音声認識の候補を絞る開発者が検討するモデルを紹介します。各主張はベンダー自身の資料か独立したランキングに基づき、出典の種類を明示しています。

Cartesia Ink 2:音声エージェント向けの英語ストリーミング

Ink 2はリアルタイムエージェント向けのストリーミングモデルで、私たちが開発しているモデルです。公開時の記事と、2026年6月時点で単語誤り率の首位だったArtificial Analysisのストリーミングランキングに基づく強みは次の通りです。

  • 本番音声での精度。電話回線の録音、さまざまな訛り、雑音環境、決算説明会で、これらの試験ではDeepgram Flux、Soniox RT-V4、AssemblyAIのリアルタイムモデル、ElevenLabs Scribe-2-realtimeを上回っています。電話番号、メール、UUID、日付などの構造化されたエンティティは、列全体を受け取ってから確定します。
  • ターン検出を内蔵。発話終了の予測がモデルに含まれるため、Sileroや別のターン制御サービスを動かす必要がありません。Pipecatの処理構成では、Inkの早期ターン終了予測によって、ユーザーのターンが正式に終了する前にエージェントが応答を開始でき、応答時間が約0.5秒短縮されました。
  • 前処理フィルターなしの雑音耐性。Krispのような処理段階と、その費用や遅延を構成から除けます。

現時点の制約として、Ink 2の文字起こしは英語のみで、多言語モデルはプレビュー段階です。現在スペイン語やヒンディー語の通話を扱うなら、以下の多言語対応モデルを選び、後で再検討してください。Cartesiaはクラウド、オンプレミス、ネットワークから隔離した環境での導入に対応しており、PlaygroundでInkを無料で試せます。

OpenAI Whisper large-v3:オープンソースのバッチ処理の定番

Whisperは自社GPUでのバッチ文字起こしの基準となるモデルです。公開ウェイト、約99言語、明瞭な音声での良好な精度、ベンダーへの依存がないことが特徴です。プライバシーや費用を重視する処理で、チームが自ら運用しています。

弱点は、このページの主題にある用途です。Whisperはバッチ専用で、標準のストリーミングもターン検出もなく、無音や非音声の区間で存在しないフレーズを生成することが知られています。AssemblyAIの解説が注意点として挙げる問題で、Whisperを包むストリーミング処理もこれを引き継ぎます。音声を分割して流す方式では約500ミリ秒の遅延が加わり、発話終了の判定も自分たちで担います。Whisperはファイルに使ってください。リアルタイムエージェントの耳には使わないでください。

Deepgram Nova-3:大規模な多言語ストリーミング

DeepgramのNova-3は、多言語導入で実績のあるストリーミングAPIです。ベンダー公表のストリーミング遅延は300ミリ秒未満で、10言語間のリアルタイムなコードスイッチングと分野別のカスタマイズに対応します。Nova-3の公開記事では、ストリーミング音声でのWER中央値を6.84%としています。これはベンダーの数値で、独立した指標ではより高い値になっています。自分で再現するまでは、ベンダーの数値をマーケティング資料として読むべき理由です。Deepgramは、音声エージェント向けに発話終了検出を加えたFluxも提供しています。従来のSTTだけではターン制御を解決できないことを認めたモデルです。

今すぐ多くの言語を本番で扱う必要があり、別のターン検出層やFluxの併用を受け入れられるなら、Nova-3を選びます。

AssemblyAI Universal:音声分析をまとめたストリーミング

AssemblyAIのUniversalシリーズは、ストリーミング文字起こし、要約、エンティティ検出、感情分析、個人情報のマスキングを一つのAPIで提供します。リアルタイムモデルは音声エージェントの評価でも直接競合しています。同社の資料では、英語音声エージェントのベンチマークでUniversal-3.6 Pro RealtimeのWERが5.19%となり、同じ試験のScribe v2とNova-3を上回っています。ベンダー自身の試験である点は踏まえる必要がありますが、文字起こしと音声分析を一社にまとめるという立ち位置は明確です。文字起こしをエージェントだけでなく分析にも使うなら、有力な候補です。

Google Chirp 3:すでにGoogle Cloudを使うチーム向け

GoogleのChirp 3は、幅広い言語対応と、多くのチームがすでに利用するクラウド内で運用を完結できる手軽さを備えたマネージドサービスです。英語ストリーミングの独立した精度ランキングで首位に立つことは多くありませんが、既存契約、コンプライアンス要件、請求の一本化といった調達の現実が、実際の導入を支えています。

Ink対Whisper:オープンソースの定番が不利になる用途

よくある比較はCartesia InkとOpenAI Whisperなので、個別に答える価値があります。表面上はどちらのモデルが優れているかという質問ですが、本当の問いは、どの仕事をさせたいかです。

ファイル、多くの言語、自社GPUがあるならWhisperが有利です。録音済み通話、ポッドキャスト、アーカイブを、ベンダーへの分単位の支払いなしで安く大量に処理できます。

ライブの会話ならInkが有利です。ユーザーが話している間に出力し、単語をより早く確定し、別のモデルなしで発話終了を予測します。数値、ID、訛りのある発話でも精度を保ちます。これらは予約ミスにつながる誤りです。Whisperにストリーミングのラッパーを付けると、分割処理、発話終了判定、無音時のハルシネーションを自ら管理し、その代償を往復遅延として払うことになります。

判断に迷う場合の基準があります。現在の構成にSilero、Krisp、再試行でつなぎ合わせた無音タイムアウトの状態機械が入っているなら、それはバッチモデルをストリーミング用途に使うための補完です。ストリーミング向けのモデルなら、その仕組みを置き換えられます。

どの音声認識モデルを選ぶべきか

用途に合わせて選びます。

用途最初の候補
英語のライブ音声エージェントInk 2
多言語のライブ文字起こしDeepgram Nova-3、AssemblyAI Universal realtime
自社運用でのファイルのバッチ処理Whisper large-v3
一つのAPIで文字起こしと分析AssemblyAI Universal
既存のクラウド契約を維持Google Chirp 3

決定する前に、自分たちの音声でテストしてください。このページの数値はすべて他者の録音から得られたものです。重要なのは実際のトラフィックでの順位です。訛り、発話の重なり、確認コードを一文字ずつ読み上げる相手など、難しい通話を二つか三つの最終候補に通してください。製品が許容できない誤りも含め、返ってくる結果を比べます。

英語の音声エージェントが目的なら、設定不要でPlaygroundのInk 2を試すか、音声エージェントの作り方を読み、全体の処理の中で文字起こしが担う役割を確認してください。

関連ドキュメント

よくある質問

最も優れた音声認識モデルは何ですか?

用途によって異なります。音声エージェント向けの英語ストリーミングでは、Ink 2が2026年6月時点でArtificial Analysisのストリーミングランキングの単語誤り率で首位に立ち、ターン検出も内蔵しています。多言語ストリーミングでは、現時点でDeepgram Nova-3とAssemblyAIのUniversalモデルがより多くの言語に対応しています。自社ハードウェアでのバッチ文字起こしなら、Whisper large-v3がオープンソースの定番です。このページを含め、単一のページをうのみにせず、最新のランキングを確認してください。

Whisperはリアルタイムで文字起こしできますか?

標準ではできません。Whisperはバッチモデルで、音声セグメント全体を受け取ってからテキストを返します。音声を分割し、発話終了の判定を独自に実装してストリーミング用のラッパーを作るチームもありますが、遅延や障害の要因が増えます。ライブ文字起こしが必要なら、Cartesia Ink、Deepgram Nova-3、AssemblyAIのリアルタイムモデルなど、ストリーミング向けに設計されたモデルを使う方が簡単です。

単語誤り率とは何ですか?WERは低いほどよいのでしょうか?

単語誤り率(WER)は、参照用の文字起こしと比較して、モデルが誤って文字起こしした単語の割合です。有用な診断指標ですが、総合評価ではありません。表記形式の違いにもペナルティがつき、参照を採点したASRモデルにも左右されます。同じWERでも、一方が数値やIDを落とすなら、実際の使い勝手は大きく異なります。自分たちの音声で評価し、アプリケーションが許容できない誤りを重く扱ってください。

数値やIDを最も正確に認識する音声認識モデルはどれですか?

平均WERだけでなく、エンティティ単位の評価を確認してください。電話番号、メールアドレス、英数字列、日付では、普通の単語とは異なる誤りが起きます。途中に現れるエンティティの処理が得意なモデルもあります。例えばInk 2は、文字列全体を受け取ってから確定します。どのモデルを選ぶ場合も、注文ID、確認コード、住所など、製品が実際に聞き取る文字列でテストしてください。

Ink 2の料金はいくらですか?

Ink 2は音声の分数に応じた料金で、利用量に応じた割引やエンタープライズ契約の個別料金があります。最新の料金はCartesiaの料金ページに掲載されています。CartesiaのPlaygroundでは無料でモデルを試せます。