CovalのストリーミングSTTベンチマークが役立つのは、会話型製品の実際の動作を支える推論基盤に目を向けられるからです。モデルの重みだけを比べると、ユーザーが強く感じる遅れの原因を見落とします。導入経路、地域、モデルの前に置くエンドポイントです。
CovalのストリーミングSTTベンチマークが測るもの
2026年9月14日に確認したCovalのWERページには、直近30日間の30のSTTモデルと28のTTSモデルが掲載されています。STTの表は単語誤り率と文字起こしのレイテンシ、サンプル数を示します。数万件のサンプルがある項目も、はるかに少ない項目もあります。順位を読む際には、この差が重要です。CovalのWERランキング
ページには、最終セグメントまでの時間、最初のトークンまでの時間、最終文字起こしまでの時間など、複数のレイテンシが表示されます。ライブ字幕では最終文字起こしの速さ、音声エージェントでは安全に再び話し始められる時点が重要になるなど、製品ごとに注目する瞬間が違うため有用です。Covalのベンチマーク概要 CovalのWERランキング
Covalは固定した地域から公開ベンチマークを実行します。すべてのモデルに同じ場所から要求するため比較しやすい一方、その値は各ユーザーの都市やネットワークから体験するレイテンシとは異なります。Covalのベンチマーク概要
ランキングが推論の経路全体を測ることを理解する必要があります。共有エンドポイントや配置の悪い導入先を使えば、その負担も数値に含まれます。評価対象には重みと、音声がモデルに届いて戻るまでの経路が含まれています。CovalのWERランキング Covalのベンチマーク概要
BasetenのSTTランキング上の位置
9月14日に確認したCovalの表では、BasetenのQwen3 ASR 1.7bエンドポイントは、1,192サンプルでTTFSが39ms、WERが3.9%でした。Covalのテスト条件における、そのエンドポイントの測定値です。CovalのWERランキング
Basetenの記事は、OpenAIの約5倍の速さと説明しています。Covalの各行を見ると、より正確に比較できます。OpenAIの項目でもTTFSは一律ではなく、どのエンドポイントと比べるかで正確な比率が変わるためです。Basetenのベンチマーク記事 CovalのWERランキング
Basetenの9月9日の記事は、早期アクセスの結果をOpenAIの約5倍の速さと述べています。特定の比較対象と日付を持つベンダーの主張として扱ってください。購入判断に使う前に、双方のモデル、エンドポイント、測定日、レイテンシの定義を確認します。Basetenのベンチマーク記事 CovalのWERランキング
専用推論と導入構成が差を生む仕組み
Covalは専用推論と共有推論を区別して示します。多くのモデル比較図で省かれる部分ですが、重みを変えずにパレート図上の配置を左に動かせる要因でもあります。CovalのWERランキング
Basetenの記事は、専用推論と調整したオートスケーリングを結果の要因に挙げています。本番システムの挙動とも一致します。容量の予約は同居する処理の影響によるばらつきを減らし、配置の改善はモデルが動き始める前の通信時間を減らします。Basetenのベンチマーク記事
共有エンドポイントはデモで問題がなくても、本番では使いにくくなることがあります。負荷がかかると、中央値と同じくらいレイテンシの安定性が大切だからです。p95が遅くなったり、p25〜p75の幅が広がったりすると、ユーザーは応答のためらいを感じます。Basetenのベンチマーク記事 CovalのWERランキング
近接配置が重要なのはそのためです。推論をユーザーの近くに置くと往復時間が短くなります。モデル自体が変わらなくても、会話型製品ではその差が表れます。Covalのベンチマーク概要
ベンチマークが統制する条件と、製品判断の落とし穴
Covalの固定地域と実行環境は、ノイズの一つを取り除く良い方法です。再現性を高めますが、ベンチマークの公平さと製品の実態を混同しやすくもなります。両者は別のものです。Covalのベンチマーク概要
同じ理由でサンプル数も重要です。Covalは各行に件数を表示します。大きいものも小さいものもあり、推定値が数万の発話に支えられているかどうかがわかります。CovalのWERランキング
推論の構成を無視したベンダー比較が誤解を招く理由の一つです。実験室で簡単にホストできるモデルも、処理の連携、オートスケーリング、通話者とサーバーの間のネットワークが加われば、高価になったり不安定になったりします。Basetenのベンチマーク記事 Covalのベンチマーク概要
測定方法はランキング間の比較にも影響します。TTFS、TTFT、最終文字起こしまでの時間は交換可能ではありません。同じ意味で読むと、違う問いに答える数値を比較することになります。CovalのWERランキング
低レイテンシ、低WERのSTTパイプラインを構築する:Cartesia Ink-2の例
音声エージェントの応答を速くするには、ターン交代を想定したSTTモデルから始めます。CartesiaのInk-2には、設定可能なターン検出とキータームプロンプトがあります。ユーザーが話し終えたと判断する時点を調整し、出現する名前や専門用語も知らせられます。Cartesia Ink-2のドキュメント
発話終端の判定も応答性の一部です。確定まで長く待つと後続の処理が止まり、早すぎるとユーザーを遮ります。調整すべきなのは、制御できるターン検出器です。Cartesia Ink-2のドキュメント LiveKit Agents
同じモデルでも、導入構成によって結果が変わります。Covalは専用推論と共有構成を分けて示し、Basetenの記事も提供側から同じ傾向を説明しています。重みを変えなくても、導入の選択でレイテンシは変わります。CovalのInk-2の項目 Basetenのベンチマーク記事
最初の部分文字起こしより最終結果の精度が大切なら、意味に基づく確定を優先します。先に話す必要がある製品では、速い部分結果が有利な場合があります。ただし、会話の間を短くする代わりに、文字起こしのリスクを増やす選択になります。Artificial Analysis AA-WER Streaming
Artificial Analysisの2026年6月1日の報告では、意味に基づく終端判定を使ったInk-2は、WERが3.59%、発話終了の検出後に最初の確定文字起こしが届くまでが0.21秒でした。同じモデルでも、データセット、終端設定、時間の定義が異なれば結果も変わります。Artificial Analysis AA-WER Streaming CovalのInk-2の項目
モデルを替える前に試す価値があるもう一つの調整は、キータームプロンプトです。商品名や社内用語を誤認識する場合、出現する語をSTTに知らせる方が、提供元の変更より安く、問題に直接対処できることが多いためです。Cartesia Ink-2のドキュメント
本番の調整ではフレームワークの対応も重要です。LiveKit Agentsには提供元の設定を渡す仕組みがあります。ターン検出とキータームの設定をそこに置くことで、実際に出荷する通話経路にモデルを組み込めます。LiveKit Agents
速さと精度のトレードオフ
Artificial Analysisの2026年6月1日の結果では、Deepgram FluxはWERが7.36%、発話終了検出後の最初の確定文字起こしまでが0.020秒でした。意味に基づく終端判定のInk-2は、同じ指標で3.59%と0.21秒です。Fluxの確定結果は早く、Ink-2の文字起こし誤りは少ないという結果でした。対象は試験した構成とデータセットです。Artificial Analysis AA-WER Streaming
ストリーミングSTTベンチマークはこのように読みます。抽象的な意味での「最良」を決めるものではありません。速さで勝っても、通話の誤転送や商品名の取り違えなど、実際のエージェントで重要な誤りでは負ける可能性があります。CovalのWERランキング Artificial Analysis AA-WER Streaming
末尾側のレイテンシは、普段は良いシステムを不快に変えます。中央値が低くてもp95やp99が大きければ、ユーザーは時折、エージェントが迷っているような沈黙を待つことになります。CovalのWERランキング
配置、エンドポイントの容量、ターン検出、キータームプロンプトを個別に試してください。組み合わせる前に、それぞれの変更が誤りとレイテンシに与える影響を記録します。どの変更がアプリを改善したかの証拠になります。Basetenのベンチマーク記事 Cartesia Ink-2のドキュメント
提供元を選ぶ前に自分の構成で測ること
大切なのは自分の経路で測った値です。STTでは、実際の電話回線やWebRTC条件の下で、発話終了を検出してから最終セグメントが届くまでを測ります。本番のネットワークを通らない実験用経路だけでは不十分です。Covalのベンチマーク概要
中央値に加え、パーセンタイルも必要です。p50が良くてもp95とp99が離れていれば、時には速く、時にはぎこちなく聞こえます。少し遅くても安定したシステムより悪い体験になりがちです。CovalのWERランキング
アプリが対応すべき訛り、背景雑音、分野固有の語彙を含む、本番を代表する音声を再生します。開発時の録音だけに最適化しないよう、評価用の別セットを確保してください。
公開ランキングで候補を絞り、その後は自分の地域、同時実行数、構成で実行します。ユーザーが聞くものを決める前に、実際の条件で確認してください。Covalのベンチマーク概要 Basetenのベンチマーク記事
少数の候補エンドポイントと固定した評価コーパスから始めます。想定する同時実行数で、文字起こしの誤り、確定の遅れ、発話終了から最初の音声までの時間を記録します。アプリの誤りと応答時間の目標を満たす構成を選び、モデルや導入構成が変わったら再試験してください。