有用なTTS APIの比較は、アプリが呼び出すエンドポイントから始まります。モデル系列の名前だけでは、正確なモデル、ホストの構成、地域、声、測定方法がわかりません。ランキングの各行で、それらが異なる可能性があります。
CovalのQwen3 TTSの項目は、この問題を示しています。系列名は同じでも、公開された説明だけでは、同じ重みを他も同じ条件で動かした実験だとは言えません。実践ではサービス全体を比較し、証拠の限界を見える形で残すことが大切です。
Qwen3 TTSの項目は実際に何を比較しているか
以下は、2026年9月15日にCovalのTTSランキングで一緒に表示されていた、30日間の平均TTFAです。リンク先にホストとライセンスの情報があります。別々のエンドポイントの測定であり、同一のシステムを条件をそろえて試したものではありません。
- NariがホストするQwen3 TTS Fastは、平均TTFAが71msです。オープンウェイト、米国での共有推論と記載されています。
- BasetenがホストするQwen3 TTS 1.7bは106msです。オープンウェイト、米国での専用推論と記載されています。
- Alibaba CloudがホストするQwen3 TTS Flash Realtimeは751msです。アジアにある独自モデルの公式APIと記載されています。
この違いは、レイテンシと同じくらい重要です。専用と共有ではホストの構成が異なります。Alibabaの項目は、地域も異なる独自のエンドポイントです。三つを「同じ重み」と呼ぶには、名前以外の証拠が必要です。
これらの値は候補を絞るのに役立ちますが、差のどれだけがモデル、通信経路、ハードウェア、スケジューリング、その他の実装に由来するかを切り分けません。大差があっても、測定したサービスについての観察であり、原因を統制して説明するものではありません。
比較にはどのレイテンシを使うべきか
最初の音声データの到着と、最初に聞こえる発話は別の時点です。最初のチャンクが無音で始まることもあります。Covalの公開された測定方法は、最初のチャンクの到着までと、聞こえる出力までの冒頭の無音を両方使ってTTFAを定義しています。数値とともに、この定義も記録しましょう。
統計量の種類も保つ必要があります。平均、中央値、p95は異なる問いに答えます。遅い応答が購入判断を左右するなら、低い平均だけでは決められません。測定期間とサンプル数を記録し、後から何の結果か理解できるようにします。
アプリのテストでは、開始と終了を明確に定義します。たとえば、テキストを送信してから、クライアントで最初に聞こえるサンプルを再生するまでを測ります。接続確立は別に測り、既存の接続を再利用したかも記録します。各行で「レイテンシ」の意味が変わらず、自分の導入に役立つ比較になります。
音声の品質をどう比較するか
CovalはTTSの単語誤り率も報告しています。WERベンチマークは、生成音声の文字起こしの誤りを測ります。聞き取りやすさの参考になりますが、完全な試聴評価ではありません。
実際にアプリが話す文から、小さなテストセットをつくりましょう。名前、日付、金額、略語、言語や発音の境界をまたぐ文を含めます。語の抜けや誤った発音を聴き取り、ペース、強調、やり取りに合う声かどうかは別に評価します。
これらの判断は速度と分けます。すぐ話し始めても、支払い通知の金額を誤って読めば、その用途には不適切です。逆に、返答前の遅れを無視した品質評価は、会話体験の一部を落としています。結果を見る前に、どの誤りなら候補から除外するか決めてください。
本番に役立つ比較にするには
ランキングで扱える数の候補に絞り、すべてに同じアプリレベルのテストを行います。APIが許す範囲で、入力文と出力形式をそろえてください。モデルの正確な識別子、声、地域、同時実行数、取り除けない設定差を記録します。
通常のトラフィックと、想定する最大負荷で試します。成功した要求だけで速い平均を計算せず、失敗と再生の中断も追跡してください。生の観測結果を残し、後のモデル更新や設定変更を同じ基準と比べられるようにします。
Cartesiaを候補にするなら、Sonic 3.6のドキュメントに、sonic-3.6の別名は安定版の更新に追従し、日付付きIDは固定されることが説明されています。再現可能な基準が必要なら日付付き版を固定します。まずPlaygroundで自分の文章を聴き、その後、公開予定のクライアントでAPIを評価してください。試聴は声の選択を助けますが、導入テストの代わりにはなりません。
自己ホストは別の運用判断として扱います。モデルの推論に加え、ハードウェア容量、導入作業、監視、保守を比較に含めてください。魅力的なレイテンシだけでは、自社で運用すべきかは決まりません。
最適なのは、記録した負荷条件で、レイテンシと音声品質の要件を満たすエンドポイントです。共通の系列名は候補を整理する助けになります。最終判断の証拠は、実際に導入するサービスから得られます。