導入事例

Spekoの音声AIベンチマークで、Sonic 3.5が最も多く推奨されるモデルに

Spekoは音声AIのルーターです。開発者は一つのSpeko APIを通じて音声エージェントを構築、運用します。Spekoは各通話の言語と用途に応じて、音声認識、LLM、テキスト読み上げのモデルを選びます。その選択の根拠となるのは、約12社のプロバイダーを対象に2〜3日ごとに再実施するベンチマークです。テキスト読み上げで最も頻繁に首位に立つのが、CartesiaのSonic 3.5です。

私たちがつくっているのは、いわば音声AIのオープンルーターです。適切なモデル構成を選ぶ手助けをする、中立的な層になろうとしています。

Beknazar AbdikamalovSpeko 創業者

課題:三つのモデルを選ぶのに、中立的な相談先がない

音声AIの約95%は、音声認識、LLM、テキスト読み上げの順で処理するカスケード方式です。エージェントごとに、別々のモデルを三つ選ぶ必要があります。その選択について意見を述べるプロバイダーの多くは、答えに利害関係を持っています。新しいプロバイダーも登場し続け、毎月選択肢が増える一方、どれが実際に役立つかは明確になりません。

英語以外では、さらに難しくなります。英語ではうまく読めるモデルでも、別の言語では声が変化したり、抑揚が乏しくなったりすることがあります。どのモデルでそうなるかについて、公開データはほとんどありません。自社で評価できる規模の企業なら、どの構成がどの場面で機能するかを把握しています。それ以外の企業は、マーケティングページを見て選ぶことになります。

ソリューション:2〜3日ごとに更新するベンチマーク

Spekoは段階的に評価します。新しいモデルには、費用をかける前に、低コストの自動チェックを行います。エージェントがXとHugging Faceで有望なリリースを監視し、見つかったモデルは最初にそのチェックを受けます。成績の良いモデルは、人による評価と、より予算をかけたテストに進みます。常時、約12社のプロバイダーを追跡しています。

2〜3日ごとにベンチマークを再実施することで、前の四半期のリリースではなく、現在のモデルバージョンの数値を維持します。評価基準はカテゴリごとに異なります。テキスト読み上げでは、三つあります。

  • 明瞭さ:単語を正しく読むだけでなく、文脈を踏まえ、意味が通り、本番で使える読み方ができるか。
  • 変動:生成全体を通じて声が一貫しているか、それとも品質、調子、タイミングが揺れるか。
  • 自然さ:人間らしく聞こえるか、それとも体験を損なう機械的な特徴があるか。

三つを別々に採点するからこそ、用途に合った推奨ができます。Abdikamalovは、多くの顧客を二つのグループに分けています。カスタマーサポートのエージェントは遅延を重視し、速く正確に処理を完了できるかで成功を測ります。AIコーチやセラピー製品には、人間らしく感じられる声が必要です。大半のプロバイダーは、どちらか一方を得意としています。

SpekoがCartesiaを選んだ理由

Sonic 3.5は、速度と自然さの組み合わせで最も強く、Spekoのテキスト読み上げ総合ランキングで首位に立っています。価格も、Spekoが追跡する他のモデルに対して競争力があります。この二つの軸は、Spekoの顧客が構築するものの大半をカバーします。サポートには低遅延、コーチングやセラピーには自然さが必要です。両方に強いモデルは珍しく、それがSonic 3.5を最も頻繁に推奨する理由です。

ここで標準というのは、自動的に選ばれるという意味ではなく、最も多く推奨されるという意味です。顧客の要件が別のモデルに向いていれば、Spekoはそちらに振り分けます。推奨は用途に従います。Sonicは、重要な評価基準で多くの用途に勝っているのです。

今後の展望:モデル選択を意識させない

Spekoは二つのことに同時に取り組んでいます。一つ目は、顧客がモデル選択を考える必要をなくすことです。Abdikamalovは、適切な構成を使えるかどうかが、顧客のモデルへの理解度で決まるべきではないと考えています。

モデル選択について知らなくても済むようにしたいんです。理想的には、内部で何が動いているかさえ知らなくてよいと思います。

Beknazar AbdikamalovSpeko 創業者

二つ目は、この分野で信頼されるベンチマークになることです。音声モデルを順位付けするランキングには、結果を検証するための手法を十分公開していないものも多く、本番の挙動がほとんど分からない限定的なデモに頼るものもあります。Spekoが目指すのは、定期的に更新し、手法を公開し、顧客が実際に構築するものをテストするベンチマークです。

Abdikamalovは、現在音声AIを利用する企業は約1%と見積もっています。その割合が増えれば、モデルの数も増えるでしょう。それでも難しい点は変わりません。どのモデルを、どこで信頼できるかを見極めることです。