本日、リアルタイム音声アプリケーションを開発する方に向けて、ストリーミング音声認識、STTの新しいモデル群Inkを公開します。最初のモデルはInk-Whisperです。OpenAIのWhisperをもとに、会話での低レイテンシな文字起こしに最適化しました。本日から利用できるInk-Whisperは、企業向け音声エージェントのために設計した、最速で最も低価格なSTTモデルです。
SonicからInkへ:話す側から聴く側へ
Sonicは、速度、品質、信頼性を重視する開発者に選ばれる音声合成、TTSとなりました。低レイテンシでの優位性により、お客様は自然な対話型音声体験をつくれます。今度はInkで、会話のもう一方、音声認識に取り組みます。
Whisperをリアルタイム向けに再設計
STTの公開にあたり、開発者が現在何を使い、どこに問題があるかを調べました。そこで注目したのが、OpenAIのwhisper-large-v3-turboです。Whisperは、会話の認識精度で他社の独自STTに匹敵し、オープンソースで、効率よく推論できます。広く使われる理由があります。
Whisperに関する改善の多くは、スループットに焦点を当てています。大きなデータセットをどれだけ速く文字起こしできるかを、リアルタイム係数、RTFで測ります。長い音声ファイルの後処理には適していますが、リアルタイムの音声エージェントでは、平均だけでなくすべての通話で高い認識品質が必要です。標準のWhisperは、その速度と正確さに課題があります。難しい実環境を想定した設計でもありません。
Whisperは基本的に、一括処理のためにつくられたモデルです。そこで、速度と実際の会話の文脈を中心に据え、リアルタイム音声AIのためのInk-Whisperへと再設計しました。
実際の会話を想定したInk-Whisper
企業の音声AIエージェントは、話されている音声をその場で認識し、変化の多い実環境でも安定して動く必要があります。Ink-Whisperでは、一般的なSTTがつまずきやすい条件での正確さを重視しました。
- 電話特有の音質:低帯域で圧縮した音声には歪みが加わります。
- 固有名詞や専門用語:製品名、薬品名、金融商品の名前などを明確に認識する必要があります。
- 背景雑音:車の音、飲食店の会話、赤ちゃんの泣き声、ノイズは認識を難しくします。
- 言いよどみや無音:「um」のようなつなぎ言葉や間は、標準的なWhisper実装を混乱させます。
- アクセントや声の違い:話者は多様で、STTも適応する必要があります。
標準のWhisperに対する大きな改善の一つが、動的なチャンク分割です。Whisperは30秒のまとまった音声で最もよく動きます。しかし会話AIは、短く断片的な音声を扱います。意味のある位置で終わる可変長チャンクを扱えるように変更しました。特に無音や音声の途切れで、誤りやハルシネーションを減らせます。
実際の環境で改善していることを確かめるため、音声AIでよくある課題を反映した評価データセットをつくりました。
- 背景雑音データセット:交通、カフェ、オフィスなど、騒音のある環境で録音した会話です。
- 固有名詞データセット:金融用語やブランド名が多いSPGISpeechから抽出した100サンプルです。
- アクセントデータセット:多様な英語アクセントの文字起こしで、話者の違いへの対応を評価します。
これらのデータセットで、Ink-Whisperは単語誤り率、WERにおいて、標準のwhisper-large-v3-turboを上回ります。他のストリーミングSTTとも競争力があり、特に本番でのリアルタイム性能に最適化しています。
| 関連データセットの単語誤り率 | データセットの内容 | Cartesia Streaming whisper-natural | Deepgram Nova3 Streaming | Fireworks Whisper Streaming | Assembly Streaming |
|---|---|---|---|---|---|
| 電話 | 電話での自然な会話 | 0.19 | 0.18 | 0.28 | 0.23 |
| 固有名詞 | 専門用語の多い発話 | 0.065 | 0.045 | 0.071 | 0.044 |
| 背景雑音 | 背景の騒音 | 0.033 | 0.038 | 0.099 | 0.027 |
| 言いよどみ | つなぎ言葉とノイズ | 0.064 | 0.055 | 0.156 | 0.137 |
| Speech Accent Archiveの一部 | 多様なアクセント | 0.015 | 0.024 | 0.014 | 0.016 |
最速のストリーミングモデル
自然な会話には、認識精度だけでなく、文字起こしをすぐに返すことも必要です。Ink-Whisperでは、time-to-complete-transcript、TTCTという指標を重視します。利用者が話し終わってから、文字起こし全体が完成するまでの時間です。TTCTは、注意を向けて聴く人のように、システム全体がどれだけ速く応答できるかを決めます。
返答の遅れは、不自然なボットだと気づかれる原因です。会話のリズムを崩し、通話の切断、利用者の不満、収益の損失につながります。TTCTを最小にすることは、速度の問題であると同時に、人と話すようなやり取りを実現するためでもあります。
Ink-Whisperは、TTCTで標準のwhisper-large-v3-turboを上回ります。実際、当社がテストしたストリーミング音声認識モデルの中で、最速のTTCTを達成しています。
| 最後の音声を送ってから文字起こしが完了するまで | Cartesia Streaming Ink-Whisper | Deepgram Nova3 Streaming | Fireworks Whisper Streaming | AssemblyAI Universal Streaming |
|---|---|---|---|---|
| 中央値 (ms) | 66 | 74 | 70 | 737 |
| P90 (ms) | 98 | 109 | 189 | 829 |
標準のWhisperは、汎用性の高いオープンなSTTモデルですが、リアルタイム向けにつくられたものではありません。Ink-Whisperは会話の正確さと低レイテンシに最適化しています。確認した中で最速のTTCTを達成し、騒音、アクセント、変化する発話にも対応します。評価したのは、実験室やスタジオの整った環境ではなく、音声エージェントが実際に出会う条件です。
最も低価格なストリーミングモデル
音声が未来のインターフェースになると信じ、音声サービスを開発する方がInk-Whisperを使いやすい価格で提供します。Ink-Whisperは、最速かつ最も低価格なストリーミングSTTモデルです。1秒あたり1クレジット、Scaleプランでは1時間あたり0.13ドルで、高品質なリアルタイム文字起こしを提供します。
Ink-Whisperは次のように導入できます。
- Vapi、Pipecat、LiveKitと連携し、数分で音声のストリーミングを始められます。
- 99.9%の稼働率と、SOC 2 Type II、HIPAA、PCIへの対応により、企業での大規模な運用を支えます。
Cartesiaと音声AIの未来
音声エージェントの需要が急増しています。優れたエージェントは、Sonicのような先端の音声AIを利用しています。Ink-Whisperでは聴く側の需要にも応え、速く自然な会話を可能にします。今回の公開は、リアルタイム音声の基盤をつくり直す取り組みの始まりです。今後も続けていきます。
