リアルタイム音声エージェント向けに開発した音声認識モデル、Ink-2を公開しました。
2026年6月時点で、Artificial Analysisのストリーミングランキングにおいて単語誤り率が最も低く、1位にランクされています。また、各プロバイダーの中で最も正確な内蔵ターン検出を備え、いつ聴き、いつ応答すべきかを判断できます。
データセット別の最終文字起こしの単語誤り率
発話終了の検出後、最終的な文字起こしで誤認識した単語の割合。低いほど高性能。
音声エージェントの音声認識には、正確さ、ターン検出、レイテンシの3つが求められます。一つでも足りなければ、体験が崩れます。利用者を誤解したり、不適切なタイミングで割り込んだり、応答が遅れたり、会話が不自然になったりします。Ink-2は、この3つすべてで優れた性能を出すために開発しました。
正確さ:一語ずつ正しく捉える
電話番号、メールアドレス、英数字、日付など、構造を持つ情報の認識に力を入れました。Ink-2は、そうした情報がまだ途中だと理解し、全体がそろってから確定します。特別なプロンプトは必要ありません。
実際の音声エージェントの通話を考え、さまざまなアクセントに対応するようにしました。14種類の英語アクセントを含む実際のコールセンター対話を使うAppTekベンチマークでは、Ink-2のWERは8%で、ストリーミングSTTの中で最良です。Deepgram Fluxは10%、ElevenLabs Scribe v2は12%でした。
単語誤り率(WER):AppTek
実際のコールセンターの会話で、14種類の英語アクセントのWERを測定。低いほど高性能。
きれいな参照音声だけでなく、本番の条件でも正確さを保ちます。社内ベンチマークでは、英語を母語としない話者、背景雑音、ネットワーク不良による音質低下を含む、稼働中の音声エージェントの通話から直接音声を抽出しています。Ink-2のWERは6.5%で、ElevenLabs Scribe v2の9.2%、Deepgram Fluxの9.4%を下回ります。
単語誤り率(WER):本番の音声エージェント
自社の音声エージェントによる、本番環境の実際の通話36件から作成した社内ベンチマーク。低いほど高性能。
実際の音声エージェントで正確さが試されるのは、整ったベンチマークだけでなく、構造を持つ情報や本番の音声を扱う場面です。
ink-2
完全な形式の電話番号
10桁すべてを認識し、電話番号の形式で表示します。
flux-general-en
最後の桁を欠落
数字を単語で書き起こし、最後の桁が抜けています。
ターン検出:聴くときと応答するときを判断する
認識精度はベンチマークで明確に表れます。しかし、本番で多くの音声エージェントがつまずくのは、ターン検出です。
多くのエージェントは、沈黙をもとにターンの終わりを判断します。一定時間話さなければ、そこで発話を打ち切ります。テスト環境では動いても、実際の通話では住所の途中で遮ったり、「メールアドレスは……」の直後に割り込んだりします。
Ink-2には意味に基づく発話終了検出を組み込みました。沈黙ではなく意味を読み取り、発話の終わりを判断します。住所がまだ途中なのか、言いかけた文がまだ続くのかを理解します。話者が話し終えたと確信するまで、ターンを開いたままにします。
Ink-2は、外部のVADを使わず、次の3種類のイベントを出力します。
turn.start:利用者が話し始めました。turn.eager_end:発話が終わりに近いとモデルが予測しました。LLMは早めに生成を始められます。turn.end:発話が完了したと確定しました。
ink-2
1ターン
発話全体を一つのターンとして保持
flux-general-en
2ターン
一つの発話を複数のターンに分割
scribe_v2_realtime
3ターン
一つの発話を複数のターンに分割
ターン検出は、人がラベルを付けた正解データと比較して測定します。適合率は、モデルが発話終了と判断した際に正しい割合です。低ければ、人の話を遮ってしまいます。再現率は、実際の発話終了をどれだけ捉えられるかです。低ければ、モデルが聴き続け、不自然な無音が生まれます。F1は、この2つを一つの指標にまとめます。
他のモデルが一方を優先してもう一方を犠牲にする中、Ink-2は適合率と再現率を両方高く保ちます。
発話終了判定:本番の音声エージェント
本番環境で録音した音声エージェントの通話による、発話終了の判定性能の社内評価。高いほど高性能。
micro1では、多数の候補者と音声面接を行うAI採用エージェントZaraにInk-2を使っています。応答はほぼ瞬時で、実際の会話パターンに沿ったターンの切り替えにもよく対応します。
レイテンシ:会話の流れを保つ
TTSのレイテンシと同じく、文字起こしのレイテンシは会話の自然さに直接影響します。注目している指標はTime-to-Final-Transcript、TTFTです。利用者が話し終えてから、確定した文字起こしが得られるまでの時間を示します。エージェントが注意を向けているように感じるか、読み込みを待たされているように感じるかを左右します。
Ink-2のTTFTは0.1秒です。さらに、turn.eager_endによって、発話終了が完全に確定する前にLLMが処理を始められます。そのため、エージェントは会話に参加していると感じられる速さで応答できます。
ink-2
他社モデルが処理を始める前に、エージェントが応答できます
flux-general-en
ここで初めて発話の終了が分かり、エージェントが処理を始めます
Ink-2を利用するチームに加わる
Ink-2はplay.cartesia.aiで公開中です。APIから直接利用できるほか、LiveKit、Vapi、Pipecatなど、音声開発チームが使う基盤でも利用できます。
音声AIを前進させ、本番でInk-2を運用するチームと一緒に、開発を続けていきます。高性能な英語モデルはすでに公開しました。利用者がどこで、どのように話していても対応できるよう、多言語対応にも取り組んでいます。