ブログ / ニュース

Ink-2のご紹介:音声エージェント向け、ランキング1位のSTT

Eli Pugh 

リアルタイム音声エージェント向けに開発した音声認識モデル、Ink-2を公開しました。

2026年6月時点で、Artificial Analysisのストリーミングランキングにおいて単語誤り率が最も低く、1位にランクされています。また、各プロバイダーの中で最も正確な内蔵ターン検出を備え、いつ聴き、いつ応答すべきかを判断できます。

データセット別の最終文字起こしの単語誤り率

発話終了の検出後、最終的な文字起こしで誤認識した単語の割合。低いほど高性能。

Artificial Analysis2026年6月
AA-AgentTalkVoxPopuliEarnings22
3.4%
2.4%
5.3%
Ink-2(意味に基づく発話終了判定)
Cartesia
2.8%
2.3%
6.4%
Scribe v2 Realtime
ElevenLabs
3.6%
2.1%
7.2%
U3.5 Pro Realtime
AssemblyAI
6.7%
4.9%
11.4%
Flux
Deepgram
Ink-2(意味に基づく発話終了判定)
Cartesia
3.4%
2.4%
5.3%
Scribe v2 Realtime
ElevenLabs
2.8%
2.3%
6.4%
U3.5 Pro Realtime
AssemblyAI
3.6%
2.1%
7.2%
Flux
Deepgram
6.7%
4.9%
11.4%

音声エージェントの音声認識には、正確さ、ターン検出、レイテンシの3つが求められます。一つでも足りなければ、体験が崩れます。利用者を誤解したり、不適切なタイミングで割り込んだり、応答が遅れたり、会話が不自然になったりします。Ink-2は、この3つすべてで優れた性能を出すために開発しました。

正確さ:一語ずつ正しく捉える

電話番号、メールアドレス、英数字、日付など、構造を持つ情報の認識に力を入れました。Ink-2は、そうした情報がまだ途中だと理解し、全体がそろってから確定します。特別なプロンプトは必要ありません。

実際の音声エージェントの通話を考え、さまざまなアクセントに対応するようにしました。14種類の英語アクセントを含む実際のコールセンター対話を使うAppTekベンチマークでは、Ink-2のWERは8%で、ストリーミングSTTの中で最良です。Deepgram Fluxは10%、ElevenLabs Scribe v2は12%でした。

単語誤り率(WER):AppTek

実際のコールセンターの会話で、14種類の英語アクセントのWERを測定。低いほど高性能。

8%
Ink-2
Cartesia
10%
Flux
Deepgram
12%
Scribe v2 Realtime
ElevenLabs
13%
U3.5 Pro Realtime
AssemblyAI

きれいな参照音声だけでなく、本番の条件でも正確さを保ちます。社内ベンチマークでは、英語を母語としない話者、背景雑音、ネットワーク不良による音質低下を含む、稼働中の音声エージェントの通話から直接音声を抽出しています。Ink-2のWERは6.5%で、ElevenLabs Scribe v2の9.2%、Deepgram Fluxの9.4%を下回ります。

単語誤り率(WER):本番の音声エージェント

自社の音声エージェントによる、本番環境の実際の通話36件から作成した社内ベンチマーク。低いほど高性能。

Cartesiaによる評価2026年7月
6.5%
Ink-2
Cartesia
9.2%
Scribe v2 Realtime
ElevenLabs
9.4%
Flux
Deepgram
10.7%
U3.5 Pro Realtime
AssemblyAI

実際の音声エージェントで正確さが試されるのは、整ったベンチマークだけでなく、構造を持つ情報や本番の音声を扱う場面です。

ink-2

完全な形式の電話番号

10桁すべてを認識し、電話番号の形式で表示します。

flux-general-en

最後の桁を欠落

数字を単語で書き起こし、最後の桁が抜けています。

ターン検出:聴くときと応答するときを判断する

認識精度はベンチマークで明確に表れます。しかし、本番で多くの音声エージェントがつまずくのは、ターン検出です。

多くのエージェントは、沈黙をもとにターンの終わりを判断します。一定時間話さなければ、そこで発話を打ち切ります。テスト環境では動いても、実際の通話では住所の途中で遮ったり、「メールアドレスは……」の直後に割り込んだりします。

Ink-2には意味に基づく発話終了検出を組み込みました。沈黙ではなく意味を読み取り、発話の終わりを判断します。住所がまだ途中なのか、言いかけた文がまだ続くのかを理解します。話者が話し終えたと確信するまで、ターンを開いたままにします。

Ink-2は、外部のVADを使わず、次の3種類のイベントを出力します。

  • turn.start:利用者が話し始めました。
  • turn.eager_end :発話が終わりに近いとモデルが予測しました。LLMは早めに生成を始められます。
  • turn.end:発話が完了したと確定しました。

ink-2

1ターン

発話全体を一つのターンとして保持

flux-general-en

2ターン

一つの発話を複数のターンに分割

scribe_v2_realtime

3ターン

一つの発話を複数のターンに分割

ターン検出は、人がラベルを付けた正解データと比較して測定します。適合率は、モデルが発話終了と判断した際に正しい割合です。低ければ、人の話を遮ってしまいます。再現率は、実際の発話終了をどれだけ捉えられるかです。低ければ、モデルが聴き続け、不自然な無音が生まれます。F1は、この2つを一つの指標にまとめます。

他のモデルが一方を優先してもう一方を犠牲にする中、Ink-2は適合率と再現率を両方高く保ちます。

発話終了判定:本番の音声エージェント

本番環境で録音した音声エージェントの通話による、発話終了の判定性能の社内評価。高いほど高性能。

Cartesiaによる評価2026年7月
適合率再現率F1
89%
97%
93%
Ink-2
Cartesia
80%
97%
88%
Flux
Deepgram
74%
97%
84%
U3.5 Pro Realtime
AssemblyAI
89%
87%
88%
Scribe v2 Realtime
ElevenLabs
Ink-2
Cartesia
89%
97%
93%
Flux
Deepgram
80%
97%
88%
U3.5 Pro Realtime
AssemblyAI
74%
97%
84%
Scribe v2 Realtime
ElevenLabs
89%
87%
88%

micro1では、多数の候補者と音声面接を行うAI採用エージェントZaraにInk-2を使っています。応答はほぼ瞬時で、実際の会話パターンに沿ったターンの切り替えにもよく対応します。

Aruj Mahajanmicro1のAI担当

レイテンシ:会話の流れを保つ

TTSのレイテンシと同じく、文字起こしのレイテンシは会話の自然さに直接影響します。注目している指標はTime-to-Final-Transcript、TTFTです。利用者が話し終えてから、確定した文字起こしが得られるまでの時間を示します。エージェントが注意を向けているように感じるか、読み込みを待たされているように感じるかを左右します。

Ink-2のTTFTは0.1秒です。さらに、turn.eager_endによって、発話終了が完全に確定する前にLLMが処理を始められます。そのため、エージェントは会話に参加していると感じられる速さで応答できます。

ink-2

10.1秒速く

他社モデルが処理を始める前に、エージェントが応答できます

flux-general-en

15.9s

ここで初めて発話の終了が分かり、エージェントが処理を始めます

Ink-2を利用するチームに加わる

ServiceNow
HeyGen
Micro1
Synthesia

Ink-2はplay.cartesia.aiで公開中です。APIから直接利用できるほか、LiveKit、Vapi、Pipecatなど、音声開発チームが使う基盤でも利用できます。

音声AIを前進させ、本番でInk-2を運用するチームと一緒に、開発を続けていきます。高性能な英語モデルはすでに公開しました。利用者がどこで、どのように話していても対応できるよう、多言語対応にも取り組んでいます。

Ink-2を試す

クリックまたはSpaceで文字起こしを開始
タップして文字起こしを開始
話すテーマに迷ったら
今日、自由な時間が1時間増えたら何をしますか?

Ink-2を今すぐ試してみてください

Cartesiaを試す(英語)