Ink:最速・最高精度の音声認識モデル

精度ランキング1位。意味に基づく発話の終了検出と業界をリードする低遅延で、音声エージェント向けに設計。
クリックまたはSpaceで文字起こしを開始
タップして文字起こしを開始
話すテーマに迷ったら
最近始めた趣味はありますか?

仕事のあらゆる環境に、一つの音声認識モデルで対応

電車の走行音や頭上のアナウンスが響く中でも、Ink-2は話者の言葉を一つひとつ文字にします。

街の騒音(英語音声)

朝の街並みのイラスト
昼の街並みのイラスト
夜の街並みのイラスト
朝の街並みのイラスト

音声エージェントのための設計

本番環境のエージェントを支える、Inkの4つの機能。

認識精度

最初から、正確に聞き取る。

実際の利用では

音声エージェントでは、文字起こしがすべての処理の土台になります。認識の誤りはLLMへの入力を損ない、対話を誤った方向へ導きます。

逆に、正確な文字起こしは応答の質を高め、問題の解決につながります。


Ink-2の仕組み

InkはストリーミングSTTモデルで最小の単語誤り率(WER)を実現し、電話番号、日付、メールアドレス、通貨、UUIDなどの構造化された情報を直接扱います。電話回線、背景雑音、さまざまなアクセントなど、実際の音声環境を想定した設計です。

日付・英数字・ID(英語音声)

自然な会話の流れ

話し始めも、話し終わりも捉える。

実際の利用では

会話では、話者が話し始める瞬間と話し終える瞬間が重要です。開始を見逃せば発話そのものを取り逃し、終了を早く判定しすぎると考えの途中で割り込みます。適切な文字起こしモデルは、待たせることなく両方を捉えます。


Ink-2の仕組み

Ink-2は発話検出を内蔵し、turn.startとturn.endをモデルから直接通知します。外部VADの組み込みや保守は不要です。turn.eager_endを使えば、発話の終了が確定する前にLLMの処理を始められます。

意味に基づいて発話の終了を判断するため、考えの途中の間を終了と誤認して応答を始めることを防ぎます。

ink-2

10.1秒速く

他社モデルが処理を始める前に、エージェントが応答できます

flux-general-en

15.9s

ここで初めて発話の終了が分かり、エージェントが処理を始めます

速度

話し終えると、
エージェントが考え始める。

実際の利用では

文字起こしが一貫して速ければ、応答もすぐに返ってくるように感じられます。10回に1回の遅れは、10回に1回の会話でその感覚が失われることを意味します。9回うまくいっても、違和感のあった1回は帳消しになりません。


Ink-2の仕組み

Inkは、リアルタイム会話専用の推論エンジンを使う最速のストリーミングASRモデルです。最終的な文字起こしまでの時間は0.1秒。turn.eager_endで、最後の発話から最初の応答までの間隔を縮めます。

Ink
88ms
まばたき
100ms
人間の反応の閾値
150ms

コスト

規模が大きくなっても、品質のためにコストを増やさない。

実際の利用では

音声は、コミュニケーションの自然なインターフェースです。規模が大きくなってもコストと品質を両立できれば、あらゆるエージェントとのやり取りに音声を取り入れられます。


Ink-2の仕組み

InkのState Space Modelアーキテクチャは、Transformerの10〜100倍のスループットを実現します。規模が大きくなっても品質を犠牲にせず、計算コストを抑えられます。モデル全体の継続的な最適化により、利用規模の拡大に合わせて単位あたりのコストを改善します。

エンタープライズ向けのセキュリティ。クラウドからローカルまで。

  • HIPAA準拠のバッジ

    HIPAA準拠

  • SOC 2 Type 2のバッジ

    SOC 2 Type 2

  • GDPRのバッジ

    GDPR

  • PCIのバッジ

    PCI

よくある質問

Ink-2が音声エージェントに適している理由は?

Ink-2は、本番環境の音声エージェント向けに設計されたCartesiaのストリーミング音声認識モデルです。TTSと同様、Stanfordで創業チームが開発したState Space Model(SSM)アーキテクチャに基づいています。

ストリーミングSTTモデルで最小の単語誤り率(WER)。通話録音、さまざまなアクセント、雑音のある環境、決算説明会で、Deepgram Flux、Soniox RT-V4、AssemblyAI RT Pro、ElevenLabs Scribe-2-realtimeなどの本番向けモデルを上回ります。電話番号、メールアドレス、UUIDなどの英数字も対象です。

高精度な発話終了検出を内蔵。モデル自体が発話の終了を検出するため、Sileroのような別のモデルを組み込む必要がありません。依存関係と遅延を減らし、発話の切り替わりをより正確に捉えます。

雑音への耐性も内蔵。Krispなどの音声フィルターなしで背景雑音に対応し、構成全体のコストと遅延を削減します。

Ink-2でもKrispやSileroは必要ですか?

いいえ。これはチームがInk-2に移行する主な理由の一つです。

発話の切り替わりの検出を内蔵しています。多くのSTTモデルは、話者が話し終えたことを判断するためにSileroなどの外部モデルを必要とします。Ink-2はこれを直接処理し、別のモデルを実行するより速く正確に検出します。

雑音への耐性も備えています。多くの音声エージェントは背景雑音を除くためにSTTにKrispなどの音声フィルターを重ね、コスト、遅延、複雑さが増えます。Ink-2は追加のフィルターなしで背景雑音に対応します。

構成するモデルを減らすことで、遅延、コスト、障害の発生箇所を減らせます。

Ink-2をオンプレミスや自社クラウド(VPC)で動かせますか?

はい。Ink-2は、ネットワークから隔離された環境を含む自社データセンター内のオンプレミス環境、AWS・GCP・Azureの自社VPC、または製品に直接組み込むOEMライセンスで導入できます。

政府との契約、医療・金融・保険などの規制対象業界、データ主権やデータの保管場所に要件がある組織にも対応できます。オンプレミスおよびOEMでの導入は、エンタープライズ契約で提供しています。

Ink-2はどの言語に対応していますか?

Ink-2は英語、スペイン語、フランス語、ヒンディー語、日本語に対応しています。

Ink-2の料金はいくらですか?

Ink-2の料金は3クレジット/秒です。料金の詳細とボリューム割引は料金ページをご覧ください。エンタープライズ契約では、利用量と導入形態に応じた個別の料金を提供しています。

Cartesiaは、対象となる初期段階の企業にクレジットを提供するスタートアップ支援プログラムも実施しています。詳細はスタートアップ支援プログラムをご覧ください。

どのような場合に営業へ問い合わせればよいですか?

次のいずれかに該当する場合はCartesiaのチームにご相談ください。

大規模な本番ワークロードを運用している(>50Mクレジット)。

オンプレミス、VPC、OEMでの導入が必要。

医療、金融、その他の規制対象分野向けに、BAA、ゼロデータ保持、その他のコンプライアンスに関する契約条件が必要。

政府、連邦機関、公共部門の調達を担当している。

評価、試作、小規模な本番ワークロードなどは、セルフサービスプランとhttps://docs.cartesia.ai/build-with-cartesia/stt-models/latestの技術ドキュメントから始められます。

今すぐ始める

専門家に相談する。

音声体験の開発にCartesiaをどう活用できるか、私たちのチームにご相談ください。

営業に問い合わせる

開発を始める。

APIでモデルにアクセスし、数分で音声エージェントを本番環境に導入できます。

Cartesiaを試す