仕事のあらゆる環境に、一つの音声認識モデルで対応
電車の走行音や頭上のアナウンスが響く中でも、Ink-2は話者の言葉を一つひとつ文字にします。
街の騒音(英語音声)
音声エージェントのための設計
本番環境のエージェントを支える、Inkの4つの機能。
認識精度
最初から、正確に聞き取る。
実際の利用では
音声エージェントでは、文字起こしがすべての処理の土台になります。認識の誤りはLLMへの入力を損ない、対話を誤った方向へ導きます。
逆に、正確な文字起こしは応答の質を高め、問題の解決につながります。
Ink-2の仕組み
InkはストリーミングSTTモデルで最小の単語誤り率(WER)を実現し、電話番号、日付、メールアドレス、通貨、UUIDなどの構造化された情報を直接扱います。電話回線、背景雑音、さまざまなアクセントなど、実際の音声環境を想定した設計です。
日付・英数字・ID(英語音声)
自然な会話の流れ
話し始めも、話し終わりも捉える。
実際の利用では
会話では、話者が話し始める瞬間と話し終える瞬間が重要です。開始を見逃せば発話そのものを取り逃し、終了を早く判定しすぎると考えの途中で割り込みます。適切な文字起こしモデルは、待たせることなく両方を捉えます。
Ink-2の仕組み
Ink-2は発話検出を内蔵し、turn.startとturn.endをモデルから直接通知します。外部VADの組み込みや保守は不要です。turn.eager_endを使えば、発話の終了が確定する前にLLMの処理を始められます。
意味に基づいて発話の終了を判断するため、考えの途中の間を終了と誤認して応答を始めることを防ぎます。
ink-2
他社モデルが処理を始める前に、エージェントが応答できます
flux-general-en
ここで初めて発話の終了が分かり、エージェントが処理を始めます
速度
話し終えると、
エージェントが考え始める。
実際の利用では
文字起こしが一貫して速ければ、応答もすぐに返ってくるように感じられます。10回に1回の遅れは、10回に1回の会話でその感覚が失われることを意味します。9回うまくいっても、違和感のあった1回は帳消しになりません。
Ink-2の仕組み
Inkは、リアルタイム会話専用の推論エンジンを使う最速のストリーミングASRモデルです。最終的な文字起こしまでの時間は0.1秒。turn.eager_endで、最後の発話から最初の応答までの間隔を縮めます。
コスト
規模が大きくなっても、品質のためにコストを増やさない。
実際の利用では
音声は、コミュニケーションの自然なインターフェースです。規模が大きくなってもコストと品質を両立できれば、あらゆるエージェントとのやり取りに音声を取り入れられます。
Ink-2の仕組み
InkのState Space Modelアーキテクチャは、Transformerの10〜100倍のスループットを実現します。規模が大きくなっても品質を犠牲にせず、計算コストを抑えられます。モデル全体の継続的な最適化により、利用規模の拡大に合わせて単位あたりのコストを改善します。
エンタープライズ向けのセキュリティ。クラウドからローカルまで。
HIPAA準拠

SOC 2 Type 2

GDPR

PCI
よくある質問
Ink-2が音声エージェントに適している理由は?
Ink-2は、本番環境の音声エージェント向けに設計されたCartesiaのストリーミング音声認識モデルです。TTSと同様、Stanfordで創業チームが開発したState Space Model(SSM)アーキテクチャに基づいています。
ストリーミングSTTモデルで最小の単語誤り率(WER)。通話録音、さまざまなアクセント、雑音のある環境、決算説明会で、Deepgram Flux、Soniox RT-V4、AssemblyAI RT Pro、ElevenLabs Scribe-2-realtimeなどの本番向けモデルを上回ります。電話番号、メールアドレス、UUIDなどの英数字も対象です。
高精度な発話終了検出を内蔵。モデル自体が発話の終了を検出するため、Sileroのような別のモデルを組み込む必要がありません。依存関係と遅延を減らし、発話の切り替わりをより正確に捉えます。
雑音への耐性も内蔵。Krispなどの音声フィルターなしで背景雑音に対応し、構成全体のコストと遅延を削減します。
Ink-2でもKrispやSileroは必要ですか?
いいえ。これはチームがInk-2に移行する主な理由の一つです。
発話の切り替わりの検出を内蔵しています。多くのSTTモデルは、話者が話し終えたことを判断するためにSileroなどの外部モデルを必要とします。Ink-2はこれを直接処理し、別のモデルを実行するより速く正確に検出します。
雑音への耐性も備えています。多くの音声エージェントは背景雑音を除くためにSTTにKrispなどの音声フィルターを重ね、コスト、遅延、複雑さが増えます。Ink-2は追加のフィルターなしで背景雑音に対応します。
構成するモデルを減らすことで、遅延、コスト、障害の発生箇所を減らせます。
Ink-2をオンプレミスや自社クラウド(VPC)で動かせますか?
はい。Ink-2は、ネットワークから隔離された環境を含む自社データセンター内のオンプレミス環境、AWS・GCP・Azureの自社VPC、または製品に直接組み込むOEMライセンスで導入できます。
政府との契約、医療・金融・保険などの規制対象業界、データ主権やデータの保管場所に要件がある組織にも対応できます。オンプレミスおよびOEMでの導入は、エンタープライズ契約で提供しています。
Ink-2はどの言語に対応していますか?
Ink-2は英語、スペイン語、フランス語、ヒンディー語、日本語に対応しています。
Ink-2の料金はいくらですか?
Ink-2の料金は3クレジット/秒です。料金の詳細とボリューム割引は料金ページをご覧ください。エンタープライズ契約では、利用量と導入形態に応じた個別の料金を提供しています。
Cartesiaは、対象となる初期段階の企業にクレジットを提供するスタートアップ支援プログラムも実施しています。詳細はスタートアップ支援プログラムをご覧ください。
どのような場合に営業へ問い合わせればよいですか?
次のいずれかに該当する場合はCartesiaのチームにご相談ください。
大規模な本番ワークロードを運用している(>50Mクレジット)。
オンプレミス、VPC、OEMでの導入が必要。
医療、金融、その他の規制対象分野向けに、BAA、ゼロデータ保持、その他のコンプライアンスに関する契約条件が必要。
政府、連邦機関、公共部門の調達を担当している。
評価、試作、小規模な本番ワークロードなどは、セルフサービスプランとhttps://docs.cartesia.ai/build-with-cartesia/stt-models/latestの技術ドキュメントから始められます。
今すぐ始める
専門家に相談する。
音声体験の開発にCartesiaをどう活用できるか、私たちのチームにご相談ください。
開発を始める。
APIでモデルにアクセスし、数分で音声エージェントを本番環境に導入できます。





