価格にかかわらず、ホスト型の音声APIを利用できない購入者がいます。政府機関、病院、銀行、防衛関連企業は、「音声を自社の境界内に置く」という条件で音声AIを調達します。オンプレミス音声AIはその条件を満たす方法であり、購入前に評価すべきことも変わります。
このページでは、オンプレミス音声AIの意味、自社ハードウェアで動かす必要があるもの、クラウドAPIからエアギャップまでの選択肢、ベンダーの評価方法を説明します。最後に、ServiceNowのAI Voice Agentsを支える完全エアギャップのオンプレミス導入を含め、Cartesiaの方法を紹介します。
オンプレミス音声AIとは
組織が所有、管理する基盤で動く音声ソフトウェアです。ベンダーがモデルを提供し、自社チームが自社サーバー、データセンター、または管理権限を持つクラウドアカウントで動かします。生の通話、その音声、文字起こしをベンダーの基盤に通す必要がありません。
一般的なクラウドAPIでは、ベンダーに音声を送り、ベンダーがモデルを動かし、その利用規約の下で音声と文字起こしを扱います。多くの製品には適切ですが、そうでない用途もあります。機密の説明、セラピー、規制当局が記録を求められる通話なら、「ベンダーが削除すると言っている」だけでは足りないことがあります。
ここで音声AIはリアルタイムの音声処理を意味し、その上に構築する音声エージェントには四つの要素があります。
| 要素 | 役割 | オンプレミスで実行できるか |
|---|---|---|
| ストリーミング音声認識 | 通話者が話している間に文字起こし | はい |
| ターン検出 | 通話者が話し終えたか判断 | はい |
| 言語モデルとツール | 返答を決め、自社システムを呼び出す | はい、自社で選択 |
| ストリーミング音声合成 | 生成中の回答を音声で返す | はい |
すべて自社の境界内で動かせます。言語モデルは従来から自社で選べました。ベンダーが手元に留めることが多いのは音声モデルであり、自社内へ持ち込めるかはベンダー間の大きな違いです。
企業がオンプレミスに導入する理由
繰り返し挙がる理由は三つあります。
データ主権と保存場所。 契約や法域によっては、特定のデータを、自社が管理する物理的または法的な境界から出せません。クラウドAPIは運用者に音声を送りますが、オンプレミスなら自社のラックが境界になります。
法令や基準への対応。 規制対象の購入者は、HIPAA、GDPR、PCIなどの枠組みに導入構成を照らします。オンプレミスだけで適合するわけではありませんが、データ経路の始点と終点を監査人に示せる基盤内に置くことで、監査しやすくなります。
レイテンシと制御。 自社ネットワークでモデルを動かすと、ベンダーとの往復通信がなくなり、他社のレート制限にも依存しません。音声エージェントでは応答時間が体験を決めます。人は約200ミリ秒で会話の順番を交代し(Stiversほか、2009年)、1秒の沈黙はためらいに感じられます。選択肢の先に端末上でのモデル実行があるのもそのためです。通信も共有基盤も不要になります。
導入方式の選択肢
クラウドかオンプレミスかという問いは、実際には誰が何を運用するかの選択です。企業の導入の多くは次のいずれかです。
| 方式 | モデルの実行場所 | 運用者 | データ経路 |
|---|---|---|---|
| クラウドAPI | ベンダーのクラウド | ベンダー | 音声が自社ネットワークを出る |
| VPC、プライベートクラウド | 自社クラウドアカウントの指定地域 | 自社、ベンダーが支援 | 音声は自社クラウドアカウント内 |
| オンプレミス | 自社データセンター | 自社 | 音声は自社ネットワーク内 |
| エアギャップのオンプレミス | インターネット経路のない自社データセンター | 自社 | 構造上、何も外に出ない |
| 端末上 | 端末そのもの | 自社 | ハードウェアの外に出ない |
確認すべき点が二つあります。VPCはオンプレミスではありません。ハードウェアは自社用でも、データセンターは自社のものではありません。制約が契約上のものなら、通常は十分です。次に、各ベンダーの「オンプレミス」に何が含まれるかを尋ねます。自社で動かすコンテナでも、ライセンスや更新のために外部へ接続するものがあります。これは接続型のオンプレミスであり、エアギャップの要件は満たしません。
オンプレミス音声AIベンダーの評価方法
実際の対応と宣伝を分ける質問です。
- エアギャップは本物か。 外部への接続が一切なくても推論できるか、ライセンス、テレメトリー、必須のクラウド呼び出しが会話中に外へ出るかを確認します。
- クラウドと同じモデルか。 APIより古い別モデルを提供するベンダーもいます。気に入ったデモがクラウドモデルなら、購入する実体がどれかを尋ねてください。
- 自社環境でどれだけ遅れるか。 ベンダーの数値はそのハードウェアでの測定です。自社のハードウェアと同時実行数で、中央値ではなく99パーセンタイルを測ってもらいます。
- 誰がどう更新するか。 オンプレミスでも更新は必要です。更新の配布、バージョン固定、モデル交換が調整済みのプロンプトと声に与える影響を確認します。
- 適合性の書類はあるか。 SOC 2 Type II、締結できるBAA、公開DPA、データ保存場所の条件を確認します。提出できなければ、導入方式だけで契約は成立しません。
- 処理全体を内側に置けるか。 TTSだけがオンプレミスでSTTが外部なら、境界に穴があります。ターン検出も含む処理全体を確認してください。
Cartesiaのオンプレミス対応
Cartesiaのモデルは、リアルタイム推論向けの状態空間モデルに基づき、同じモデルをクラウド、オンプレミス、端末上で利用できます。
- 音声合成モデルSonicは、モデルのレイテンシが90ms未満で、第三者のブラインド試聴評価で首位、44言語に対応します。エアギャップを含む自社データセンター、AWS、GCP、Azureの自社VPC、または製品に直接組み込むOEMライセンスで導入できます。
- ターン検出を備えたストリーミング音声認識モデルInkも、同じ方式で導入できます。
- ServiceNowのAI Voice Agentsには、音声モデル、推論エンジン、処理の連携を完全エアギャップのオンプレミス構成で提供し、SOC 2 Type II、HIPAA、GDPR、PCIに対応しています。
- Rasaは企業向け製品にCartesiaのオンプレミス導入を組み込み、Blue Machinesは規制環境向けの構成を共同開発しました。
- 端末上での実行には、状態空間モデルを動かすオープンソースのApache 2.0ライブラリEdgeがあります。
オンプレミスとOEMはエンタープライズ契約で利用できます。要件をご相談いただくか、セルフサービス料金のクラウドで始めてから移行できます。モデルが同じなので、移行は導入構成の変更であり、作り直しではありません。