学ぶ

オンプレミス音声AIとは:仕組みと導入方法

Rene, Kabir Goel 
オンプレミス音声AIとは:仕組みと導入方法

価格にかかわらず、ホスト型の音声APIを利用できない購入者がいます。政府機関、病院、銀行、防衛関連企業は、「音声を自社の境界内に置く」という条件で音声AIを調達します。オンプレミス音声AIはその条件を満たす方法であり、購入前に評価すべきことも変わります。

このページでは、オンプレミス音声AIの意味、自社ハードウェアで動かす必要があるもの、クラウドAPIからエアギャップまでの選択肢、ベンダーの評価方法を説明します。最後に、ServiceNowのAI Voice Agentsを支える完全エアギャップのオンプレミス導入を含め、Cartesiaの方法を紹介します。

オンプレミス音声AIとは

組織が所有、管理する基盤で動く音声ソフトウェアです。ベンダーがモデルを提供し、自社チームが自社サーバー、データセンター、または管理権限を持つクラウドアカウントで動かします。生の通話、その音声、文字起こしをベンダーの基盤に通す必要がありません。

一般的なクラウドAPIでは、ベンダーに音声を送り、ベンダーがモデルを動かし、その利用規約の下で音声と文字起こしを扱います。多くの製品には適切ですが、そうでない用途もあります。機密の説明、セラピー、規制当局が記録を求められる通話なら、「ベンダーが削除すると言っている」だけでは足りないことがあります。

ここで音声AIはリアルタイムの音声処理を意味し、その上に構築する音声エージェントには四つの要素があります。

要素役割オンプレミスで実行できるか
ストリーミング音声認識通話者が話している間に文字起こしはい
ターン検出通話者が話し終えたか判断はい
言語モデルとツール返答を決め、自社システムを呼び出すはい、自社で選択
ストリーミング音声合成生成中の回答を音声で返すはい

すべて自社の境界内で動かせます。言語モデルは従来から自社で選べました。ベンダーが手元に留めることが多いのは音声モデルであり、自社内へ持ち込めるかはベンダー間の大きな違いです。

企業がオンプレミスに導入する理由

繰り返し挙がる理由は三つあります。

データ主権と保存場所。 契約や法域によっては、特定のデータを、自社が管理する物理的または法的な境界から出せません。クラウドAPIは運用者に音声を送りますが、オンプレミスなら自社のラックが境界になります。

法令や基準への対応。 規制対象の購入者は、HIPAA、GDPR、PCIなどの枠組みに導入構成を照らします。オンプレミスだけで適合するわけではありませんが、データ経路の始点と終点を監査人に示せる基盤内に置くことで、監査しやすくなります。

レイテンシと制御。 自社ネットワークでモデルを動かすと、ベンダーとの往復通信がなくなり、他社のレート制限にも依存しません。音声エージェントでは応答時間が体験を決めます。人は約200ミリ秒で会話の順番を交代し(Stiversほか、2009年)、1秒の沈黙はためらいに感じられます。選択肢の先に端末上でのモデル実行があるのもそのためです。通信も共有基盤も不要になります。

導入方式の選択肢

クラウドかオンプレミスかという問いは、実際には誰が何を運用するかの選択です。企業の導入の多くは次のいずれかです。

方式モデルの実行場所運用者データ経路
クラウドAPIベンダーのクラウドベンダー音声が自社ネットワークを出る
VPC、プライベートクラウド自社クラウドアカウントの指定地域自社、ベンダーが支援音声は自社クラウドアカウント内
オンプレミス自社データセンター自社音声は自社ネットワーク内
エアギャップのオンプレミスインターネット経路のない自社データセンター自社構造上、何も外に出ない
端末上端末そのもの自社ハードウェアの外に出ない

確認すべき点が二つあります。VPCはオンプレミスではありません。ハードウェアは自社用でも、データセンターは自社のものではありません。制約が契約上のものなら、通常は十分です。次に、各ベンダーの「オンプレミス」に何が含まれるかを尋ねます。自社で動かすコンテナでも、ライセンスや更新のために外部へ接続するものがあります。これは接続型のオンプレミスであり、エアギャップの要件は満たしません。

オンプレミス音声AIベンダーの評価方法

実際の対応と宣伝を分ける質問です。

  1. エアギャップは本物か。 外部への接続が一切なくても推論できるか、ライセンス、テレメトリー、必須のクラウド呼び出しが会話中に外へ出るかを確認します。
  2. クラウドと同じモデルか。 APIより古い別モデルを提供するベンダーもいます。気に入ったデモがクラウドモデルなら、購入する実体がどれかを尋ねてください。
  3. 自社環境でどれだけ遅れるか。 ベンダーの数値はそのハードウェアでの測定です。自社のハードウェアと同時実行数で、中央値ではなく99パーセンタイルを測ってもらいます。
  4. 誰がどう更新するか。 オンプレミスでも更新は必要です。更新の配布、バージョン固定、モデル交換が調整済みのプロンプトと声に与える影響を確認します。
  5. 適合性の書類はあるか。 SOC 2 Type II、締結できるBAA、公開DPA、データ保存場所の条件を確認します。提出できなければ、導入方式だけで契約は成立しません。
  6. 処理全体を内側に置けるか。 TTSだけがオンプレミスでSTTが外部なら、境界に穴があります。ターン検出も含む処理全体を確認してください。

Cartesiaのオンプレミス対応

Cartesiaのモデルは、リアルタイム推論向けの状態空間モデルに基づき、同じモデルをクラウド、オンプレミス、端末上で利用できます。

  • 音声合成モデルSonicは、モデルのレイテンシが90ms未満で、第三者のブラインド試聴評価で首位、44言語に対応します。エアギャップを含む自社データセンター、AWS、GCP、Azureの自社VPC、または製品に直接組み込むOEMライセンスで導入できます。
  • ターン検出を備えたストリーミング音声認識モデルInkも、同じ方式で導入できます。
  • ServiceNowのAI Voice Agentsには、音声モデル、推論エンジン、処理の連携を完全エアギャップのオンプレミス構成で提供し、SOC 2 Type II、HIPAA、GDPR、PCIに対応しています。
  • Rasaは企業向け製品にCartesiaのオンプレミス導入を組み込み、Blue Machinesは規制環境向けの構成を共同開発しました。
  • 端末上での実行には、状態空間モデルを動かすオープンソースのApache 2.0ライブラリEdgeがあります。

オンプレミスとOEMはエンタープライズ契約で利用できます。要件をご相談いただくか、セルフサービス料金のクラウドで始めてから移行できます。モデルが同じなので、移行は導入構成の変更であり、作り直しではありません。

よくある質問

オンプレミス音声AIとは何ですか?

組織が管理するハードウェアで、自社ネットワーク内で動く音声ソフトウェアです。音声認識、音声合成、返答を決めるモデルをデータセンターやプライベートクラウドで実行し、通話音声と文字起こしをベンダーのサーバーに通しません。

オンプレミスとエアギャップは同じですか?

異なります。オンプレミスは自社のハードウェアで動かすこと、エアギャップは公開インターネットへの経路が一切ないことです。前者は設置場所、後者は適用できる最も厳しいネットワーク方針です。データ主権の要件がある組織が求めるオンプレミスは、多くの場合エアギャップを意味します。

音声合成をオンプレミスで実行できますか?

はい。Cartesiaの音声合成モデルSonicは、エアギャップを含む自社データセンターや、AWS、GCP、Azureの自社VPCに導入できます。ストリーミング音声認識モデルInkも同様です。どちらもエンタープライズ契約で利用できます。

音声AIではどの認証が重要ですか?

SOC 2 Type II、BAAを締結できるHIPAA適格性、GDPRへの対応を確認し、データ保存の扱いを尋ねてください。CartesiaはSOC 2 Type II認証を取得し、BAAを提供するHIPAA適格サービスで、GDPRに対応し、対象サービスでゼロデータ保持を提供します。データ保護補遺はcartesia.ai/legal/dpaで公開しています。

通話音声を非公開にするには完全なオンプレミスが必要ですか?

必ずしも必要ではありません。制約が物理的なものでなく契約上のものなら、VPCやゼロデータ保持で、運用負担を抑えて満たせる場合があります。音声を物理的に境界の外に出せない、または規制や契約で要求される場合に、オンプレミスの費用に意味があります。