学ぶ

AI音声エージェントとは:仕組みと構築方法

Rene, Kabir Goel 
AI音声エージェントとは:仕組みと構築方法

AI音声エージェントは電話を取り、通話者の要望を聞き、予約、注文照会、質問への回答、行き詰まる前の人への引き継ぎを行います。チャットボットは読み書きでこの仕事をします。音声エージェントは、通話者がまだ話している間も、生の音声を扱います。

技術的な難しさの大部分は、このタイミングの違いにあります。このページでは、音声エージェントの意味、処理の仕組み、構築の難しさ、Cartesiaで構築する二つの方法を説明します。

AI音声エージェントとは

声で会話し、操作を行うソフトウェアです。通話者の発話を文字起こしし、行動を決め、カレンダーや注文システムなどのツールを呼び、結果を声で返します。より広い分類は「会話型AI」であり、音声エージェントはそれをリアルタイムの音声に適用したものです。分類全体については会話型AIの概要をご覧ください。

混同されやすい隣接分野が二つあります。

システム役割違い
プッシュボタン式やメニュー式のIVRメニューを再生して電話を振り分ける言語理解がなく、通話者がメニューに合わせて操作する
テキストのチャットボットテキストを読み書きする生の音声がなく、返答の間に待っても気づかれにくい

音声エージェントは、メニューで想定していない依頼を理解し、通話者が電話を切る前に返答できます。タイミングを外すと、声が重なり、不自然な間ができ、電話を切られます。

音声エージェントの仕組み

ループには四つの段階があります。優れたものは順番に待つのではなく、並行して実行します。

段階役割注意すること
ストリーミング音声認識届く音声を順に文字起こし訛り、電話のコーデック、雑音への精度。ターン検出に必要な無音を捨てない
ターン検出通話者が考えを話し終えたか判断間は「考え中」にも「終了」にもなる。固定タイムアウトは両方を同じに扱う
LLMとツール返答を計画し、カレンダーや注文システムを呼ぶツールの遅れはそのまま通話者の待ち時間になる
音声合成生成しながら返答を音声で送る文全体ができる前に話し始め、割り込みを適切に処理する

通話者が感じるのは、話し終えてから返答が聞こえるまでの一つの時間です。すべての段階が影響します。1秒未満のTTSでもツールが3秒かかれば解決せず、速いLLMでも口座番号を誤認識すれば役に立ちません。測るときはループ全体を測ります。CartesiaのInkは、ターン検出を備えたストリーミング文字起こしで、最初の二段階を一つのモデルで担います。Sonicは第四段階の音声合成で、ブラインド試聴で1位、モデルのレイテンシは90ms未満、40以上の言語に対応します。中間の言語モデルは自社で選べます。

音声エージェントが難しい理由

処理の接続自体は簡単な部分です。エージェントが崩れるのは次の三つの振る舞いです。

ターン交代。 人は完成した文だけを話しません。「住所は……」と言って調べるために止まります。言語をまたいだ会話研究では、人は約200ミリ秒で話す順番を渡します(Stiversほか、2009年)。確実にするため1秒待てばリズムを失い、間にすぐ入れば遮ってしまいます。「考え中」か「終了」かの判断は、それ自体が課題です。音声区間検出とターン検出のガイドで説明しています。

割り込み。 通話者は返答の途中で「やっぱり木曜日にして」と気を変えます。役立つエージェントは話すのを止め、訂正を受け入れ、続けます。テキスト生成に加え、通話者のスピーカーにすでにたまった音声も取り消す必要があり、サーバーと同じくらいクライアント側の問題です。

復旧。 認識器は聞き違え、ツールはタイムアウトします。エージェントには次の行動が必要です。一度確認する、再試行する、通話者が三度繰り返す前に人に転送するなどです。成功する場合しか扱えないエージェントは、失敗が目立ちます。

デモではなく、自分の通話で評価する

ベンダーのデモが動くのは、そのデモ用に作ってあるからです。自分の通話者には、その訛り、電話接続、用語があります。本番を流す前に、録音またはテスト通話をまとめてエージェントに通し、会話を評価してください。

  • 「あと、ええと、二つ目も」のような言い足しまで待てるか。
  • 完全な回答の後、不自然な1秒の沈黙なく返答を始めるか。
  • 通話者が割り込むと、実際に音声が止まるか。
  • 聞き違えたとき、推測せずに確認や転送を行うか。
  • 予約取消や注文変更など重要な操作の前に確認するか。

AIコールセンターの試験導入ガイドでは一つの窓口向けの評価表にし、AI受付ガイドではプロンプトインジェクションも含む受け入れテストを紹介しています。

Cartesiaで構築する二つの方法

Managed Agents(/agents)はループを接続します。LLMを選び、ツールと転送を接続し、ナレッジベースと電話番号を追加できます。下層のストリーミング基盤はCartesiaが動かします。ゼロからテスト可能なエージェントまでを短くする方法です。

APIでは部品を使います。音声にはSonic、ストリーミング文字起こしとターン検出にはInk、中間には自社で選ぶLLMを置き、自分のコードでループを制御します。モデル、実装言語、導入構成を制御したいときに使います。Managed Agentsの紹介では、両方の方法と、それぞれが管理する範囲を説明しています。

どちらも同じモデルを使います。このレイテンシでのストリーミングを可能にする状態空間モデルの構造に基づいていますが、費用を検討するまでは、その構造を意識する必要はありません。

音声エージェントの用途

カスタマーサポート、ヘルプデスク、受付、予約、コールセンターの自動化、キャラクターや玩具の対話体験などです。Decagon、ServiceNow、Quora、Retell、EliseAIはCartesiaで音声製品を構築しています。詳細は導入事例をご覧ください。

関連ガイド

よくある質問

AI音声エージェントとは何ですか?

音声で会話し、操作を行うソフトウェアです。通話者の声を聞き、目的を理解し、依頼に必要なツールを呼び出し、リアルタイムに声で答えます。会話型エージェントを生の音声に適用したもので、そのタイミングに合わせる必要があります。

AI音声エージェントはどう動きますか?

四つの部分で構成します。ストリーミング音声認識が発話中に文字起こしし、ターン検出が終了を判断し、言語モデルが返答を計画してツールを呼び、音声合成が回答を音声で返します。各段階は並行して動くため、体感する遅れは一つのモデルの時間ではなく、ループを通る遅い経路の合計です。

どれだけ速く応答する必要がありますか?

機械だと意識させない速さが必要です。人は約200ミリ秒で会話の順番を交代し、1秒以上の間はためらいに感じられます。実際には1秒を十分下回る時間で返答を始めるべきです。Sonicは生成中に音声を送り、モデルのレイテンシは90ms未満です。音声生成は通常、時間配分の小さな部分で、LLMと通信の方が大きくなりがちです。

最適なAI音声エージェント基盤はどれですか?

用途によります。ブラインド試聴での声の評価、全体の応答時間、割り込みと未完の文への対応、ツール呼び出し、電話連携、通話量に応じた価格、オンプレミスなどの導入方法を確認します。契約前に候補で自分の通話を試してください。ベンダーのベンチマークは出発点であり、最終判断ではありません。

無料のAI音声エージェントはありますか?

CartesiaのモデルはPlaygroundで無料で試せます。Managed Agentsも、利用を決める前に設定してテスト通話できます。継続的な通話は従量課金です。現在のプランと利用枠は料金ページを確認してください。