AI音声エージェントは電話を取り、通話者の要望を聞き、予約、注文照会、質問への回答、行き詰まる前の人への引き継ぎを行います。チャットボットは読み書きでこの仕事をします。音声エージェントは、通話者がまだ話している間も、生の音声を扱います。
技術的な難しさの大部分は、このタイミングの違いにあります。このページでは、音声エージェントの意味、処理の仕組み、構築の難しさ、Cartesiaで構築する二つの方法を説明します。
AI音声エージェントとは
声で会話し、操作を行うソフトウェアです。通話者の発話を文字起こしし、行動を決め、カレンダーや注文システムなどのツールを呼び、結果を声で返します。より広い分類は「会話型AI」であり、音声エージェントはそれをリアルタイムの音声に適用したものです。分類全体については会話型AIの概要をご覧ください。
混同されやすい隣接分野が二つあります。
| システム | 役割 | 違い |
|---|---|---|
| プッシュボタン式やメニュー式のIVR | メニューを再生して電話を振り分ける | 言語理解がなく、通話者がメニューに合わせて操作する |
| テキストのチャットボット | テキストを読み書きする | 生の音声がなく、返答の間に待っても気づかれにくい |
音声エージェントは、メニューで想定していない依頼を理解し、通話者が電話を切る前に返答できます。タイミングを外すと、声が重なり、不自然な間ができ、電話を切られます。
音声エージェントの仕組み
ループには四つの段階があります。優れたものは順番に待つのではなく、並行して実行します。
| 段階 | 役割 | 注意すること |
|---|---|---|
| ストリーミング音声認識 | 届く音声を順に文字起こし | 訛り、電話のコーデック、雑音への精度。ターン検出に必要な無音を捨てない |
| ターン検出 | 通話者が考えを話し終えたか判断 | 間は「考え中」にも「終了」にもなる。固定タイムアウトは両方を同じに扱う |
| LLMとツール | 返答を計画し、カレンダーや注文システムを呼ぶ | ツールの遅れはそのまま通話者の待ち時間になる |
| 音声合成 | 生成しながら返答を音声で送る | 文全体ができる前に話し始め、割り込みを適切に処理する |
通話者が感じるのは、話し終えてから返答が聞こえるまでの一つの時間です。すべての段階が影響します。1秒未満のTTSでもツールが3秒かかれば解決せず、速いLLMでも口座番号を誤認識すれば役に立ちません。測るときはループ全体を測ります。CartesiaのInkは、ターン検出を備えたストリーミング文字起こしで、最初の二段階を一つのモデルで担います。Sonicは第四段階の音声合成で、ブラインド試聴で1位、モデルのレイテンシは90ms未満、40以上の言語に対応します。中間の言語モデルは自社で選べます。
音声エージェントが難しい理由
処理の接続自体は簡単な部分です。エージェントが崩れるのは次の三つの振る舞いです。
ターン交代。 人は完成した文だけを話しません。「住所は……」と言って調べるために止まります。言語をまたいだ会話研究では、人は約200ミリ秒で話す順番を渡します(Stiversほか、2009年)。確実にするため1秒待てばリズムを失い、間にすぐ入れば遮ってしまいます。「考え中」か「終了」かの判断は、それ自体が課題です。音声区間検出とターン検出のガイドで説明しています。
割り込み。 通話者は返答の途中で「やっぱり木曜日にして」と気を変えます。役立つエージェントは話すのを止め、訂正を受け入れ、続けます。テキスト生成に加え、通話者のスピーカーにすでにたまった音声も取り消す必要があり、サーバーと同じくらいクライアント側の問題です。
復旧。 認識器は聞き違え、ツールはタイムアウトします。エージェントには次の行動が必要です。一度確認する、再試行する、通話者が三度繰り返す前に人に転送するなどです。成功する場合しか扱えないエージェントは、失敗が目立ちます。
デモではなく、自分の通話で評価する
ベンダーのデモが動くのは、そのデモ用に作ってあるからです。自分の通話者には、その訛り、電話接続、用語があります。本番を流す前に、録音またはテスト通話をまとめてエージェントに通し、会話を評価してください。
- 「あと、ええと、二つ目も」のような言い足しまで待てるか。
- 完全な回答の後、不自然な1秒の沈黙なく返答を始めるか。
- 通話者が割り込むと、実際に音声が止まるか。
- 聞き違えたとき、推測せずに確認や転送を行うか。
- 予約取消や注文変更など重要な操作の前に確認するか。
AIコールセンターの試験導入ガイドでは一つの窓口向けの評価表にし、AI受付ガイドではプロンプトインジェクションも含む受け入れテストを紹介しています。
Cartesiaで構築する二つの方法
Managed Agents(/agents)はループを接続します。LLMを選び、ツールと転送を接続し、ナレッジベースと電話番号を追加できます。下層のストリーミング基盤はCartesiaが動かします。ゼロからテスト可能なエージェントまでを短くする方法です。
APIでは部品を使います。音声にはSonic、ストリーミング文字起こしとターン検出にはInk、中間には自社で選ぶLLMを置き、自分のコードでループを制御します。モデル、実装言語、導入構成を制御したいときに使います。Managed Agentsの紹介では、両方の方法と、それぞれが管理する範囲を説明しています。
どちらも同じモデルを使います。このレイテンシでのストリーミングを可能にする状態空間モデルの構造に基づいていますが、費用を検討するまでは、その構造を意識する必要はありません。
音声エージェントの用途
カスタマーサポート、ヘルプデスク、受付、予約、コールセンターの自動化、キャラクターや玩具の対話体験などです。Decagon、ServiceNow、Quora、Retell、EliseAIはCartesiaで音声製品を構築しています。詳細は導入事例をご覧ください。