知っておきたい音声AIの概念
エージェントが不適切なタイミングでユーザーを遮ったら、音声認識、STTの問題でしょうか。音声区間検出、VADの問題でしょうか。それとも、音声合成、TTSの生成を途中で止めなかったのでしょうか。
三つは異なる問題で、修正方法も違います。パイプライン内の場所も別です。
会話らしい音声AIの開発が、STTやTTSのモデルを選ぶだけより難しいのは、そのためです。
Cartesiaは、人が自分を表現し、理解されるためのAIを開発しています。
理解は、共通の言葉から始まります。
この記事では、会話型AIエージェントを理解し、調べ、考えるための用語を紹介します。数日おきに公開されるように見えるベンチマークも、読み解きやすくなるでしょう。
文脈をつかみやすいように、用語を分野別にまとめました。特にAIでは、文脈が重要です。
音声処理の基本パイプライン
-
STT、Speech-to-Text。入力された音声をテキストに変換することです。実際には、自動音声認識のASRと同じ意味で使われることが多くあります。
電話でメッセージを音声入力するときも、STTやASRを使っています。
人とAIが自然に双方向で会話する会話型音声AIでは、人からシステムに伝える唯一の経路ですが、全体の一部分にすぎません。
CartesiaのSTTモデルInkはこちらで無料で試せます。電話番号、日付、一文字ずつ読むメールアドレスなどで、性能を試してください。
-
VAD、Voice Activity Detection。音声区間検出のモデルは専門の分類モデルであり、文字起こしをするSTTそのものとは異なります。入力信号の無音と音、さらに背景音と発話を区別します。
音声信号を絞り込んで発話を切り出し、それをASRに渡して文字起こしします。
Cartesiaの最新のInk-2 STTは、内部でターン検出を行います。ユーザーが話しているかを知るためだけに別のVADを評価、統合、保守する必要がなく、パイプラインを単純にできます。
-
ターン検出。エンドポインティングとも呼ばれますが、APIのエンドポイントと紛らわしいため、ここではターン検出と呼びます。
発信者が話し始めた、話し終えた、話を再開したことを正確に検出する能力です。間を置いているのか、考えているのか、一時的に気がそれたのか、長く息を吸っているのかは判断しにくく、予想以上に難しいものです。
音声エージェントの使い心地を左右します。人が話し終えたと早合点すると、不快な割り込みが起きます。判定が雑で遅ければ、貴重な数ミリ秒が積み重なり、不自然な間の多い会話になります。
信頼できないVADと、早すぎる発話終了の判定が組み合わさると、ユーザーは一言も話させてくれないAIに相手をされていると感じるでしょう。
弱いターン検出は自然な会話の流れを壊し、文字起こしの誤りを生み、それが後続の処理に蓄積して悪影響を与えます。
従来は、無音の長さなどの代理の信号から終了を判断していました。CartesiaのInk-2のような最近の先端モデルは、モデル自体にターン検出を組み込んでいます。
-
TTS、Text-to-Speech。STTの逆で、テキストを合成音声に変換します。STTより主観的な要素が多く、後ほど説明します。
TTSは数十年前から存在します。以前は機械的に聞こえましたが、現在の優れたモデルは非常に自然です。Cartesiaの先端TTSモデルSonicをこちらで無料で試せます。
会話型音声AIの機能
-
Barge-in。割り込み対応とも呼ばれ、会話型音声AIで非常に重要です。
企業向けの会話型AIは、チャットボットにSTTとTTSをつなぐだけではありません。予測しにくく、環境、地域、品質に大きなばらつきがある人の会話を扱う必要があります。
Barge-inは、ユーザーが割り込んだときにAIの発話を止めます。そのためには、ユーザーの発話の開始や再開を上流のSTTやVADで検出し、TTSに伝えなければなりません。
ターン検出だけでは足りません。複数のモデルと、それらを連携させる実行基盤を慎重に設計する必要があります。
STTのターン検出が発話の開始や再開をイベントとして出すと、連携層は直ちにTTSのストリームを無音にします。簡単ではありませんが、モデルと連携を適切に設計すれば十分に実現できます。
Cartesiaは音声エージェントの連携にイベント駆動の構成を使い、システムが各イベントを観測して適切に対応できるようにしています。
-
音声の分離と雑音の低減。周囲の雑音を減らしたり、背景の会話から対象の会話を切り出したりする専用モデルがあります。オフィス、カフェ、空港、コールセンター、病院など、人の多い場所で使うエージェントに重要です。難しい課題でもあり、モデルによって対応能力が異なります。
CartesiaのInk-2 ASRでは、この点に特に力を入れました。企業の会話型エージェントは、スタジオとは程遠い、周囲の音がある活動で使われることが多いためです。
声の特徴
声の特徴は重要ですが、非常に主観的なものです。ある俳優の声がよいかどうかで友人と意見が合わないのも、そのためです。
声の調子や感情などについて、よい例と好ましくない例を英語の音声で聴いてみましょう。
自然な韻律(英語)
平坦な韻律(英語)
自然な感情表現(英語)
過剰な感情表現(英語)
好ましい特徴よりも、好ましくない特徴のほうが見つけやすいものです。各特徴に注意を向けると、多すぎるか少なすぎるかを感じ取れ、用途に合う声か判断しやすくなります。
-
韻律、Prosody。声の高さであるイントネーション、音量、長さ、タイミング、速さをまとめた、話し方の特徴です。声を分析するための属性と技術的な特徴が組み合わさっています。
音量やタイミングはわかりやすいので、イントネーションを補足します。
イントネーションは、話している間の声の上がり下がりです。疑問か断定か、続きか終わりか、強調か中立かを伝えます。たとえば文末で声が上がると、一般に質問を表します。
韻律は、言葉そのものに意味と影響を加えます。学校での聞き取りで「ジョニーが犬をかんだの?」と言うのと、「ジョニーが犬をかんだ!」と言うのでは、反応は大きく異なるでしょう。
-
感情表現。韻律の効果なので、韻律と関係します。韻律は感情と意味を伝え、人は声の感情を敏感に検出し、分類します。音声AIの感情表現は、用途に合っている必要があります。
-
音色、Timbre。音の質感です。声では、温かい、豊か、暗い、ビロードのよう、といった形容に表れます。鼻にかかった歌声や、かすれた歌声もあります。音色は、個性、感情への響き、重み、信頼感などを声に与えます。
-
速さとペース。Eminemが1分で何語ラップできるかだけではありません。もう一つ重要なのがペースです。全体の話すリズム、間の位置と長さを指します。よいペースは聞き取りやすく、句読点に自然に合う間をつくります。
-
ボーカルフライ。空気が声帯をゆっくり脈打つように通るときに生じる、低い周波数のきしむような振動です。人は文末などで自然にこの声を出すため、現実らしさに役立ちます。
ただしAIでは難しい調整が必要です。ASRは背景音や無音と解釈することがあります。一方、TTSの学習で多すぎると、雑音として働き、不自然な音を出すモデルになります。
目標は自然なバランスです。機械的な声を避ける程度には含めつつ、声を乱したり、聞き取りにくくしたりしないことです。
-
ローカライズ、方言、発音。信頼されるTTSには、現地の人らしく聞こえる声が必要です。一般的なアクセントだけでは足りず、地域に応じて略語、日付、通貨を正しく解釈する正規化も必要です。「12/01」が1月12日か12月1日か、「Sr.」が「Senior」か「Señor」か、という違いです。
正規化は意味の層です。音の層には、アクセント、発音、明瞭さがあります。正規化が正しくても、ムンバイやダブリンの聞き手には不自然に聞こえることがあります。固有名詞、ブランド名、専門用語を誤って発音すると、ブランドの個性や聞き手の信頼が損なわれます。
高品質なエージェントは、話す相手に合わせ、内容と聞こえ方の両方を正しくする必要があります。次はヒングリッシュの音声例です。
-
相づち、Backchanneling。「うん」「そうですね」「わかりました」など、会話についていっていることを示す小さな言葉です。
発話の順番を取るものではなく、理解を示す短い手掛かりです。
会話型AIでは双方向に働きます。TTSは、機械的でよそよそしく聞こえないよう適切な時に相づちを打ち、ASRはそれを割り込みと誤解せず、相づちとして認識する必要があります。
「うん」を割り込みと誤認したり、聴いているという合図を一度も返さなかったりすると、システムが正しく動作していても、壊れているように感じます。
性能の指標
-
入力テキストへの忠実さ、Transcript Following。TTSの音声が入力テキストにどれだけ忠実かを測ります。高度なモデルでも、存在しない語を足す幻覚や、句全体を落とす省略が起こります。生成音声が不明瞭になったり、台本から外れた奇妙な発音をしたりしないかも評価します。
忠実さが低いモデルは、意味の正確さが欠かせない法律や医療の読み上げには使えません。
-
英数字の扱い。電話番号、追跡ID、日付、メールアドレスなど、辞書にないデータをどれだけ確実に話せるかを測ります。
正規化が基礎になります。「12/01」が月日か日月かをまず正しく解釈し、それを正確に音声化する必要があります。電話番号を一桁ずつでなく大きな整数として読むと違和感が生じ、特に医療、金融、物流など、専門的で影響の大きい場面で問題になります。
-
RTF、Real-Time Factor。STTでは、一定の長さの入力音声からテキストを生成する速度です。処理時間を入力音声の長さで割ります。
1分、つまり60秒の録音の文字起こしに30秒かかればRTFは0.5で、実時間より速いことになります。RTFが1なら処理時間と音声の長さが同じです。1を超えると実時間より遅く、遅れが生じます。
TTSでは少し異なり、入力テキストから音声を生成する時間を使います。
| STT/ASR | TTS |
|---|---|
| 入力は音声、出力はテキスト。 | 入力はテキスト、出力は音声。 |
| RTF = 文字起こし時間 / 入力音声の長さ | RTF = 音声合成時間 / 生成音声の長さ |
-
TTFS、Time To Final Segment。実際の会話で動く音声AIエージェントでは、ASRのRTFだけでは細かさが足りません。
重要なのは、最後のセグメントまでの時間TTFSです。文字起こし完了までの時間TTCTとも呼びます。ユーザーが発話を終えた瞬間から、STTが確定した完全なテキストを出し、LLMが処理できるようになるまでの間を測ります。
最初のテキストの塊が来るまでを測る、別のTTFS、Time to First Segmentとは異なります。TTCTは文字起こし全体が終わる時点です。会話型エージェントでは、TTCTが終わるまで後続処理が動けないため、最後のセグメントが重要な受け渡しの地点です。
-
TTFB、Time to First Byte。TTSの反応の速さを測ります。テキストが届いてから、最初の音声データのバイトを返し始めるまでの時間です。
自然な会話に感じられる基準は、以前は300ms未満でした。それより長いと、トランシーバーのような不自然な遅れが生じます。
CartesiaのSonic 3モデルは、さらに短い40〜90msを実現しています。約100msの人のまばたきより速い数値です。
これがリアルタイムの対話を実現します。
-
MOS、Mean Opinion Score。自然さ、信頼感、用途への適合といった声の品質には、強い主観性があります。瞑想アプリで高評価の声も、医療のトリアージでは不適切かもしれません。そのためにMOSがあります。従来は人の試聴パネルで評価しましたが、最近はAIモデルで得点を予測することもあります。
MOSは、人の聞き手が1〜5の尺度でつけた得点の平均です。主観性を一定の形式で採点し、想定する相手の期待や好みに沿って評価します。
対象者の文脈と用途に照らしてモデルを評価できるため、品質が文脈や用途に強く依存する会話型音声AIに特に適しています。
-
STTの単語誤り率、STT WER。文字起こしの中で、誤って認識した単語の割合を文字どおりに測ります。この厳密さが重要な場合もあります。
ただし会話型エージェントでは、STT WERは実際の価値に結びつかない指標になることもあります。
現代のLLMは行間を読むのが得意なので、100%役立つために100%正確な文字起こしが必要とは限りません。「gonna」と「going to」を同じように扱えます。
より有用なのは、意味に基づく_WERです。「ええと」「ああ」や読点の位置を一つずつ採点するのではなく、ユーザーの意図_をどれだけ伝えているかを測ります。
文字どおりのWERを重視しすぎると、レイテンシも増えることがあります。意味に基づくWERは、AIが実際に意図を理解し、応じられたかに注目するため有用です。
-
TTSの単語誤り率、TTS WER。TTSでは、元のテキストに対して音声をどれだけ正しく生成したかを測ります。テキストを対応する話し言葉として正しく発音したか、複雑な発音を扱えたか、語を勝手につくったり抜かしたりしなかったかを含みます。
本当に_会話できる_AIには、高速な音声モデルをLLMにつなぐ以上の層があります。人の会話は不規則で、雑音があり、予測できません。効果的な音声AIは、品質、正確さ、速度を大きく損なわず、技術と人の特性のバランスを取る仕事です。
Cartesiaは、会話の全体を慎重に設計し、細かく制御することから、音声AIの力を引き出せると考えています。この方針は状態空間モデル、SSMの設計、学習、開発、評価、導入に組み込まれています。各層を意図的に組み合わせ、トレードオフ、事業の成果、用途の目標、技術の品質を十分に考える必要があります。
自然で信頼でき、人間らしい声を見つけるお手伝いをします。business@cartesia.aiまでご連絡ください。
