알아두어야 할 음성 AI 개념
음성 에이전트가 잘못된 순간에 사용자의 말을 끊으면 음성 인식(STT)의 문제일까요? 음성 활동 감지(VAD)의 문제일까요? 아니면 음성 합성 모델의 생성을 중간에 멈추지 못한 것일까요?
이 셋은 서로 다르고 해결 방법도 다릅니다. 파이프라인에서 위치하는 곳도 다릅니다.
그래서 실제로 대화할 수 있는 음성 AI 에이전트를 만드는 일은 STT나 TTS 모델 하나를 고르는 것보다 훨씬 어렵습니다.
Cartesia는 사람들이 자신을 표현하고 이해받을 수 있도록 AI를 만듭니다.
이해의 시작은 공통의 어휘입니다.
이 글은 대화형 AI 에이전트를 이해하고 탐색하고 논의하는 데 필요한 용어를 설명합니다. 며칠마다 나오는 듯한 벤치마크 결과를 이해하는 데도 도움이 될 것입니다!
맥락을 파악하기 쉽도록 용어를 주제별로 묶었습니다. 특히 AI에서는 맥락이 중요하니까요.
기본 음성 파이프라인
-
STT(Speech-to-Text, 음성 인식). 입력된 음성을 텍스트로 변환하는 것입니다. 실무에서는 STT와 ASR(Automatic Speech Recognition, 자동 음성 인식)을 같은 뜻으로 쓰는 경우가 많습니다.
휴대전화에 말로 문자 메시지를 입력할 때마다 STT 또는 ASR을 사용하는 것입니다.
사람과 AI가 자연스럽게 양방향으로 대화하는 대화형 음성 AI에서 이것은 사람이 시스템에 정보를 전달하는 유일한 통로이지만 전체 과정의 일부입니다.
Cartesia의 Ink STT 모델을 여기에서 무료로 사용해 볼 수 있습니다. 전화번호, 날짜, 철자를 하나씩 읽는 이메일 주소 등을 입력하여 모델의 한계를 시험해 보세요!
-
VAD(Voice Activity Detection, 음성 활동 감지). VAD 모델은 전문 분류 모델이며 STT 전사 모델 자체와는 다릅니다. VAD는 다음을 구분합니다.
-
입력 신호의 무음과 소리
-
배경 소리와 발화
VAD 모델은 시스템에 들어오는 오디오 신호를 걸러 발화를 분리하도록 설계됩니다. 분리한 발화를 ASR 모델에 보내 전사합니다.
Cartesia의 최신 Ink-2 STT 모델은 발화 차례 감지를 내부적으로 처리합니다. 사용자가 말하는 순간을 감지하려고 별도 VAD 모델을 평가하고 통합하고 유지할 필요가 없어 음성 에이전트 파이프라인이 단순해집니다.
-
-
발화 차례 감지(Turn Detection). 흔히 엔드포인팅이라고 부르지만 API 엔드포인트와 혼동할 수 있어 여기서는 발화 차례 감지라고 하겠습니다.
통화자가 발화를 시작했는지, 끝냈는지, 다시 이어 말하는지 정확하게 판단하는 능력입니다. 잠깐 쉬는 것인지, 생각 중인지, 잠시 주의가 분산되었는지, 길게 숨을 쉬는 것인지 구별하기 어려워 예상보다 까다롭습니다.
발화 차례 감지는 음성 에이전트 UX에 중요합니다. 사람이 말을 끝냈다고 너무 빨리 판단하면 짜증 나는 끼어들기가 발생합니다. 반대로 감지가 부정확하고 늦으면 귀중한 밀리초가 지연시간에 더해져 어색한 공백이 많은 부자연스러운 대화가 됩니다.
신뢰할 수 없는 VAD에 성급한 발화 종료 감지가 더해지면, 사용자는 자신의 말을 계속 끊으며 말할 틈을 주지 않는 AI와 대화한다고 느낄 수 있습니다.
따라서 부실한 발화 차례 감지는 자연스러운 대화 흐름을 망가뜨리고, 전사 오류가 누적되어 음성 AI 파이프라인의 후속 동작에도 영향을 줄 수 있습니다.
기존 VAD와 발화 차례 감지 시스템은 정지 시간 같은 간접 신호로 사용자의 발화 종료를 계산했습니다. 하지만 Cartesia의 Ink-2 같은 최근 모델은 발화 차례 감지를 모델 안에 통합합니다.
-
TTS(Text-to-Speech, 음성 합성). STT의 반대로 텍스트를 합성 음성으로 변환합니다. TTS에는 STT보다 주관적인 요소가 훨씬 많으며 곧 설명하겠습니다.
TTS는 수십 년 전부터 존재했습니다. 예전에는 로봇처럼 들렸지만 요즘 좋은 TTS 모델은 매우 자연스럽습니다. Cartesia의 Sonic TTS 모델을 여기에서 무료로 사용해 보세요!
대화형 음성 AI 기능
-
끼어들기(Barge-in). 흔히 인터럽션 처리라고 부르며 대화형 음성 AI에서 매우 중요합니다.
기업용 대화형 AI는 챗봇에 STT와 TTS 모델을 연결하는 것보다 훨씬 많은 기능을 요구합니다. 음성 에이전트는 예측하기 어렵고 환경, 지역, 품질의 편차가 큰 실제 사람의 대화를 처리해야 합니다.
끼어들기는 사용자가 AI의 말을 끊으면 AI가 발화를 멈추도록 합니다. 이를 위해 TTS 모델은 사용자가 발화를 시작하거나 다시 이어 말한다는 사실을 알아야 합니다. 이 이벤트는 파이프라인 앞부분의 STT나 VAD 모델이 감지하고 처리해야 합니다.
끼어들기 처리에는 발화 차례 감지만으로 부족합니다. 모델과 여러 모델을 조정하는 음성 에이전트 실행 환경을 신중히 설계해야 합니다.
STT 모델의 발화 차례 감지가 사용자의 발화 시작 또는 재개 이벤트를 내보내면 오케스트레이션 계층은 즉시 TTS 스트림을 음소거해야 합니다. 간단하지 않지만 모델과 오케스트레이션을 잘 설계하면 충분히 구현할 수 있습니다.
Cartesia는 음성 에이전트를 조정할 때 이벤트 기반 아키텍처를 사용합니다. 시스템이 각 이벤트를 관측하고 적절하게 대응할 수 있습니다.
-
음성 분리와 잡음 감소. 일부 모델은 주변 잡음을 줄이거나 배경 대화에서 진행 중인 대화를 분리합니다. 사무실, 카페, 공항, 콜센터, 병원 등 사람이 많은 시끄러운 환경에서 사용하는 음성 에이전트에 중요합니다. 해결하기 어려운 문제이기도 하며 모델별로 처리 능력이 다릅니다.
Cartesia의 Ink-2 ASR 모델은 이 부분에 특히 집중했습니다. 기업의 대화형 음성 에이전트 활용 환경은 스튜디오와 거리가 멀고 주변 소음이 있는 경우가 많기 때문입니다.
목소리의 특성
목소리 특성은 중요하지만 매우 주관적일 수 있습니다. 배우의 목소리가 좋은지를 두고 친구와 의견이 다르다면 특성 평가에 주관성이 개입하기 때문입니다.
아래는 어조와 감정 표현 등을 기준으로 좋은 목소리와 그렇지 않은 목소리를 비교하는 예시입니다. 녹음은 원래 언어를 유지합니다.
자연스러운 운율
단조로운 운율
자연스러운 감정 표현
과도한 감정 표현
들어보면 바람직한 특성보다 바람직하지 않은 특성을 더 쉽게 알아차릴 수 있습니다. 각 특성에 주의를 기울이면 과하거나 부족한 정도를 파악할 수 있고, 목소리가 용도에 맞는지 판단하는 데 도움이 됩니다.
-
운율(Prosody). 목소리의 높낮이인 억양, 크기, 지속 시간, 타이밍과 속도, 즉 말을 “어떻게” 하는지라고 이해하면 좋습니다. 목소리를 분석하는 여러 속성과 기술적 특성의 조합입니다.
크기와 타이밍은 이해하기 쉽지만 억양은 설명이 더 필요합니다.
억양은 말할 때 목소리가 오르내리는 방식입니다. 질문인지 진술인지, 이어지는 말인지 끝맺음인지, 강조인지 중립인지 알아차리는 단서가 됩니다. 예를 들어 문장 끝의 높아지는 음은 대체로 질문을 나타냅니다.
운율은 문자 그대로의 말에 의미와 효과를 더합니다. 학교에서 사건을 조사할 때 “조니가 개를 물었다고?”와 “조니가 개를 물었다고!”는 전혀 다른 반응을 일으킬 수 있습니다.
-
감정 표현. 운율의 효과이므로 운율과 관련이 있습니다. 운율은 감정과 의미를 전달하며 사람은 목소리의 감정을 감지하고 분류하는 데 매우 민감합니다. 음성 AI에서는 표현되는 감정이 용도에 맞아야 합니다.
-
음색(Timbre). 소리의 질감입니다. 목소리를 설명하는 형용사를 떠올리면 됩니다. 라디오 진행자는 따뜻하고 풍부하거나 낮고 부드러운 목소리를 낼 수 있습니다. 어떤 가수는 콧소리가 나고 다른 가수는 거친 소리가 납니다. 음색은 목소리에 정체성, 감정적 울림, 무게감, 신뢰 등을 부여합니다.
-
속도와 페이싱. Eminem이 1분에 몇 단어를 랩하는지에 관한 것만은 아닙니다. 목소리의 속도에는 페이싱이라는 또 다른 중요한 측면이 있습니다. 전체적인 말의 리듬과 쉼의 위치 및 길이입니다. 좋은 페이싱은 문장 부호에 자연스럽게 맞는 쉼으로 내용을 따라가기 쉽게 만듭니다.
-
보컬 프라이(Vocal Fry). 성대를 통해 공기가 천천히 진동하며 지나갈 때 생기는 낮은 주파수의 삐걱거리는 소리입니다. 사람은 문장 끝에서 자연스럽게 이런 소리를 내므로 사실감을 높이는 데 유용합니다.
하지만 AI에서는 섬세한 균형이 필요합니다. ASR 모델은 보컬 프라이를 배경 잡음이나 무음으로 해석하기도 합니다. TTS 학습에서는 과도한 프라이가 잡음으로 작용해 결함 있는 출력을 만들 수 있습니다.
목표는 자연스러운 균형입니다. 로봇처럼 들리지 않을 만큼은 있어야 하지만 목소리를 뭉개거나 이해도를 떨어뜨릴 만큼 많아서는 안 됩니다.
-
현지화, 방언, 발음. 효과적인 TTS는 현지인처럼 들려야 신뢰를 얻습니다. 일반적인 억양을 넘어 지역에 맞게 약어, 날짜, 통화를 해석하는 정규화 능력이 필요합니다. “12/01”이 1월 12일인지 12월 1일인지, “Sr.”이 “Senior”인지 “Señor”인지 구별하는 것이 예입니다.
정규화는 의미의 계층입니다. 억양, 발음, 명료도라는 음성적 계층도 있습니다. 정규화를 정확히 해도 뭄바이나 더블린의 청자에게 어색하게 들릴 수 있습니다. 고유명사, 브랜드명, 전문 용어의 잘못된 발음은 브랜드의 인상을 깨뜨리고 청자의 신뢰에 영향을 줍니다.
좋은 음성 에이전트는 특정 청중에 맞게 말의 내용과 소리 모두를 정확하게 구현해야 합니다. 다음 예시를 들어보세요. 녹음은 원래 언어를 유지합니다.
-
맞장구(Backchanneling). “음”, “맞아요”, “알겠어요”, “네”처럼 대화를 따라가고 있음을 나타내는 짧은 말입니다.
이것은 대화 차례가 아니라 확인과 작은 신호입니다.
대화형 AI에서 맞장구는 양방향으로 작동합니다. TTS는 로봇처럼 무심하게 들리지 않도록 적절한 순간에 맞장구를 생성해야 합니다. ASR은 이를 끼어들기가 아닌 맞장구로 정확하게 해석해야 합니다.
“음”을 끼어들기로 잘못 알아듣거나 듣고 있다는 신호를 전혀 주지 않는 에이전트는 시스템이 정상 작동하더라도 고장 난 것처럼 느껴집니다.
성능 지표
-
입력 원문 준수(Transcript Following). TTS 발화가 입력 텍스트에 얼마나 충실한지 측정합니다. 고급 모델도 없는 단어를 추가하는 환각을 일으키거나 구절 전체를 누락할 수 있습니다. 정확도에는 발음이 뭉개지거나 의도한 대본에서 벗어난 이상한 발음이 생기는지도 포함됩니다.
원문 충실도가 낮은 음성 모델은 의미의 정확성이 중요한 법률 또는 의료 문서 낭독에 사용할 수 없습니다.
-
영숫자 처리. 전화번호, 추적 ID, 날짜, 이메일 주소처럼 사전에 없는 데이터를 얼마나 안정적으로 읽는지 평가합니다.
정규화가 기반입니다. 먼저 “12/01”이 MM-DD인지 DD-MM인지 형식을 정확히 해석한 뒤 음성으로 정확하게 출력해야 합니다. 전화번호를 한 자리씩 읽지 않고 큰 정수로 읽으면 어색합니다. 의료, 금융, 물류 같은 전문적이거나 중요한 상황에서는 특히 그렇습니다.
-
RTF(Real-Time Factor, 실시간 계수). STT에서는 주어진 길이의 입력 오디오에서 텍스트를 생성하는 속도입니다. 처리 시간을 입력 오디오 길이로 나누어 계산합니다.
예를 들어 1분인 60초 녹음을 전사하는 데 30초가 걸리면 RTF는 0.5로 실시간보다 빠릅니다. RTF = 1이면 처리 시간과 오디오 길이가 같아 정확히 실시간입니다. RTF > 1이면 실시간보다 느리므로 STT 처리가 뒤처집니다.
TTS에서는 입력 텍스트로부터 오디오를 생성하는 시간이므로 실시간 계수가 조금 다릅니다.
| STT/ASR | TTS |
|---|---|
| 입력은 오디오, 출력은 텍스트입니다. | 입력은 텍스트, 출력은 오디오입니다. |
| RTF = 전사 시간 / 입력 오디오 길이 | RTF = 음성 합성 시간 / 생성된 음성 길이 |
-
TTFS(Time To Final Segment, 최종 세그먼트까지의 시간). 실시간 대화에서 음성 AI 에이전트를 사용하려면 ASR 모델의 RTF만으로는 충분히 세밀하게 측정할 수 없습니다.
중요한 것은 TTFS입니다. TTCT(Time to Complete Transcript, 전사 완료까지의 시간)라고도 합니다. 사용자가 발화를 끝낸 순간부터 STT 모델이 확정된 전체 전사, 즉 LLM이 처리할 준비가 된 텍스트를 출력할 때까지의 간격입니다.
첫 텍스트 청크가 도착하는 시점만 측정하는 다른 TTFS인 Time to First Segment와 구분해야 합니다. TTCT는 전체 전사가 끝나는 시점을 측정합니다. 대화형 에이전트에서는 TTCT가 완료되어야 후속 처리가 시작되므로 최종 세그먼트가 의미 있는 인계 지점입니다.
-
TTFB(Time to First Byte, 첫 바이트까지의 시간). TTS 모델의 반응성을 측정합니다. 텍스트 입력이 모델에 도착한 시점부터 음성 오디오의 첫 바이트를 스트리밍하기 시작하는 시점까지의 시간입니다.
자연스러운 대화를 위해 한때 300ms 미만의 TTFB가 기준이었습니다. 이보다 길면 무전기처럼 어색한 지연이 생깁니다.
Cartesia는 이를 더 줄였습니다. Sonic 3 모델은 40~90ms로, 사람이 눈을 깜빡이는 약 100ms보다 빠릅니다.
실시간 대화를 실제로 구현하는 속도입니다.
-
MOS(Mean Opinion Score, 평균 의견 점수). 자연스럽고 신뢰할 만하며 상황에 적합한 목소리인지에 대한 사람의 판단에는 강한 주관성이 있어 사용하는 지표입니다. 명상 앱에서 높은 점수를 받는 목소리가 의료 분류 에이전트에는 맞지 않을 수 있습니다. 전통적으로 사람이 직접 듣고 평가했지만 현대 음성 AI 작업 흐름에서는 AI 모델로 점수를 예측하기도 합니다.
MOS는 사람이 매긴 1~5점 평가의 평균입니다. 주관성을 체계적으로 점수화하고 대상 청중의 구체적인 기대와 선호에 맞춰 목소리를 평가합니다.
MOS는 대상 청중의 맥락과 용도별 기대에 맞춰 음성 모델을 평가하는 틀을 제공합니다. 품질이 맥락과 용도에 크게 좌우되는 대화형 음성 AI에서 특히 유용합니다.
-
STT 단어 오류율(STT WER). STT 전사에서 잘못 옮겨진 단어의 비율을 문자 그대로 측정합니다. 이런 정확성이 중요한 경우도 있습니다.
하지만 대화형 음성 에이전트에서는 STT WER가 겉보기만 좋은 지표일 수 있습니다.
현대 LLM은 맥락을 추론하는 데 뛰어나므로 전사가 100% 정확하지 않아도 100% 효과적으로 작동할 수 있습니다. 예를 들어 “gonna”와 “going to”를 같은 뜻으로 처리합니다.
더 유용한 지표는 의미 기반 WER입니다. “음”, “아”나 쉼표 하나하나를 채점하기보다 전사가 사용자의 의도를 얼마나 잘 전달하는지 측정합니다.
문자 그대로의 WER를 지나치게 중시하면 시스템 지연시간도 늘어날 수 있습니다. 의미 기반 WER는 AI가 사용자의 의도를 실제로 이해하고 처리하는지에 초점을 맞추므로 더 유용합니다.
-
TTS 단어 오류율(TTS WER). TTS에서는 원본 텍스트와 비교해 음성을 얼마나 정확히 생성했는지 측정합니다. 주어진 텍스트를 해당 발화로 정확히 표현했는지, 복잡한 발음을 잘 처리했는지, 없는 단어를 만들거나 단어를 빠뜨렸는지 포함합니다.
이처럼 실제로 대화하는 AI를 만드는 일에는 빠른 음성 모델을 LLM에 연결하는 것보다 훨씬 많은 계층이 있습니다. 사람의 대화는 복잡하고 시끄러우며 예측하기 어렵습니다. 효과적인 음성 AI 에이전트를 만들려면 품질, 정확도, 속도를 실질적으로 잃지 않으면서 공학과 인간의 특성을 균형 있게 다뤄야 합니다.
Cartesia는 음성 AI 에이전트의 힘을 실현하려면 대화 경험 전체를 신중히 설계하고 세밀하게 제어해야 한다고 믿습니다. 이 철학은 상태 공간 모델인 SSM의 설계, 학습, 개발, 평가, 배포에 반영됩니다. 시스템의 각 계층은 절충점, 사업 성과, 용도의 목표, 엔지니어링 품질을 충분히 고려하며 의도적으로 연결해야 합니다.
직관적이고 믿을 수 있으며 사람다운 목소리를 찾도록 돕겠습니다. business@cartesia.ai로 연락하세요.
