블로그 / 제품

음성 AI 모델 선택 가이드

Zubin Pratap 
반투명 초록색 꽃잎들이 겹친 장미 모양의 중심에서 윤곽선 원 세 개가 교차하는 이미지

기업용 음성 AI 모델 선택하기

많은 팀은 “전문적으로 들리는” TTS 목소리를 고르고 기존 챗봇과 LLM에 연결한 뒤 ASR을 붙이면 음성 에이전트를 만들 수 있다고 생각합니다. 몇 달 후 조용한 방의 macOS에서 왕복 600~800ms를 기록하는 프로토타입을 출시합니다.

하지만 실제 전화 인프라에서는 2~4초가 걸리고, 통화 95%가 경험하는 최대 지연 시간인 P95가 5초까지 치솟습니다. 8khz 전화망의 낮은 음질까지 더하면 실제 경험은 평가 조건과 크게 다를 수 있습니다.

실험실 벤치마크로 모델을 고르고 싶어지지만 실제 대화는 복잡합니다. 기업용 음성 에이전트는 어려운 엔지니어링 문제입니다. 음성 모델을 서로 바꿔 끼우는 범용품처럼 다뤄서는 해결할 수 없습니다. 의도한 사용 사례에서의 성능을 기준으로 선택하고 분석하고 측정해야 합니다.

스튜디오 팟캐스트에서 영국 방송 억양을 잘 내는 모델이 PSTN 전화망의 항공사 헬프데스크에서는 못할 수 있습니다. 브라우저에서 정확하게 전사하는 모델이 전화에서는 발화를 감지하기 어려울 수 있습니다. 누르고 말하기에 뛰어난 모델이 사용자가 말을 끝냈는지 생각하느라 흐렸는지 구분하지 못할 수 있습니다.

데모와 벤치마크, 그리고 현실

공개 벤치마크는 유용하고 타당한 시작점이지만 최종 제공업체 선정의 전부가 되어서는 안 됩니다. 의도한 사용 사례를 반영하는지도 살펴야 합니다. 많은 데이터셋은 스튜디오 녹음, 오디오북, 정해진 대본처럼 이상적인 오디오를 담습니다. “음”, 말끝 흐리기, 배경 소음, 긴 침묵 등이 없습니다.

AI 음성 에이전트 파이프라인

고객이 책상을 뒤지며 “음, 잠깐만요 [긴 멈춤] 다른 걸 확인할게요…”라고 말하면 규칙 기반 VAD는 멈춤을 감지해 turn_ended를 내보낼 수 있습니다. 빨리 진행해 지연 시간을 줄이도록 최적화됐기 때문입니다. ASR이 전사하고 오케스트레이션 계층이 LLM에 전달하면 응답이 바로 좋은 어조의 부드러운 음성으로 바뀝니다. 좋아 보이지만 사용자가 다시 말하기 시작하면 에이전트가 그 위에 말합니다.

현실적인 오디오 학습·벤치마크 데이터를 합법적으로 대량 확보하기는 매우 어렵습니다. 그래서 많은 벤치마크가 실제 상황 대신 이상적인 실험실 조건을 측정합니다.

시끄러운 환경의 전화 고객 대화를 처리하는 에이전트를 만들려면 모델이 이런 실제 상황을 다루도록 설계됐는지 조사해야 합니다.

음성 AI 모델을 선택한다는 것

1. 첫 토큰이 아니라 전사 완료까지 걸리는 시간 평가

대부분은 ASR을 첫 토큰까지 시간 TTFT, 실시간 계수 RTF, 평균 단어별 지연 시간으로 평가합니다. 하지만 실시간 음성 에이전트에는 실속 없는 지표일 수 있습니다.

우리는 마지막 세그먼트까지 시간 TTFS, 즉 완전한 전사까지 시간 TTCT가 중요하다고 봅니다.

사용자의 발화 차례가 끝난 밀리초부터 LLM 에이전트가 신뢰할 수 있는 확정 전사를 모델이 출력한 밀리초까지입니다. TTFS는 에이전트가 바로 함께하는지 뒤처지는지, 이후 대화와 다음 차례의 품질을 결정합니다.

ASR·LLM·TTS 각 부분이 아니라 처음부터 끝까지 200ms 미만이면 자연스럽게 느껴집니다. 500ms~1s면 사용자가 알아차리지만 참습니다. 1s를 넘으면 말을 반복하거나 예상치 못한 시점에 서로 충돌합니다. 충돌은 쌓입니다. 사용자가 더 크게 말하고 ASR은 이전 말에 혼란스러워하며 LLM은 잘못된 입력을 받고 전체 루프가 나빠집니다.

2. 발화 종료 감지와 끼어들기 처리 평가

발화 종료 감지는 엔드포인팅이라고도 합니다. 사용자가 발화 차례를 끝낸 순간을 찾는 것입니다. STT 모델은 사람처럼 시각적 단서를 갖지 못하므로 정확히 하기가 어렵습니다. 품질이 나쁘면 어색하고 긴 멈춤과 큰 지연 시간이 생깁니다.

시각적 단서가 없으므로 오케스트레이션 계층과 실행 환경은 사용자가 갑자기 다시 말하거나 에이전트를 끊는 경우도 처리해야 합니다. 좋은 에이전트는 사용자가 새 차례를 시작하거나 끝난 줄 알았던 말을 이어갈 때 LLM 호출과 진행 중인 TTS 생성을 모두 취소합니다.

ASR의 지연 시간과 대화 흐름을 평가하는 팀은 실제로 발화 감지와 정밀도·재현율을 평가하고 있다는 점을 놓칩니다. 데모와 프로덕션의 차이를 디버깅할 때야 깨닫습니다. 다른 디버깅처럼 시프트 레프트로 일찍 잡는 편이 빠르고 저렴합니다.

정밀도는 발화 감지 ASR이 사용자의 turn_start와 turn_end를 올바르게 감지하는 정도입니다. 잘못된 turn_start는 전사와 파이프라인을 끊고, 잘못된 turn_end는 에이전트가 사용자를 끊게 합니다. 재현율은 turn_start를 놓쳐 사용자 차례 전체를 빠뜨리거나 turn_end를 놓쳐 응답하지 않는지 측정합니다.

발화 감지를 통합한 ASR은 이제 흔합니다. 최고 수준을 결정하는 것은 정밀도와 재현율입니다. 예전에는 높은 정밀도를 위해 재현율을 희생했지만 Cartesia의 Ink-2 ASR 모델은 시작과 끝 모두에서 높은 정밀도와 재현율로 최신 성능을 달성했습니다.

Ink-2가 침묵의 길이만 규칙으로 쓰지 않고 말의 문맥으로 판단하기 때문입니다. 전화번호를 읽는 중인지, 말끝을 흐리는지, 생각 중인지, 실제로 끝났는지 이해합니다. 영상과 아래 녹음은 원래 언어를 유지합니다.

3. 중요한 곳의 정확도

관계없는 오류 종류를 보거나 비스트리밍 ASR과 스트리밍 ASR을 비교한다면 단어 오류율 WER은 오해를 부릅니다. 비스트리밍은 본래 정확도를 내기 더 쉽습니다. 안타깝게도 많은 벤치마크는 두 사용 사례를 구분하지 않습니다.

입력 데이터 범주별로 WER을 측정하는 편이 좋습니다. 하나의 평균은 전화번호, 이름, UUID 등의 약점을 숨깁니다. 전화번호 WER이 2%인 모델도 억양이 있는 발화에서는 23%일 수 있습니다. 의료와 법률의 전문 용어나 표현은 일반 소비자용 벤치마크가 아예 측정하지 않을 수 있습니다.

여러 지역의 인바운드 고객 지원이라면 깨끗한 영어 실적 발표 전사보다 억양이 있는 발화의 WER이 더 중요합니다.

일부 범주에서만 낮은 WER이 필요할 수도 있습니다. 다른 성능 지표와의 균형을 분석할 때 알아야 합니다. 의존하는 벤치마크가 실제 사용 사례의 데이터를 시험하지 않았다면 적어도 여러분에게는 의미가 없습니다.

TTS에서 WER은 입력 텍스트와 비교한 합성 음성의 이해 가능성을 측정합니다. 중요한 것은 말의 일관성, 발음, 속도, 운율, 숫자, 약어, 금액, 수량 처리입니다. “March 3rd”와 “03/03”, “twelve hundred dollars”와 “$1,200”을 어떻게 다루는지 보세요. 특정 사용 사례에서는 전문 용어 발음도 중요합니다.

선택한 모델의 정확도를 측정하는 좋은 방법은 다음과 같습니다.

  1. 중요한 성능 범주를 정합니다.
  2. 여러 시나리오에서 각각 따로 측정합니다.
  3. 모든 시나리오와 범주의 성능을 살펴봅니다.
  4. 사용 사례와 요구에 안정적으로 대응하는 모델을 고릅니다.

실제로 영향을 주는 지표를 분명히 정하고 벤치마크를 세밀하게 읽어야 적절한 음성 모델을 선택할 수 있습니다.

4. 음성 복제

현재 사람과 고객의 상호작용을 새 에이전트 경험으로 자연스럽게 이어가려는 많은 고객은 복제 음성을 선호합니다.

Cartesia에는 두 방법이 있습니다. 오디오 5초로 만드는 Instant Voice Cloning, IVC와 음성 30분 이상으로 만드는 Professional Voice Cloning, PVC입니다.

기업 고객은 어떤 특성이 용도에 적합하게 만드는지, 무엇을 보존하고 최적화할지 깊이 이해해야 합니다.

다른 언어에서 원어민처럼 들리도록 현지화할 때도 설계와 발화에 중요한 영향이 있습니다. 현지화, 억양 조정, 맞춤 발음 등에 대한 기대를 명확히 하면 효과적인 에이전트 설계에 도움이 됩니다. 대화 경험에 큰 영향을 주는 특성이기 때문입니다.

5. 목소리 설계의 범위

모든 음성 AI 플랫폼은 TTS에서 속도, 음량, 감정을 조절하는 기능을 어떤 형태로든 제공합니다.

Cartesia Sonic-3.5는 더 나아갑니다. 특성을 설정할 수 있지만 입력 텍스트에 맞춰 감정을 표현하고 의미 문맥과 충돌하는 설정은 무시합니다.

공감하는 어조를 원한다면 LLM이 공감하는 텍스트를 생성해야 합니다. 목소리 설계가 문맥을 이해하고 LLM의 생성과 연결됩니다.

에이전트 설계를 텍스트 입력과 연결하면 LLM 선택과 시스템의 성격을 용도에 맞추는 데 더 많은 제어와 유연성을 얻습니다.

Cartesia는 각 목소리에도 기본 감정 성향을 설계합니다. “밝은 해결사”와 “믿을 만한 조언자”는 다르게 들립니다. 필요한 감정에 목소리를 맞춘 뒤 선택한 목소리에 LLM 프롬프트를 맞추세요.

선택을 위한 방법

효과적인 대화형 음성 에이전트는 어려운 기술적 성과입니다. 성공적인 고객에게서 배운 방법은 다음과 같습니다.

1단계: 목표를 정하고 음성 특성에 연결하기

사용 사례별로 다음처럼 연결할 수 있습니다.

사용 사례발화 속도감정 수준응답 속도참고 음성
아웃바운드 영업1.1× ~ 1.3×, 긴박하고 적극적높음, 따뜻하고 열정적중간~빠름, 300-500ms
고객 지원0.8× ~ 1.0×, 차분하고 신중함낮음~중간, 안정감과 안심중간, 500-650ms, 생각할 여유
추심 / 규정 준수0.9× ~ 1.0×, 명확하고 단호함낮음, 절제되고 전문적느림, 650-800ms, 말을 끝내도록 기다림
명상 앱0.7× ~ 1.0×, 차분함낮음, 편안함과 안심느림~중간, 650-400ms, 서두르지 않고 편안함

병원 예약 에이전트에서 잘못된 전화번호나 날짜는 규정 준수 사고와 매출 손실로 이어질 수 있습니다. 신용카드 추심 IVR에서는 대화의 열정보다 정확도가 중요합니다.

이상적인 통화가 아니라 최악의 상황에서 시작해 원치 않는 결과를 만드는 원인을 거슬러 올라가세요.

2단계: 공개 벤치마크가 필요한 것을 시험하는지 분석하기

평가 데이터가 사업의 현실과 맞지 않으면 벤치마크는 의미가 없습니다. 좋아 보이는 것이 안정성 문제를 만들면 오히려 해롭습니다. 공격적인 종료 감지로 지연을 낮추지만 끼어들기가 많아지거나 도구 호출에 잘못된 입력을 주는 경우가 그렇습니다.

많은 공개 벤치마크는 구하기 쉬워서 잘못 라벨링된 데이터, 오래된 오디오북, 문장 중간의 짧은 클립, 스튜디오 녹음, 낭독 데이터를 사용합니다. 공개 데이터는 프로덕션을 잘 반영하지 못하는 경우가 많습니다. 모델이 심하게 과적합하면 말을 이해하는 대신 데이터셋의 흔적으로 잘못된 라벨을 추측합니다.

이 데이터는 실제 대화 에이전트의 운영 환경과 거의 닮지 않았을 수 있습니다.

제공업체를 대상으로 레드팀 테스트를 해보세요. 실제 고객의 전화 50건을 주되 배경 소음, 억양, 겹친 발화, 제품명, 타이핑에서 말하기로 전환할 때의 어색한 침묵을 포함하세요. 몇 주간 전체 성능과 느낌을 분석하세요.

Sierra의 Voice Sims로 확장할 수도 있습니다. 여러 언어와 요구, TV를 켠 집·거리·기차 같은 장소, 감정 상태와 상황의 발신자를 시뮬레이션합니다.

3단계: 사용 사례에 필요한 지표 정하기

모든 지표가 중요하지 않고 중요도도 같지 않습니다. 의료 예약 에이전트는 약품명, 날짜, 용량 같은 의료 용어와 구조화된 데이터의 WER이 좋아야 합니다. 대량 아웃바운드 영업은 전체 지연 시간과 끼어들기 정확도가 중요합니다. 규정에 민감한 추심 에이전트는 법정 고지의 중간을 끊지 않는 발화 감지가 필요합니다. 결국 기업용 음성 에이전트의 가장 중요한 지표는 효율적으로 규모에 맞게, 사람에게 최소한으로 넘기며 일을 끝냈는가입니다.

사업 목표에 영향을 주는 두세 지표에 사용 사례를 연결하고 그 기준으로 평가하세요.

4단계: 시간 예산 직접 관리하기

구성 요소마다 지연 시간 예산을 정하세요. 예시는 다음과 같습니다.

  • ASR 발화 감지: 50ms
  • ASR TTCT, TTFS: 200ms
  • LLM 첫 토큰: 300ms
  • LLM 텍스트 입력을 위한 TTS 생성 버퍼
  • TTS 첫 오디오: 100ms
  • 전체 파이프라인: 처음부터 끝까지 500ms

각 항목의 담당자를 정하세요. 팀은 2주 안에 전화 환경에서 500ms가 비현실적인지 알려줄 것입니다. 이 충돌은 유용합니다. 프로덕션에 들어가기 전에 실제 제약이 드러나기 때문입니다.

마지막으로

기업용 음성 에이전트는 인터넷에서 들리는 것보다 만들기 어렵습니다.

제공업체를 평가하는 제품 구매자나 엔지니어링 리더라면 어떤 아키텍처가 사용 사례, 지연 예산, 규정 준수 요구를 브랜드에 맞게 다루는지 물어야 합니다. 고객이 호텔 방의 유선전화로 지역 억양을 쓰며 문장 중간에 끼어들어도 말입니다.

좋게 들리거나 깨끗한 벤치마크에서 잘 나오는 모델을 고르고 싶지만, 나중에 P95 하나가 수개월의 개발과 비용을 무너뜨릴 수 있습니다.

최신 AI 연구와 실용적인 사업 판단을 결합해 기업용 음성 에이전트를 만들고 싶다면 business@cartesia.ai로 연락해 주세요. 도와드리겠습니다.