AI 음성 에이전트는 전화를 받고 통화자가 원하는 것을 들은 뒤 실제로 처리합니다. 예약을 잡고, 주문을 확인하고, 질문에 답하거나, 통화자가 막히기 전에 사람에게 연결합니다. 챗봇은 읽고 쓰는 방식으로 이 일을 합니다. 음성 에이전트는 통화자가 아직 말하는 동안 실시간 오디오로 처리합니다.
이 시간의 차이가 엔지니어링의 대부분입니다. 이 글에서는 음성 에이전트의 개념, 파이프라인의 동작, 구축이 어려운 이유, Cartesia에서 만드는 두 가지 방법을 설명합니다.
AI 음성 에이전트란 무엇인가요?
말로 대화하고 동작을 수행하는 소프트웨어입니다. 통화자의 발화를 전사하고, 할 일을 결정하고, 일정이나 주문 시스템 같은 도구를 호출한 뒤 결과를 말로 전합니다. 더 넓은 범주인 대화형 AI를 실시간 음성에 적용한 것입니다. 범주 전체에 대해서는 별도의 대화형 AI 개요를 제공합니다.
흔히 혼동하는 비슷한 시스템이 두 가지 있습니다.
| 시스템 | 역할 | 다른 점 |
|---|---|---|
| 버튼 입력 또는 메뉴형 IVR | 메뉴를 재생하고 통화를 라우팅 | 언어를 이해하지 않습니다. 시스템이 통화자에 맞추는 것이 아니라 통화자가 메뉴를 따라갑니다. |
| 텍스트 챗봇 | 텍스트를 읽고 작성 | 실시간 오디오가 없고 차례 사이에서 잠시 멈춰도 통화자가 알아차리지 않습니다. |
음성 에이전트는 메뉴에서 예상하지 못한 요청도 이해할 수 있으며, 통화자가 연결된 동안 답해야 합니다. 타이밍을 놓치면 통화자가 겹쳐 말하거나 어색한 공백을 기다리거나 전화를 끊습니다.
음성 에이전트의 동작 원리
루프에는 네 단계가 있으며, 잘 만든 에이전트는 차례대로가 아니라 동시에 실행합니다.
| 단계 | 역할 | 주의할 점 |
|---|---|---|
| 스트리밍 음성 인식 | 통화자의 오디오가 도착하는 대로 전사 | 대상 억양, 전화 코덱, 소음에서의 정확도. 차례 감지에 필요한 무음을 버리지 않기 |
| 발화 차례 감지 | 통화자가 생각을 끝냈는지 판단 | 쉼은 생각 중이거나 완료라는 뜻일 수 있지만 고정 타임아웃은 둘을 같게 취급 |
| LLM과 도구 | 응답을 계획하고 일정 또는 주문 시스템 호출 | 도구 지연이 통화자의 대기 시간에 그대로 반영 |
| 음성 합성 | 생성하는 대로 답변을 스트리밍하며 말하기 | 전체 문장이 나오기 전에 시작하고 끼어들기를 정확히 처리 |
통화자가 경험하는 숫자는 문장을 끝낸 뒤 답변을 들을 때까지의 시간 하나입니다. 모든 단계가 기여합니다. TTS가 1초 미만이어도 도구 호출이 3초 걸리면 해결되지 않습니다. LLM이 빨라도 인식기가 계정 번호를 틀리면 소용없습니다. 측정할 때는 루프 전체를 측정하세요. Cartesia의 Ink는 스트리밍 전사와 내장 발화 차례 감지로 첫 두 단계를 한 모델에서 처리합니다. Sonic은 네 번째 단계입니다. 블라인드 청취 테스트 1위의 TTS 모델로, 모델 지연시간이 90ms 미만이며 40개 이상의 언어를 지원합니다. 가운데 언어 모델은 직접 선택합니다.
음성 에이전트가 어려운 이유
파이프라인은 쉬운 부분입니다. 에이전트는 다음 세 동작에서 무너집니다.
대화 차례 전환. 사람은 완성된 문장으로만 말하지 않습니다. “제 주소는…”이라고 하고 찾아보려고 멈춥니다. 언어 간 대화 연구에 따르면 사람은 약 200밀리초에 차례를 주고받습니다(Stivers 외, 2009). 확신하려고 1초를 기다리면 이미 리듬을 잃고, 쉼마다 들어가면 말을 끊습니다. 쉼이 생각 중인지 완료인지 판단하는 것은 별도 문제입니다. 이를 다룬 음성 활동 감지 및 발화 차례 감지 가이드를 참고하세요.
끼어들기. 통화자는 응답 중 “아니요, 목요일로 할게요”처럼 마음을 바꿉니다. 유용한 에이전트는 발화를 멈추고 수정 내용을 반영해 이어갑니다. 텍스트 생성뿐 아니라 통화자 스피커에 이미 버퍼링된 오디오도 취소해야 하므로 서버만큼 클라이언트의 문제이기도 합니다.
복구. 인식기는 잘못 들을 수 있고 도구 호출은 시간 초과될 수 있습니다. 에이전트에는 다음 행동이 필요합니다. 한 번 확인하거나 재시도하거나, 통화자가 세 번째로 반복하기 전에 사람에게 연결해야 합니다. 성공만 할 수 있는 에이전트는 실패를 크게 드러내는 에이전트입니다.
데모가 아닌 실제 통화로 평가
업체 데모는 데모를 위해 작성했으므로 잘 작동합니다. 실제 통화자에게는 고유한 억양, 전화 연결, 용어가 있습니다. 실시간 트래픽을 연결하기 전에 녹음 또는 테스트 통화를 에이전트에 통과시키고 대화를 평가하세요.
- “그리고, 음, 두 번째 거요”처럼 이어지는 생각까지 끝내게 하나요?
- 완성된 답변 뒤에 1초의 공백 없이 신속하게 응답하나요?
- 통화자가 끼어들면 오디오가 실제로 멈추나요?
- 잘못 들었을 때 추측하지 않고 확인하거나 연결하나요?
- 예약 취소나 주문 변경처럼 중요한 동작을 실행하기 전에 확인하나요?
AI 콜센터 시범 운영 가이드는 이를 하나의 지원 대기열을 위한 평가표로 만듭니다. AI 접수 에이전트 가이드에는 프롬프트 인젝션 사례를 포함한 인수 테스트 표가 있습니다.
Cartesia에서 만드는 두 가지 방법
Managed Agents(/agents)는 루프를 대신 연결합니다. 몇 번의 클릭으로 LLM을 고르고, 도구와 전달 경로를 연결하고, 지식 베이스를 추가하고, 전화번호를 받을 수 있습니다. Cartesia가 아래의 스트리밍 스택을 운영합니다. 아무것도 없는 상태에서 테스트 가능한 에이전트로 가는 빠른 경로입니다.
API는 구성 요소를 제공합니다. 음성에는 Sonic, 스트리밍 전사와 발화 차례 감지에는 Ink, 가운데는 원하는 LLM을 사용하며 루프는 직접 작성한 코드가 소유합니다. 모델, 구현 언어, 배포를 제어해야 할 때 사용하세요. 문서의 Managed Agents 소개는 두 경로와 각각 관리해 주는 범위를 설명합니다.
두 경로 모두 같은 모델을 사용합니다. 이 지연시간의 스트리밍을 가능하게 하는 상태 공간 모델 아키텍처를 기반으로 합니다. 하지만 비용을 따질 때까지 그 내부 구조를 신경 쓸 필요는 없습니다.
음성 에이전트의 사용처
고객 지원과 헬프데스크, 접수와 일정 관리, 콜센터 자동화, 캐릭터나 장난감 같은 상호작용 경험에 사용합니다. Decagon, ServiceNow, Quora, Retell, EliseAI가 Cartesia로 음성 제품을 만듭니다. 자세한 내용은 고객 페이지에 있습니다.