AI 음성 에이전트 플랫폼은 여러분 대신 전화를 받습니다. 상대의 말을 듣고, 무엇을 원하는지 파악하고, 사내 시스템을 조회하고, 목소리로 답한 뒤 분 단위로 요금을 청구합니다. 이제 이런 플랫폼이 수십 개나 되고, 요금 페이지는 나란히 비교하기 어렵게 쓰여 있습니다. 이 페이지에서는 후보에 오를 가능성이 가장 높은 여덟 곳을 각자 무엇을 대신 처리해 주는지, 그리고 1분에 실제로 얼마가 드는지로 비교합니다.
요약하면 이렇습니다. 모델까지 포함한 단일 요금을 원하면 Bland를 보세요. 모델을 전부 직접 고르고 싶다면 Vapi나 Retell을 보세요. 에이전트를 코드로 작성하고 싶다면 LiveKit Agents나 Pipecat을 쓰세요. 음성 품질과 응답 속도가 통화 상대가 끊지 않고 남아 있는지를 좌우한다면, 독립 순위표에서 1위를 차지한 음성 모델을 실행하는 Cartesia Managed Agents를 써 보세요.
저희는 Cartesia를 만드는 회사이니 그 점을 감안해서 읽어 주세요. 아래 경쟁사 요금은 모두 2026년 10월 3일 각 업체의 요금 페이지에서 확인한 것입니다.
음성 에이전트 플랫폼이 하는 일
모든 음성 에이전트는 같은 루프로 동작합니다. 스트리밍 음성 인식이 상대가 말하는 동안 받아 적습니다. 턴 감지기가 상대가 말을 마쳤는지 판단합니다. 언어 모델이 답변을 구상하고 캘린더나 주문 조회 같은 도구를 호출합니다. 음성 합성이 답변을 스트리밍으로 돌려줍니다. 루프에 대한 자세한 설명은 음성 에이전트 작동 방식 가이드에 있습니다.
플랫폼은 이 루프를 호스팅하고, 아무도 두 번 만들고 싶지 않은 부분을 더해 줍니다. 전화번호, 통화 연결, 설정 화면, 통화 기록, 평가 기능입니다. 프레임워크는 같은 루프를 코드로 제공하고 배포는 직접 합니다. 핵심은 어느 업체를 고르느냐보다 스택을 어디까지 직접 맡을지입니다.
플랫폼별 살펴보기
Cartesia Managed Agents
Managed Agents 문서에 따르면 Managed Agents는 음성 인식에 Ink 2, 원하는 LLM, 음성 합성에 Sonic 3.6을 조합합니다. 두 음성 모델 모두 저희가 만든 것입니다. Ink 2는 2026년 6월 기준 Artificial Analysis 스트리밍 순위표에서 단어 오류율 1위였고, 별도의 음성 활동 감지기 없이 턴이 끝나는 시점을 스스로 예측합니다. Sonic 3.6은 2026년 8월 기준 Artificial Analysis Provider Voice Arena에서 94개 모델 중 1위였습니다.
에이전트는 플레이그라운드나 API로 설정하며, 도구와 지식 베이스, 전화번호를 연결할 수 있습니다. 통화 요금은 모든 요금제에서 분당 $0.06이고, Cartesia가 제공하는 번호를 쓰면 분당 $0.014가 추가됩니다. 한시적으로 플레이그라운드에서 만든 에이전트의 LLM 사용료가 포함됩니다(요금). 동시 통화 수는 Free의 8건부터 Scale의 60건까지입니다.
음성 자체가 제품인 경우에 맞습니다. 고객 지원 회선, 안내 데스크, 그리고 느리거나 기계 같은 응답 때문에 상대가 전화를 끊어 버리는 모든 통화입니다. 쓰고 있는 CRM이나 예약 시스템에 연동이 있는지 확인하세요. 없다면 에이전트가 웹훅 도구로 접근할 수 있습니다.
Vapi
Vapi는 직접 고른 부품으로 에이전트를 조립하는 개발자용 플랫폼입니다. Vapi 요금 페이지에 따르면 호스팅은 분당 $0.05이고 모델(음성 인식, LLM, 음성)은 원가로 청구되므로, 실제 단가는 무엇을 고르느냐에 달려 있습니다. Vapi 자체 견적으로는 1,000분에 월 $82~$129, 분당 약 $0.08~$0.13입니다. 무료 플랜에는 $5 크레딧과 동시 통화 4건이 포함됩니다. Vapi는 2024년에 Cartesia를 기본 음성 공급자로 선택했습니다.
모든 모델을 직접 통제하고 싶고, 청구서 서너 장 분량의 항목을 읽는 것이 부담스럽지 않다면 맞습니다.
Retell AI
Retell은 콜센터 자동화를 겨냥한 로우코드 플랫폼입니다. 요금 페이지에는 종량제로 분당 $0.07~$0.31, 동시 통화 20건 포함이라고 나와 있습니다. 기본 견적은 Retell 음성 인프라 $0.055, LLM $0.04, 전화 회선 $0.015로 합계 약 $0.11입니다. Retell은 Cartesia를 포함한 여러 공급자의 음성을 제공하며, 자사 플랫폼에서 차순위 공급자보다 Cartesia의 첫 오디오까지 걸리는 시간이 2~3배 빠르다고 밝혔습니다.
엔지니어가 아닌 사람이 통화 흐름을 만들고 유지할 거라면 맞습니다.
Bland AI
Bland는 모든 것을 하나의 숫자로 청구합니다. Bland 요금 페이지에는 Start가 분당 $0.14, Build(월 $299 플랫폼 요금)가 분당 $0.12로 나와 있으며, LLM과 음성 인식, 음성 합성이 포함되고 전화 회선은 별도입니다. Enterprise 요금제에는 온프레미스나 VPC 배포, 팀에 함께 붙는 엔지니어 지원이 추가됩니다.
모델을 고르는 것보다 예측 가능한 청구서가 더 중요하다면 맞습니다.
Synthflow
Synthflow는 노코드 빌더, 자체 전화 회선, 도입 지원으로 대기업 컨택센터를 겨냥합니다. 요금 페이지에 따르면 기업 계약은 연 $30,000부터 시작하며, 통화량, 동시 통화 수, 연동 범위에 따라 산정됩니다.
업체가 함께 도입을 진행해 주길 원하고 연간 계약 예산이 있다면 맞습니다.
ElevenLabs Agents
ElevenLabs 에이전트 요금에 따르면 ElevenAgents는 통화 분 단위로 청구합니다. 요금제마다 일정 분량이 포함되고, 추가 분은 $0.08, 동시 통화 한도를 넘기면 $0.16입니다. LLM은 별도로 청구됩니다. ElevenLabs 요금 분석에서 1만 분 사용 시 비용을 계산해 두었습니다.
팀이 이미 창작 작업에 ElevenLabs를 쓰고 있고 같은 계정에서 에이전트도 운영하고 싶다면 맞습니다. 지연에 민감한 통화라면 먼저 비교해 보세요. Coval의 2026년 8월 측정에서 Sonic 3.5는 P90 기준 351ms에 첫 오디오를 냈고, 테스트한 ElevenLabs 모델은 모두 1초가 넘게 걸렸습니다.
LiveKit Agents
LiveKit은 많은 음성 제품의 기반이 되는 오픈소스 WebRTC 인프라이고, LiveKit Agents는 에이전트 루프를 Python이나 Node로 작성하기 위한 프레임워크입니다. 직접 호스팅할 수도 있고 LiveKit Cloud에 배포할 수도 있습니다. LiveKit Cloud는 포함된 사용량을 넘으면 에이전트 세션 1분당 $0.01을 청구하고, 주요 모델의 추론도 같은 청구서로 이용할 수 있습니다.
엔지니어가 있고, 미디어 서버를 운영하지 않으면서 완전한 통제권을 원한다면 맞습니다. LiveKit은 Cartesia와 파트너십을 맺고 있으며, Sonic과 Ink는 LiveKit의 추론 청구를 통해 쓸 수 있습니다.
Pipecat
Pipecat은 Daily가 시작한 오픈소스 Python 프레임워크로, 음성·멀티모달 에이전트를 서비스 파이프라인으로 구성합니다. 무료이며, 모델 공급자에게 비용을 내고 원하는 곳에 호스팅하면 됩니다.
최대한의 통제권과 최소한의 플랫폼 제약을 원한다면 맞습니다. Pipecat 튜토리얼에서는 Ink와 Sonic으로 동작하는 에이전트를 만들고, 빠른 턴 종료 감지로 응답마다 약 0.5초를 줄이는 방법을 보여 줍니다.
한눈에 비교
| 플랫폼 | 유형 | 공개된 분당 요금 (2026년 10월 3일) | 모델 |
|---|---|---|---|
| Cartesia Managed Agents | 호스팅 플랫폼 | $0.06, Cartesia 번호는 +$0.014 | Ink 2 + 원하는 LLM + Sonic 3.6 |
| Vapi | 호스팅 플랫폼 | 호스팅 $0.05 + 모델 원가 | 직접 선택 |
| Retell AI | 호스팅 플랫폼 | $0.07~$0.31 | 직접 선택 |
| Bland AI | 호스팅 플랫폼 | $0.12~$0.14, 모델 포함 | 포함 |
| Synthflow | 기업용 플랫폼 | 계약, 연 $30,000부터 | 포함 |
| ElevenLabs Agents | 호스팅 플랫폼 | $0.08 + LLM | ElevenLabs + 원하는 LLM |
| LiveKit Agents | 프레임워크 + 클라우드 | 세션 $0.01 + 모델 | 직접 선택 |
| Pipecat | 오픈소스 프레임워크 | 무료 + 모델과 호스팅 | 직접 선택 |
공개 요금만으로는 판단하기 어렵습니다. 고급 음성과 큰 LLM을 얹은 “$0.05” 플랫폼이 “$0.14” 일괄 요금보다 비쌀 수도 있습니다. 후보마다 같은 조건, 즉 같은 LLM, 같은 음성 품질, 같은 전화 회선으로 통화 한 건의 비용을 계산해 보세요.
고르는 방법
대부분의 결정은 네 가지 질문으로 정리됩니다.
- 에이전트를 누가 관리하나요? 운영팀이라면 시각적 빌더가 있는 플랫폼(Retell, Synthflow, Bland, Managed Agents)을 고르세요. 엔지니어라면 Vapi, LiveKit, Pipecat이 덜 답답할 것입니다.
- 에이전트가 얼마나 빨리 답하나요? 사람은 약 200밀리초 만에 말할 차례를 넘기고, 1초의 공백은 전화가 끊긴 것처럼 느껴집니다. 상대의 마지막 말부터 에이전트의 첫 오디오까지 걸리는 시간을 실제 전화 회선에서 90번째 백분위수로 측정하세요. 깨끗한 오디오의 중앙값은 느린 통화를 가립니다.
- 까다로운 문자열을 어떻게 처리하나요? 각 후보에게 확인 코드, 주소, 전화번호를 불러 주세요. 이런 정보의 인식 오류가 잘못된 예약으로 이어집니다.
- 우리 통화량이면 얼마가 드나요? 예상 월간 통화 분량에 LLM과 전화 회선을 포함한 총 단가를 곱하고, 요금제의 동시 통화 한도를 넘으면 어떻게 되는지도 확인하세요.
그다음 파일럿을 진행하세요. AI 콜센터 가이드에 파일럿 계획이, AI 안내원 가이드에 소규모 사업자 사례가 있습니다.
Cartesia Managed Agents 써 보기
Cartesia 플레이그라운드에서 무료 요금제로 에이전트를 만들고 테스트 통화를 해 볼 수 있습니다. 무료 요금제에는 매달 $1의 에이전트 사용량이 포함됩니다. 지금 쓰는 플랫폼을 계속 쓰고 싶다면 Vapi, Retell, LiveKit, Pipecat 모두 에이전트 음성으로 Sonic을 지원합니다.