어떤 구매자는 가격과 관계없이 호스팅 음성 API를 사용할 수 없습니다. 정부기관, 병원, 은행, 방산업체는 오디오가 자체 경계 안에 머물러야 한다는 조건으로 음성 AI를 도입합니다. 온프레미스 음성 AI는 이 조건을 충족하는 방식이며 구매 전에 평가할 사항도 바꿉니다.
이 글은 온프레미스 음성 AI의 개념, 실제로 자체 하드웨어에서 실행해야 하는 요소, 클라우드 API부터 에어갭까지의 위치, 제공업체 평가 방법을 설명합니다. 마지막에는 ServiceNow AI Voice Agents를 지원하는 완전한 에어갭 온프레미스 배포를 포함하여 Cartesia의 방식을 소개합니다.
온프레미스 음성 AI란 무엇인가요?
조직이 소유하고 통제하는 인프라에서 실행하는 음성 소프트웨어입니다. 제공업체는 모델을 제공하고, 자체 팀이 자신의 서버와 데이터센터 또는 직접 접근 권한을 통제하는 클라우드 계정에서 운영합니다. 실시간 통화, 오디오, 전사의 어떤 부분도 제공업체 인프라를 거칠 필요가 없습니다.
반대는 흔히 사용하는 클라우드 API 배포입니다. 오디오를 제공업체로 스트리밍하고 제공업체가 모델을 실행하며, 오디오와 전사는 제공업체의 서비스 약관을 따릅니다. 대부분의 제품에는 괜찮은 절충이지만 일부에는 맞지 않습니다. 기밀 브리핑, 심리 상담, 규제기관이 사본을 요구할 수 있는 통화라면 “업체가 삭제한다고 합니다”는 답이 충분하지 않을 수 있습니다.
여기서 음성 AI는 실시간 음성 파이프라인을 뜻합니다. 그 위에 구축하는 음성 에이전트는 네 부분으로 구성됩니다.
| 구성 요소 | 역할 | 온프레미스 실행 가능 여부 |
|---|---|---|
| 스트리밍 음성 인식 | 통화자가 말하는 동안 전사 | 가능 |
| 발화 차례 감지 | 통화자가 말을 끝냈는지 판단 | 가능 |
| 언어 모델과 도구 | 응답을 결정하고 내부 시스템 호출 | 가능, 직접 선택 |
| 스트리밍 음성 합성 | 응답이 생성되는 동안 음성으로 전달 | 가능 |
모두 자체 경계 안에서 실행할 수 있습니다. 언어 모델은 원래 직접 선택할 수 있었습니다. 제공업체가 보통 외부에 내주지 않는 부분은 음성 모델이며, 이를 내부로 가져올 수 있는지가 업체 간의 실질적인 차이입니다.
기업이 음성 AI를 온프레미스에 배포하는 이유
반복해서 나오는 이유는 세 가지입니다.
데이터 주권과 상주 위치. 일부 계약과 관할권은 특정 데이터가 조직이 통제하는 물리적 또는 법적 경계 밖으로 나가지 않도록 요구합니다. 클라우드 API는 운영 주체에게 오디오를 스트리밍하지만 온프레미스는 자체 랙에 경계를 유지합니다.
규정 준수. 규제 대상 구매자는 배포를 HIPAA, GDPR, PCI 같은 체계에 맞춥니다. 온프레미스 자체로 규정을 준수하게 되는 것은 아니지만 데이터 경로가 감사인에게 보여 줄 수 있는 인프라에서 시작하고 끝나므로 감사를 수행하기 쉬워집니다.
지연시간과 제어. 자체 네트워크에서 모델을 실행하면 제공업체까지의 네트워크 왕복이 사라지고 외부 업체의 요청 한도를 적용받지 않습니다. 음성 에이전트에서는 응답 시간이 곧 제품입니다. 사람은 약 200밀리초 만에 대화 차례를 주고받으며(Stivers 외, 2009), 1초의 무음은 망설임처럼 들립니다. 이 때문에 스펙트럼의 끝에는 기기에서 직접 모델을 실행하는 방식도 있습니다. 네트워크도 공유 인프라도 필요하지 않습니다.
배포 방식의 범위
클라우드와 온프레미스는 사실 누가 무엇을 운영하는지의 범위입니다. 기업 배포는 대개 다음 중 하나입니다.
| 배포 | 모델 실행 위치 | 운영 주체 | 데이터 경로 |
|---|---|---|---|
| 클라우드 API | 제공업체 클라우드 | 제공업체 | 오디오가 자체 네트워크 밖으로 나감 |
| VPC, 프라이빗 클라우드 | 자체 클라우드 계정과 선택한 지역 | 자체 팀, 제공업체 지원 | 오디오가 자체 클라우드 계정 안에 머묾 |
| 온프레미스 | 자체 데이터센터 | 자체 팀 | 오디오가 자체 네트워크 안에 머묾 |
| 에어갭 온프레미스 | 인터넷 경로가 없는 자체 데이터센터 | 자체 팀 | 구조상 아무것도 밖으로 나가지 않음 |
| 온디바이스 | 단말기 자체 | 자체 팀 | 아무것도 하드웨어 밖으로 나가지 않음 |
구매 시간을 줄이는 주의점이 두 가지 있습니다. 첫째, VPC는 온프레미스가 아닙니다. 하드웨어는 자체 것이어도 데이터센터는 아닙니다. 계약상 제약이라면 보통 충분합니다. 둘째, 각 업체에 온프레미스가 무엇을 포함하는지 물어보세요. 일부는 직접 실행하는 컨테이너여도 라이선스나 업데이트를 위해 외부 서버에 연결합니다. 이는 연결형 온프레미스이며 에어갭 요구사항을 충족하지 못합니다.
온프레미스 음성 AI 제공업체 평가 방법
실제 온프레미스 제공과 마케팅 문구를 구분하는 질문입니다.
- 진짜 에어갭인가요? 외부 연결 없이 추론할 수 있나요? 아니면 대화 중 라이선스, 텔레메트리, 필수 클라우드 호출이 네트워크 밖으로 나가나요?
- 온프레미스 모델과 클라우드 모델이 같나요? 일부 업체는 API와 다른 오래된 모델을 제공합니다. 마음에 든 데모가 클라우드 모델이었다면 실제 구매하는 바이너리가 무엇인지 물어보세요.
- 자체 환경에서 지연시간은 얼마인가요? 업체 수치는 업체 하드웨어에서 측정합니다. 자신의 하드웨어와 동시성에서 중앙값이 아닌 99백분위수 벤치마크를 요청하세요.
- 누가 어떻게 모델을 업데이트하나요? 온프레미스가 고정된 상태를 뜻해서는 안 됩니다. 업그레이드 전달 방식, 버전 고정 가능 여부, 모델 교체가 조정한 프롬프트와 목소리에 미치는 영향을 물어보세요.
- 규정 준수 서류는 무엇인가요? SOC 2 Type II, 서명 가능한 BAA, 공개된 DPA, 데이터 상주 조건을 확인하세요. 업체가 이를 제시하지 못하면 배포 방식만으로 계약을 성사시킬 수 없습니다.
- 파이프라인 전체를 내부로 가져올 수 있나요? TTS만 온프레미스이고 STT는 외부라면 배포에 구멍이 있는 셈입니다. 발화 차례 감지를 포함한 전체 파이프라인을 확인하세요.
Cartesia의 온프레미스 방식
Cartesia 모델은 실시간 추론을 위해 설계된 아키텍처인 상태 공간 모델을 기반으로 하며 클라우드, 온프레미스, 온디바이스에서 같은 모델을 제공합니다. 구체적으로는 다음과 같습니다.
- 음성 합성 모델인 Sonic은 모델 지연시간이 90ms 미만이며 외부 블라인드 청취 테스트에서 1위를 기록하고 44개 언어를 지원합니다. 에어갭을 포함한 자체 데이터센터, AWS·GCP·Azure의 자체 VPC에 배포하거나 OEM 라이선스로 제품에 직접 내장할 수 있습니다.
- 발화 차례 감지를 기본 제공하는 스트리밍 음성 인식 모델 Ink도 같은 배포 옵션이 있습니다.
- ServiceNow AI Voice Agents에는 SOC 2 Type II, HIPAA, GDPR, PCI 규정 준수와 함께 음성 모델, 추론 엔진, 오케스트레이션을 완전한 에어갭 온프레미스 배포로 제공합니다.
- Rasa는 엔터프라이즈 제품에 Cartesia 온프레미스 배포 옵션을 포함합니다. Blue Machines는 규제 환경을 위한 배포 아키텍처를 함께 개발했습니다.
- 스펙트럼의 끝에는 기기에서 상태 공간 모델을 실행하는 Apache 2.0 오픈소스 라이브러리 Edge가 있습니다.
온프레미스와 OEM 배포는 엔터프라이즈 계약으로 제공합니다. 요구사항을 문의하거나 셀프서비스 요금제로 클라우드에서 시작한 뒤 내부로 옮기세요. 모델이 같으므로 다시 만드는 것이 아니라 배포 방식을 바꾸는 일입니다.