블로그 / 소식

시리즈 A와 음성 AI의 미래

Karan Goel 
시리즈 A와 음성 AI의 미래

Cartesia는 사실적이고 빠르며 제어 가능한 음성 AI의 미래를 만들고 있습니다. 지난 1년간 수백만 건의 통화를 지원하고 수만 명의 크리에이터가 콘텐츠의 접근성을 높이도록 도왔습니다.

Kleiner Perkins가 주도한 $64 million 시리즈 A 투자를 발표합니다. 새 투자금으로 팀을 확장하고 차세대 음성 모델, 인프라, 제품을 개발하기 위한 연구에 투자합니다. 그 시작은 최신 음성 생성 모델 Sonic 2.0의 출시입니다.

Sonic 2.0은 새로운 상태 공간 모델 아키텍처를 기반으로 하며, 현재 제공되는 음성 모델 중 가장 빠르고 세밀하게 제어할 수 있습니다. Sonic보다 크기는 두 배지만 더 빠르게 실행됩니다. 전체 모델의 지연 시간은 90ms, turbo는 40ms입니다. 학습에 사용하지 않은 음성 100개로 진행한 블라인드 일대일 평가에서 Sonic 2.0을 선호한 사람은 차순위 제공업체를 선호한 사람보다 1.5배 많았습니다.

Sonic 2.0은 속도와 품질 외에도 생성 결과에 대한 세밀한 제어 기능을 제공합니다. 복잡한 억양과 풍부한 오디오 환경을 담는 최고 수준의 음성 복제도 지원합니다. 새 엔드포인트 두 가지도 도입했습니다.

  • Voice changer로 오디오의 스타일과 목소리를 다듬을 수 있습니다.
  • Infill로 오디오 안의 콘텐츠를 자연스럽게 편집할 수 있습니다.

엔터프라이즈급 인프라를 갖춘 음성 AI 플랫폼을 만들고 있습니다. 개발자를 위해 설계한 Sonic API는 음성 생성에 가장 안정적이고 빠른 서빙 스택을 제공하며, 가동률 99.9%와 전 세계에서 가장 빠른 P90 지연 시간을 갖췄습니다. SOC-2와 HIPAA를 준수하며 실시간 온프레미스 및 온디바이스 배포를 지원합니다.

장기 연구 계획도 계속 추진하고 있습니다. 차세대 오디오 모델에는 스트리밍 아키텍처, 코덱, 긴 문맥 모델링, 온디바이스 추론을 비롯한 여러 분야에서 알고리즘의 발전이 필요합니다. 앞으로 그 진척을 공유하겠습니다.

음성 AI 연구와 제품은 cartesia.ai/sonic에서 자세히 알아보세요. 함께 일하고 싶다면 연락해 주세요.