Tavus는 사용하기 쉬운 API로 개발자가 디지털 트윈 영상 경험을 구축하도록 돕는 생성형 AI 영상 연구 기업입니다. AI 디지털 트윈을 위한 세계에서 가장 빠른 대화형 영상 인터페이스(CVI)를 만들어 AI와 상호작용하는 방식을 혁신하고 있습니다. 이 기술은 AI 복제본과 실시간으로 몰입감 있는 대화를 나누게 하여 마케팅 자동화, 전자상거래, 기업 교육, 고객 참여, 엔터테인먼트에 새로운 가능성을 열어 줍니다.
Cartesia가 Tavus 창립자들을 만났을 때 이들은 이미 AI 성능의 한계에 도전하고 있었습니다. Tavus는 기존 구성에서 자동 확장과 네트워크 지연 문제를 겪고 있었습니다.
Cartesia와의 협력은 전환점이 되었습니다. 일관되게 90ms 미만의 지연시간을 제공하는 Cartesia Sonic 모델 덕분에 Tavus는 엄격한 성능 요구사항을 충족하면서도 인프라를 단순화할 수 있었습니다. 사용자들은 품질을 높이 평가했으며, 일부는 텍스트 음성 변환 엔진으로 Cartesia를 직접 요청하기도 했습니다.
여기에서 CEO Hassaan의 발표를 읽어 보세요. 개발자는 상세한 API 문서를 활용하여 Tavus 기술을 쉽게 통합할 수 있습니다.
과제
Tavus는 AI 디지털 트윈과 자연스럽게 실시간 영상 대화를 나눌 수 있는 플랫폼을 구축하고자 했습니다. 이 야심 찬 목표를 달성하려면 몇 가지 기술적 과제를 해결해야 했습니다.
- 원활한 상호작용을 위한 초저지연 달성
- 품질 높고 자연스러운 음성을 실시간으로 생성
- 보고 듣고 자연스럽게 응답하는 설득력 있는 AI 복제본 제작
- 여러 동시 사용자를 처리하는 확장 가능한 시스템 개발
솔루션
Tavus는 음성 생성 시스템의 핵심으로 Cartesia의 Sonic 모델을 선택했습니다. Sonic의 상태공간모델 역량은 품질 높고 지연시간이 낮은 음성 생성이 필요했던 Tavus의 요구에 정확히 부합했습니다.
- 초저지연: Sonic의 90ms 미만 지연시간 덕분에 Tavus는 1초 미만의 종단 간 응답 시간을 달성하여 실제 대화 같은 경험을 만듭니다.
- 자연스러운 음성 품질: Sonic의 고급 음성 생성은 사실적인 음성을 만들어 설득력 있는 AI 디지털 트윈을 구현하는 데 필요한 기반을 제공합니다.
- 음성 설계와 복제: Sonic의 즉각적인 음성 복제 및 설계 기능으로 Tavus는 각 AI 복제본에 고유한 음성을 부여하여 플랫폼의 개인화 수준을 높입니다.
- 다국어 지원: 여러 언어를 지원하는 Sonic 덕분에 Tavus는 플랫폼을 전 세계로 확장할 수 있습니다.
- 확장성: Cartesia 인프라는 Tavus의 여러 동시 사용자 요구를 쉽게 처리하여 사용량이 가장 많을 때도 원활한 성능을 보장합니다.
성과
Cartesia Sonic 모델을 통합한 Tavus는 뛰어난 성과를 달성했습니다.
- 1초 미만 지연시간: CVI는 이제 1초 미만의 종단 간 지연시간으로 작동하여 자연스러운 대화 흐름을 만듭니다.
- 사실감 향상: 사용자들은 AI 디지털 트윈과의 대화가 매우 생생하고 몰입감 있다고 평가합니다.
- 활용 사례 확대: Tavus는 교육, 기업 교육, 엔터테인먼트 등 다양한 분야에 기술을 성공적으로 적용했습니다.
- 확장성: 플랫폼은 여러 동시 사용자를 손쉽게 처리하여 폭넓은 도입을 위한 기반을 마련합니다.
Tavus는 CVI 기술을 새로운 시장과 활용 사례로 확장할 계획이며 AI 상호작용의 한계를 계속 넓히고 있습니다.
Cartesia의 Sonic 모델은 대화형 영상 인터페이스의 판도를 바꿉니다. 90ms의 초저지연과 고품질 음성 생성 덕분에 AI 디지털 트윈과 진정으로 몰입감 있는 실시간 대화를 만들 수 있었습니다. 자연스러운 음성과 음성 설계 기능이 제품을 한 단계 끌어올렸습니다.
Tavus가 AI와 인간의 상호작용에서 이루는 일은 놀랍습니다. 이 팀은 한계를 넓히는 특별한 재능을 갖추고 있으며, Sonic으로 대화형 영상 인터페이스를 구동하게 되어 기쁩니다. 디지털 트윈이 자연스러운 실시간 대화를 나누는 모습을 보면 미래에 들어선 듯합니다. 이 흥미로운 여정에 함께하게 되어 영광입니다.