블로그 / 연구

Sonic 발표: 사실적인 음성을 위한 저지연 음성 모델

Karan Goel 
Sonic 발표: 사실적인 음성을 위한 저지연 음성 모델

우리는 모든 기기에서 오래 지속되는 실시간 지능을 만들기 위해 Cartesia를 설립했습니다. 출발점은 상태 공간 모델이라는 아키텍처의 변화였습니다. 오늘 사실적인 음성을 생성하는 저지연 음성 모델 Sonic을 출시합니다.

실시간 지능 만들기

어떤 길이의 문맥이든 처리하고, 세상의 어떤 기기에서든 실행되며, 모든 모달리티를 실시간으로 직접 처리할 만큼 AI가 효율적인 세상을 상상해 보세요. 지능이 어디에나 존재하고 오래 지속되며, 대화를 통해 주변을 이해하고 대처하도록 돕고, 복잡한 문제를 독립적으로 해결하는 세상입니다. 누구나 자신의 필요에 맞춰 개인화되고 사생활을 지키는 즉각적인 지능에 접근하고 제어하며 실행할 수 있습니다.

우리는 이런 미래에 근본적으로 새로운 지능 아키텍처가 필요하다고 믿습니다. 오늘날 모델은 인간 지능의 기준에 크게 못 미칩니다. 우리만큼 세상을 세밀하게 이해하지 못하고, 느리고 비싸서 개발과 보급이 대기업에 집중되어 있습니다. 가장 뛰어난 모델도 1년 동안의 오디오, 영상, 텍스트 스트림, 즉 텍스트 토큰 1B개, 오디오 토큰 10B개, 영상 토큰 1T개를 계속 처리하며 추론하지 못합니다. 온디바이스에서는 더욱 어렵습니다. 데이터 센터를 동원하지 않아도 되는 저렴한 지능을 누구나 이용할 수 있어야 하지 않을까요?

이 비전을 실현하는 것이 우리의 평생 과제입니다. 지난 4년간 공동 창립자 Albert와 Karan은 AI 모델을 근본적으로 더 효율적으로 만드는 새 패러다임인 상태 공간 모델, SSM을 함께 개발했습니다. 상태 공간 모델은 사람처럼 정보를 스트리밍으로 받아들이는 효율적인 실시간 모델을 학습할 기반을 제공합니다. 우리 팀이 독보적인 Tri Dao와 함께 학계에서 개발한 S4와 Mamba 같은 상태 공간 모델은 이제 전 세계로 빠르게 확산되고 있습니다. 시각, 로봇공학, 생물학용 변형부터 Jamba, Zamba 등 산업계 언어 모델까지, 학계와 산업계의 새 연구에 영향을 주고 있습니다. 이 모델들은 AI가 훨씬 효율적이고 접근하기 쉬워질 미래를 보여줍니다.

Cartesia는 지능의 효율성을 높이는 데 집중합니다. 모두에게 더 빠르고 저렴하며 쉽게 이용할 수 있게 만들고자 합니다. 모든 기기에서 오래 지속되는 실시간 지능을 지원하는 플랫폼을 개발하고 있습니다.

실시간 지능은 여러 형태를 띨 것입니다. 첫 목표는 오래 지속되는 기억을 갖춘 실시간 대화형 AI입니다. 모델이 오디오를 직접 이해하며 대화하고, 상호작용을 장기적으로 기억하며, 문제를 해결하기 위해 행동하는 새로운 컴퓨팅 플랫폼입니다. 실시간 게임부터 고객 지원까지 어떤 새 경험을 만들지 기대하며, 아래에서 초기 개발 성과를 공유합니다.

고해상도 모달리티를 위한 저지연 모델

실시간 지능을 만들 때 지연 시간은 큰 과제입니다. 모델은 입력을 받으면 즉시 반응해야 합니다. 우리는 오디오와 영상 같은 고해상도 모달리티를 효율적이고 짧은 지연 시간으로 생성하는 새 상태 공간 모델 아키텍처 개발에서 진전을 이뤘습니다. 실시간 대화형 AI를 만들기 위해 먼저 음성과 오디오에서 접근법을 실험하고 확장하고 있습니다.

지금까지의 실험에서는 오디오 생성에 널리 쓰이는 Transformer 구현과 비교해 모델 품질, 추론 속도, 처리량, 지연 시간을 동시에 개선할 수 있었습니다. 파라미터 수를 맞춘 Cartesia 모델을 Multilingual Librispeech에서 한 에포크 학습했을 때 검증 퍼플렉서티가 20% 낮았습니다. 후속 평가에서는 단어 오류율이 절반으로 줄고 품질 점수는 5점 만점의 NISQA 평가에서 1점 높아졌습니다. 추론에서는 첫 오디오까지 걸리는 시간이 1.5배 짧고, 실시간 계수가 절반이며, 처리량은 4배였습니다.

새 아키텍처의 자세한 내용은 별도 보고서로 공개하겠습니다.

Sonic: 저지연 음성 생성

이 아키텍처로 새 음성 모델 Sonic을 학습했고 오늘 출시합니다. Sonic은 어떤 목소리로든 고품질의 사실적인 음성을 만듭니다. 모델 지연 시간은 동급 모델 중 가장 빠른 135ms입니다.

Sonic을 짧은 지연 시간과 높은 처리량으로 제공하기 위해 상태 공간 모델 추론 스택을 직접 만들고 최적화했습니다. 덕분에 고품질 모델을 더 낮은 비용으로 제공할 수 있습니다. Sonic은 웹 플레이그라운드와 저지연 API로 출시됩니다. 플레이그라운드에는 고객 지원, 엔터테인먼트, 콘텐츠 제작에 쓸 수 있는 다양한 음성 라이브러리가 있습니다. 즉석 음성 복제와 속도·감정 조절을 지원하며, 모두 API로도 사용할 수 있습니다.

가입해 사용해 보세요. 실시간 대화형 AI 개발에 협력하고 싶다면 문의 양식으로 연락해 주세요. 함께 이야기하고 싶습니다.

앞으로의 계획

더 큰 목표는 개발자와 기업이 모든 기기에서 실시간 멀티모달 경험을 만들고 실행하도록 돕는 것입니다. 오디오는 시작입니다. 모델이 모든 모달리티를 즉시 이해하고 생성하길 원합니다. 앞으로 1년간 각 모달리티에 실시간 멀티모달 지능을 도입하겠습니다.

개발자들이 좋아할 만한 오픈소스도 곧 공개할 예정입니다.

채용

모든 기기에 실시간 멀티모달 지능을 제공하는 사명에 관심이 있다면 join@cartesia.ai로 연락해 주세요.