블로그 / 연구

온디바이스 지능 업데이트

Karan Goel 
온디바이스 지능 업데이트

Cartesia는 어디서나 실행되는 상호작용형 지능, 누구나 곁에서 사용할 수 있는 차세대 AI를 만들고 있습니다. 우리의 모델과 플랫폼은 오디오 분야의 발전과 세계에서 가장 빠른 생성형 음성 API Sonic을 시작으로, 개발자가 실시간 멀티모달 AI 시스템을 만들도록 돕습니다. 오늘 모든 기기에 지능을 제공하기 위한 첫 성과를 발표합니다.

우리는 AI가 궁극적으로 데이터 센터에서 벗어날 수 있을 만큼 효율적이어야 한다고 믿습니다. 그래야 모든 기기에 유능한 모델을 넣고, 개인정보를 존중하면서 오늘날 불가능해 보이는 규모와 속도로 세상과 상호작용하는 애플리케이션을 만들 수 있습니다. 에이전트, 개인 비서, 로봇공학, 게임, 의료, 교통, 국방, 보안은 이 기술이 바꿀 분야의 일부입니다.

지난 몇 년간 우리는 상태 공간 모델, SSM이라는 새 AI 아키텍처를 개척했습니다. 널리 쓰이는 어텐션 아키텍처와 달리 SSM은 시퀀스 길이에 따른 비용이 제곱이 아니라 거의 선형으로 증가해 매우 효율적입니다. SSM은 AI 발전에서 중요한 역할을 하며, 장기 기억과 짧은 지연 시간을 갖추고 모든 기기에서 실행되는 실시간 파운데이션 모델을 가능하게 할 것이라 믿습니다. 앞으로 몇 년간 이 초기 기술을 계속 발전시키며 목표에 다가가겠습니다.

이제 상태 공간 모델을 여러분의 기기로 가져옵니다. 이번에 다음을 발표합니다.

  • Edge는 다양한 가속기와 환경의 온디바이스 애플리케이션을 위해 효율적인 SSM 연구와 출시를 지원하는 Apache 2.0 오픈소스 라이브러리입니다. Rene를 비롯한 오픈웨이트 SSM 언어 모델을 한곳에 모으고, 새로운 SSM 최적화 Metal 커널을 통해 Apple 하드웨어에서 사용할 수 있게 합니다.
  • Rene는 하이브리드 Mamba-2 SSM을 기반으로 처음부터 사전 학습한 1.3B 파라미터 오픈소스 언어 모델입니다. 온디바이스 추론에 맞춰 설계했습니다.
  • Sonic On-Device는 비공개 베타로 제공합니다. 기기에서 짧은 지연 시간의 실시간 스트리밍을 지원하는 최초의 사실적인 생성형 음성 모델로, 무제한 목소리와 즉석 음성 복제를 제공합니다.

세 출시는 기존 시스템의 연산 요구량을 넘어설 새로운 모델 아키텍처와 플랫폼을 만들기 위한 성과입니다. Rene와 Sonic On-Device로 차세대 온디바이스 AI 제품을 함께 만들고 싶다면 문의 양식으로 연락해 주세요.

온디바이스 지능

AI의 주된 흐름은 더 큰 파운데이션 모델을 만드는 것입니다. 투자와 연구개발이 늘며 이 분야는 계속 성장할 것입니다. 이런 대형 모델은 사용 장소에서 멀리 떨어진, 연산과 에너지를 많이 쓰는 데이터 센터용으로 만들어집니다.

반대 방향은 어떨까요? “충분히 큰” 모델을 엣지나 기기에 배포하면 가능해질 사용 사례가 아주 많습니다.

이 방식은 API로 클라우드의 대형 모델을 호출하는 방식과 비교해 다음 장점이 있습니다.

  • 데이터 전송을 최소화해 오디오나 영상 이해를 위한 고해상도 멀티모달 데이터를 모델에 계속 스트리밍할 수 있습니다.
  • 네트워크 지연을 없애 다른 방식으로는 달성하기 어려운 애플리케이션 지연 시간과 안정성을 얻습니다.
  • 네트워크 연결이 필요 없어 연결이 나쁘거나 보안 요구가 높거나 연결 중단을 허용할 수 없는 환경에서도 모델을 사용할 수 있습니다.
  • 배포가 하드웨어의 물리적 경계 밖으로 나가지 않아 완전히 비공개로 안전하게 유지됩니다.

온디바이스 AI는 주변 환경을 계속 처리하고 실시간으로 반응하는 새 애플리케이션을 가능하게 합니다. 우리가 기대하는 사용 사례는 다음과 같습니다.

  • 비서: 모든 기기를 사용자를 먼저 돕고 제안하는 개인 비서로 바꿉니다.
  • 의사소통: 어디서든 Babelfish처럼 언어 사이를 즉시 번역합니다.
  • 보안: 카메라 영상에서 이상 상황과 관심 이벤트를 찾아 대응합니다.
  • 의료: 의료 상호작용에서 환자와 비공개로 소통합니다.
  • 교육: iPad에서 학생 맞춤 교육 콘텐츠를 안전하게 만들며 개인정보를 지킵니다.
  • 로봇: 빠르게 변하는 환경을 인지하고 빠르고 안정적으로 행동합니다.
  • 게임: PC에서 영상을 생성하고 제어해 완전히 생성형인 게임을 만듭니다.

이런 사용 사례는 클라우드에서 실행되는 프로토타입으로 시작할 수 있지만, 최상의 사용자 경험을 위해서는 엣지나 온디바이스 컴퓨팅으로 옮겨야 합니다.

새 모델 아키텍처는 더 빠르고 지연 시간이 짧으며 효율적인 엣지 배포의 핵심입니다. 우리는 상태 공간 모델이 전력과 연산을 효율적으로 쓰는 엣지 파운데이션 모델의 핵심 기술이 될 것이라 생각합니다. 그 첫 결과를 공유합니다.

Edge: 온디바이스 SSM을 위한 오픈소스 라이브러리

Cartesia의 주요 목표 중 하나는 개발자와 사용자 모두에게 품질 좋고 효율적인 모델을 제공할 새 방법을 찾는 것입니다. 이를 위해 SSM 기반 온디바이스 모델 개발 라이브러리 Edge를 공개합니다. Apple M 시리즈 칩을 시작으로 다양한 기기용 오픈소스 모델을 Edge에서 개발할 예정입니다. Edge에는 노트북과 모바일 배포에 재사용할 수 있는 Mamba-2 커스텀 Metal 커널이 포함됩니다. 로컬 개발과 테스트를 돕기 위해 Apple MLX에서 Edge를 기반으로 개발하는 Python 패키지 cartesia-mlx도 출시했습니다. Edge는 Metal 커널 바인딩, 계층 양자화 등 최적화된 추론을 기본 지원합니다.

현재 Rene를 비롯한 모든 공식 Mamba-2 모델을 Edge에서 사용할 수 있습니다. Cartesia와 커뮤니티의 추가 출시도 기대해 주세요.

Rene: 오픈소스 1.3B SSM 언어 모델

Rene는 효율적인 온디바이스 사용을 위한 소형 언어 모델, SLM입니다. 1.3B 파라미터를 갖춘 하이브리드 SLM으로, Mamba-2와 MLP 계층을 번갈아 배치하고 일부 슬라이딩 윈도 어텐션, SWA 계층을 사이에 넣었습니다. 공개된 Dolma-1.7 데이터셋의 1.5T 토큰으로 학습했습니다. AllenAI에 감사드립니다.

Mamba-2와 SWA를 사용해 Rene의 추론 시 메모리 사용량은 고정됩니다. 개인용 컴퓨팅 기기처럼 자원이 제한된 환경에서 안정적으로 실행하는 데 중요합니다. Mamba-2 계층은 다른 순수 SSM 아키텍처보다 프리필 시간도 단축합니다.

LM Evaluation Harness로 여러 표준 언어 모델링 벤치마크에서 Rene를 최근 오픈소스 SLM들과 비교했습니다. 상식 추론 COPA, WinoGrande, ARC-Easy, ARC-Challenge와 언어 이해 PIQA, HellaSwag, OpenBookQA, MMLU 등 여러 범주를 포함합니다. Rene는 Apple OpenELM 1.1B와 Google recurrent Gemma 2B 같은 SLM도 앞섭니다. 그림 1을 참고하세요. 이 벤치마크 전반에서 비슷한 크기, 2B 파라미터 이하의 최신 SLM과 유사한 성능을 달성한 최초의 순환 아키텍처 기반 SLM입니다.

Rene: 오픈소스 1.3B SSM 언어 모델

Edge는 PyTorch 구현 대비 품질 손실 없이 MLX에서 Rene를 기본 지원합니다. 또한 그림 2처럼 품질 손실 없이 더 빠르게 추론하도록 8비트와 4비트 양자화를 지원합니다.

Rene: 오픈소스 1.3B SSM 언어 모델

Sonic On-Device 비공개 베타

Sonic 출시 이후 비서, 대화형 에이전트, 게임, 교육, 더빙 등 다양한 분야에서 사용되는 모습을 보았습니다. 그동안 지연 시간, 개인정보 보호, 가용성을 이유로 Sonic의 온디바이스 버전을 요청하는 분들이 많았습니다.

이번 업데이트와 함께 Sonic On-Device 비공개 베타를 출시합니다. Sonic On-Device는 기기에서 짧은 지연 시간의 실시간 스트리밍을 지원하는 최초의 사실적인 생성형 음성 모델입니다. 즉석 복제와 발음, 속도, 감정 제어 등 Sonic의 모든 기능을 갖췄습니다. 애플리케이션 개발자와 기업이 온디바이스 개인 비서, 실시간 번역과 더빙 같은 차세대 음성 애플리케이션을 만드는 데 함께하겠습니다.

모든 기기의 실시간 지능을 향해

Rene, Edge, Sonic On-Device는 모든 기기에 실시간 멀티모달 지능을 제공하기 위한 시작입니다. 온디바이스 AI가 일상이 되는 미래에는 모델 아키텍처와 머신러닝을 바라보는 사고의 전환이 필요하다고 믿습니다. 어떤 사용자든 어떤 기기에서든 실시간 멀티모달 AI를 사용할 수 있도록 하드웨어에 최적화된 차세대 모델과 플랫폼을 계속 만들겠습니다.

영상은 원래 녹화된 언어를 유지합니다. Rene와 Sonic On-Device로 차세대 온디바이스 AI 제품을 함께 만들고 싶다면 문의 양식으로 연락해 주세요.