블로그 / 소식

시드 투자 유치를 발표합니다

Karan Goel 
시드 투자 유치를 발표합니다

Index Ventures가 주도하고 Lightspeed, Factory, Conviction, General Catalyst, A*, SV Angel과 엔젤 투자자 90명이 참여한 $27M 시드 투자를 발표합니다.

Cartesia의 사명은 어디서나 실행되며 오래 기억하는 실시간 지능을 만드는 것입니다. Transformer 모델의 확장으로 AI는 큰 변화를 겪었습니다. 하지만 이 모델에는 중요한 한계가 있습니다. 한 번에 처리하고 생성하는 정보가 몇 분의 오디오나 몇 초의 영상으로 짧고, 상호작용 사이의 상태를 효율적으로 유지하지 못하며, 대부분의 하드웨어에서 실시간으로 실행하기에 너무 비쌉니다. 차세대 AI에는 지능의 기본 아키텍처 변화가 필요합니다.

지난 몇 년간 이 비전을 향해 S4와 Mamba 같은 새 아키텍처를 개척했습니다. 이들은 연산 비용이 시퀀스 길이에 따라 제곱이 아니라 선형으로 늘고, 긴 데이터 시퀀스를 고정 크기 상태로 압축하는 법을 학습하며, 빠르고 효율적으로 추론합니다.

우리는 세상의 방대한 문맥을 계속 받아 작업 기억으로 압축하고 가까운 기기에서 여러 모달리티를 실시간으로 생성하는 모델의 미래를 만들고 있습니다.

실시간 AI 애플리케이션의 미래를 만드는 고객에게 최신 모델을 제공하는 것도 사명의 큰 부분입니다. 올해 가장 빠르고 사실적인 음성 생성 모델 Sonic을 출시하고 온디바이스로 가져왔습니다. 개인 크리에이터와 스타트업부터 대기업까지 수천 고객의 프로덕션에서 차세대 음성 에이전트, 디지털 미디어, 비서를 지원하고 있습니다.

오디오와 영상처럼 풍부한 멀티모달 신호를 위한 긴 문맥 생성 모델은 여전히 어렵습니다. 제어하기 어렵고 금방 의도에서 벗어납니다. 지난 몇 달간 서로 다른 모달리티의 여러 데이터 스트림을 병렬로 계속 추론하고 생성하는 멀티스트림 모델용 새 SSM 아키텍처를 만들었습니다. 효율적인 스트리밍 추론과 모달리티 전반의 세밀한 제어를 갖춘 엔드투엔드 모델을 학습할 수 있습니다.

멀티스트림 아키텍처로 학습한 엔드투엔드 음성 생성 모델은 텍스트를 세밀하게 제어해 환각을 막으면서 엔드투엔드 생성의 사실성을 유지합니다. 복잡하고 길며 반복적인 텍스트를 따르기 어려웠던 기존 오디오 생성 아키텍처보다 근본적으로 개선되었습니다. 모든 사용자에게 중요하지만 정확성이 필수인 음성 에이전트 개발자에게 특히 중요합니다. 다음은 예시입니다. 오디오와 이에 대응하는 전사는 원래 영어를 유지합니다.

Are you available at any of the following times? 10:00am, 10:05am, 10:10am, 10:15am, 10:20am, 10:25am, 10:30am, 10:35am, 10:40am, 10:45am, 10:50am, or 10:55am?

My phone number is 8888888888.

My email address is HELLOWORLD at CARTESIA dot AI

How much wood could a woodchuck chuck if a woodchuck could chuck wood? A woodchuck would chuck as much wood as a woodchuck could chuck if a woodchuck could chuck wood.

오늘 플레이그라운드의 Sonic Preview에서 새 모델을 사용해 볼 수 있습니다. 앞으로 몇 주 안에 실시간 API로도 제공할 예정입니다.

멀티스트림 SSM 아키텍처를 여러 입력·출력 모달리티로 계속 확장하고 있습니다. 차세대 실시간 멀티모달 AI를 제공하려는 계획에 관심이 있다면 함께해 주세요.