Cartesiaのミッションは、どこにいても動作する、身近で双方向の知能をつくることです。モデルとプラットフォームを通じて、開発者がリアルタイムのマルチモーダルAIシステムをつくれるようにします。その出発点が音声分野での研究と、世界最速の音声生成APIであるSonicです。本日、あらゆるデバイスに知能を届けるための、最初の成果を発表します。
AIは、いずれデータセンターから離れて動けるほど効率的であるべきだと考えています。高性能なモデルをすべてのデバイスに載せれば、プライバシーを尊重しながら、今は不可能に思える量と速度で世界とやり取りするアプリケーションをつくれます。エージェント、個人アシスタント、ロボット、ゲーム、医療、交通、防衛、セキュリティなどが、その影響を受ける分野です。
私たちはこの数年間、状態空間モデル、SSMという新しいAIアーキテクチャを開発してきました。広く使われる注意機構に比べ、系列長に対するコストが二次ではなくほぼ線形に増えるため、効率的です。SSMは、長期記憶と低レイテンシを備え、あらゆるデバイスで動くリアルタイム基盤モデルの実現に重要な役割を果たすと考えています。目標に向け、今後数年間、この初期段階の技術を育てていきます。
今回、状態空間モデルをデバイス上で使えるようにします。公開するのは次の3つです。
- Edge: さまざまなアクセラレーターや環境で、デバイス向けの効率的なSSMを研究・公開するための、Apache 2.0ライセンスのオープンソースライブラリです。Reneを含む重みを公開したSSM言語モデルをまとめ、SSM用に最適化した新しいMetalカーネルを通じてAppleのハードウェアで利用できます。
- Rene: ハイブリッドなMamba-2 SSMを基盤にゼロから事前学習し、デバイス上での推論向けに設計した、13億パラメーターのオープンソース言語モデルです。
- Sonic On-Device: 非公開ベータ版です。デバイス上で低レイテンシのリアルタイムストリーミングに対応する、初の自然な音声生成モデルです。声の数に制限はなく、即時の声のクローンにも対応します。
これらは、現在のシステムに必要な計算量の制約を越える、新しいアーキテクチャとプラットフォームをつくるための成果です。ReneやSonic On-Deviceを使った次世代のデバイス向けAI製品の共同開発に関心がある方は、お問い合わせフォームからご連絡ください。
デバイス上の知能
AIでは、ますます大きな基盤モデルをつくる流れが主流です。投資や研究開発によって、今後も成長していく分野です。こうした大規模モデルは、利用者から離れた、計算資源と電力を大量に使うデータセンター向けにつくられています。
その逆を考えるとどうでしょう。「十分に大きい」モデルをエッジやデバイス上に配置することで、実現できる用途は数多くあります。
クラウド上の大規模モデルをAPIで使う方法と比べて、次の利点があります。
- データ転送を最小限にでき、音声や動画の理解など、高解像度のマルチモーダルデータを継続してモデルに入力できます。
- ネットワークのレイテンシをなくし、ほかの方法では難しい応答速度や信頼性を実現できます。
- ネットワーク接続が不要になり、接続が不安定な環境、セキュリティ要件が高い環境、通信切断を許容できない環境でもモデルを使えます。
- データはハードウェアの外に出ず、プライバシーと安全性を保てます。
デバイス上のAIは、環境を継続して処理し、リアルタイムで応答する新しいアプリケーションを可能にします。たとえば、次のような用途を考えています。
- アシスタント: あらゆるデバイスを、先回りして利用者を助け、提案する個人アシスタントにします。
- コミュニケーション: どこにいても、バベルフィッシュのように言語間を瞬時に翻訳します。
- セキュリティ: カメラ映像から異常や注目すべき出来事を見つけ、対処します。
- 医療: 患者とのやり取りを、プライバシーを守りながら行います。
- 教育: iPad上で、生徒に合わせた教材を安全かつプライバシーを保って生成します。
- ロボット: 環境の急変を捉え、高速で安定した行動を取ります。
- ゲーム: PC上で動画を生成・制御し、全体を生成するゲームをつくります。
これらは、クラウド上の試作から始まるかもしれません。しかし、最良の利用体験には、エッジやデバイス上の処理への移行が必要です。
エッジで速く、低レイテンシで効率よく動かす鍵は、新しいモデルのアーキテクチャです。状態空間モデルは、電力と計算量を抑えたエッジ向け基盤モデルを可能にする技術だと考えています。その最初の成果を紹介します。
Edge:デバイス上のSSMのためのオープンソースライブラリ
Cartesiaは、品質と効率を両立するモデルを開発者や利用者に届ける方法を探しています。そのため、SSMを使ったデバイス向けモデルを開発するライブラリ、Edgeをオープンソースで公開します。AppleのMシリーズチップを出発点に、さまざまなデバイス向けのオープンソースモデルをEdgeで開発していきます。Mamba-2用の独自Metalカーネルを含み、ノートPCとモバイルの両方で再利用できます。ローカルでの開発とテストを助けるため、Apple MLXでEdgeを使うPythonパッケージcartesia-mlxも公開しました。Edgeには、Metalカーネルのバインディングや層の量子化など、推論を最適化する機能があります。
提供状況。 Reneを含むすべての公式Mamba-2モデルが、Edgeで利用できます。当社やコミュニティからの今後の公開にもご期待ください。
Rene:13億パラメーターのオープンソースSSM言語モデル
Reneは、デバイス上で効率よく動くよう設計した小型言語モデル、SLMです。13億パラメーターを持ち、Mamba-2層とMLP層を交互に並べ、その間に一部のスライディングウィンドウ注意機構、SWAの層を配置したハイブリッドモデルです。AllenAIが公開したDolma-1.7データセットの1.5Tトークンで学習しました。
効率を優先。 Mamba-2とSWAにより、推論時のメモリ使用量は一定です。個人用の端末など、資源の限られた環境で安定して動かすために重要です。Mamba-2層によって、ほかの純粋なSSMアーキテクチャよりプリフィル時間も短くなります。
評価。 LM Evaluation Harnessを使い、標準的な言語モデリングのベンチマークで、最近のオープンソースSLMと比較しました。常識推論のCOPA、WinoGrande、ARC-Easy、ARC-Challenge、言語理解のPIQA、HellaSwag、OpenBookQA、MMLUなどが対象です。Reneは、AppleのOpenELM、11億パラメーター、GoogleのRecurrent Gemma、20億パラメーターなども上回ります。図1をご覧ください。これらのベンチマークで、同規模の20億パラメーター以下の最先端SLMと同等の性能を達成した、初の再帰アーキテクチャによるSLMです。

デバイス上での実行。 EdgeはMLXでReneを直接扱え、PyTorch実装と比べて品質は低下しません。8ビットや4ビットの量子化でも品質を保ちながら推論を速くできます。図2をご覧ください。

Sonic On-Deviceの非公開ベータ版
Sonicの公開以来、アシスタント、会話エージェント、ゲーム、教育、吹き替えなど、多くの用途で採用が進みました。同時に、レイテンシ、プライバシー、可用性のため、Sonicをデバイス上で使いたいという要望も多く寄せられました。
今回、Sonic On-Deviceの非公開ベータ版を公開します。デバイス上で低レイテンシのリアルタイムストリーミングに対応する、初の自然な音声生成モデルです。即時の声のクローン、発音、速度、感情の制御など、Sonicの機能を備えています。アプリケーション開発者や企業とともに、デバイス上の個人アシスタント、リアルタイム翻訳、吹き替えなど、次世代の音声アプリケーションをつくっていきたいと考えています。
今後に向けて
Rene、Edge、Sonic On-Deviceは、あらゆるデバイスにリアルタイムのマルチモーダル知能を届ける取り組みの始まりです。デバイス上のAIが当たり前になるには、モデルのアーキテクチャや機械学習の考え方を大きく変える必要があります。ハードウェアに最適化した次世代モデルとプラットフォームの開発を続け、どんなデバイスの利用者もリアルタイムのマルチモーダルAIの恩恵を受けられるようにします。
ReneとSonic On-Deviceで、次世代のデバイス向けAI製品を共同開発したい方は、お問い合わせフォームからご連絡ください。
