Index Ventures主導で2,700万ドルのシード資金調達を実施しました。Lightspeed、Factory、Conviction、General Catalyst、A*、SV Angelと、90人のエンジェル投資家が参加しています。
Cartesiaのミッションは、長期記憶を持ち、どこにいても動作するリアルタイムの知能をつくることです。Transformerモデルの大規模化によって、AIは大きく変わりました。しかし、こうしたモデルには重大な制約があります。一度に処理・生成できる情報は限られ、音声なら数分、動画なら数秒にとどまります。対話の間に状態を効率よく保持できず、多くのハードウェアでリアルタイムに動かすには費用がかかりすぎます。次世代のAIには、知能の基礎となるアーキテクチャの革新が必要です。
私たちはこの目標に向け、過去数年間でS4やMambaなどの新しいアーキテクチャを開発してきました。これらにはいくつかの特性があります。計算コストは系列長に対して二次ではなく線形に増えます。長いデータ系列を固定サイズの状態に圧縮する方法を学習します。そして、推論が高速で効率的です。
世界についての膨大なコンテキストを継続して取り込み、作業記憶に圧縮し、身近なデバイス上で複数のモダリティをリアルタイムに生成するモデルの実現を目指しています。
その取り組みの大きな部分は、次世代のリアルタイムAIアプリケーションを開発するお客様に、こうしたモデルを届けることです。今年は、自然な音声を最速で生成するSonicを公開し、デバイス上でも動作させました。Sonicは個人のクリエイターやスタートアップから大企業まで、数千のお客様が本番で利用しています。次世代の音声エージェント、デジタルメディア、アシスタントを支えています。
音声や動画のように情報量の多いマルチモーダル信号を扱う、長いコンテキストの生成モデルの構築は依然として難しい課題です。モデルの制御は難しく、すぐに意図から外れてしまいます。この数か月で、異なるモダリティの複数のデータストリームを並列に扱い、継続的に推論・生成するマルチストリームモデル向けの新しいSSMアーキテクチャを開発しました。これにより、効率的なストリーミング推論と、モダリティをまたぐ細かな制御を備えたエンドツーエンドモデルを学習できます。
このマルチストリームアーキテクチャで、エンドツーエンドの音声生成モデルを学習しました。エンドツーエンド生成の自然さを保ちながら、テキストを細かく制御してハルシネーションを防ぎます。複雑で長く、繰り返しの多い原稿に従うことが苦手な従来のエンドツーエンド音声生成アーキテクチャを、根本から改善しています。多くのユーザーに役立つ改善ですが、正確さが特に重要な音声エージェントの開発者にとって大切です。以下は、録音で読み上げている英語の原文と音声の例です。
Are you available at any of the following times? 10:00am, 10:05am, 10:10am, 10:15am, 10:20am, 10:25am, 10:30am, 10:35am, 10:40am, 10:45am, 10:50am, or 10:55am?
My phone number is 8888888888.
My email address is HELLOWORLD at CARTESIA dot AI
How much wood could a woodchuck chuck if a woodchuck could chuck wood? A woodchuck would chuck as much wood as a woodchuck could chuck if a woodchuck could chuck wood.
この新モデルは、PlaygroundのSonic Previewで本日から試せます。今後数週間で、リアルタイムAPIからも利用できるようになります。
複数の入力・出力モダリティに向けて、マルチストリームSSMアーキテクチャの拡張を続けています。次世代のリアルタイムマルチモーダルAIを届けるための計画があります。この取り組みに関心がある方は、ぜひチームへの参加をご検討ください。
