ブログ / 研究

Sonicの発表:自然な音声を生成する低レイテンシの音声モデル

Karan Goel 
Sonicの発表:自然な音声を生成する低レイテンシの音声モデル

私たちは、あらゆるデバイスに長く使い続けられるリアルタイムの知能を届けるため、Cartesiaを設立しました。その出発点は、状態空間モデルというアーキテクチャの革新です。本日、自然な話し声を生成する低レイテンシの音声モデル、Sonicを公開します。

リアルタイムの知能をつくる

どんな長さのコンテキストも処理し、世界中のあらゆるデバイスで動き、どんなモダリティもリアルタイムで直接扱う、非常に効率的なAIを想像してください。知能が身近にあり、長く存在し続ける世界です。私たちと会話して周囲の理解や行動を助け、自律的に複雑な問題を解きます。誰もが、自分の必要に合わせた、プライバシーを守る知能をすぐに使い、制御し、実行できます。

その未来には、根本的に新しい知能のアーキテクチャが必要だと考えています。現在のモデルは、人の知能が示す水準に遠く及びません。世界を私たちほど細かく理解できず、動作は遅く高価で、その開発や提供が大企業に集中しています。最高のモデルでさえ、1年分の音声、動画、テキストを継続的に処理して推論することはできません。テキストなら10億、音声なら100億、動画なら1兆トークンです。デバイス上での実行はなおさらです。データセンターを動員せずに使える安価な知能を、誰もが利用できるべきではないでしょうか。

この構想を実現することが、私たちの仕事です。共同創業者のAlbertとKaranは、過去4年間、状態空間モデル、SSMという新しい手法を共同で開発してきました。AIモデルをつくる、根本的に効率の高い方法です。SSMは、人のように情報をストリームとして取り込める、効率的なリアルタイムモデルの学習基盤になります。S4やMambaは、私たちのチームがTri Daoとともに大学で開発した状態空間モデルです。現在、世界中で急速に採用が進み、視覚、ロボット、生物学向けの変種から、JambaやZambaなどの言語モデルまで、大学や企業の研究を刺激しています。AIがこれまで以上に効率的で身近になる未来を示しています。

Cartesiaは、知能の効率を最適化することに取り組んでいます。誰にとっても速く、安く、利用しやすくするためです。あらゆるデバイスで動く、長く使えるリアルタイムの知能を支えるプラットフォームを構築しています。

リアルタイムの知能には多様な形があります。最初の目標は、長期記憶を持つリアルタイム会話AIです。モデルが音声を直接理解して会話し、やり取りを長く記憶し、問題を解くために行動できる、新しい計算基盤です。リアルタイムのゲームからカスタマーサポートまで、新しい体験が生まれると考えています。以下で開発の初期成果を紹介します。

高解像度のモダリティを扱う低レイテンシのモデル

リアルタイムの知能をつくるうえで、レイテンシは大きな課題です。入力を受けたモデルは、すぐに応答するべきです。音声や動画などを高解像度のまま効率よく低レイテンシで生成する、新しいSSMアーキテクチャの開発を進めてきました。リアルタイム会話AIに向け、まず発話や音声で手法を試し、拡張しています。

これまでの実験では、音声生成に広く使われるTransformerの実装と比べ、モデル品質、推論速度、スループット、レイテンシを同時に改善できました。パラメーター数をそろえ、Multilingual Librispeechで1エポック学習したCartesiaモデルは、検証パープレキシティが20%低くなりました。下流の評価では、単語誤り率が半分になり、NISQAによる5点満点の品質スコアが1点上がりました。推論時は、最初の音声までの時間を1.5分の1、リアルタイム係数を半分に短縮し、スループットを4倍にしました。

新しいアーキテクチャの詳しい説明は、別の報告で公開する予定です。

Sonic:低レイテンシの音声生成

このアーキテクチャで学習した新しい音声モデル、Sonicを本日公開します。Sonicは、任意の声で自然な高品質の音声を生成します。モデルのレイテンシは135msで、このクラスのモデルで最速です。

独自のSSM推論基盤を構築・最適化し、Sonicを低レイテンシかつ高スループットで提供します。これにより、高品質なモデルを低コストで利用できます。SonicはウェブのPlaygroundと低レイテンシのAPIで公開しています。Playgroundには、カスタマーサポート、エンターテインメント、コンテンツ制作向けの多様な音声ライブラリがあります。即時の声のクローンや、速度・感情を調整する音声デザインにも対応し、すべてAPIから利用できます。

登録してお試しください。リアルタイム会話AIの共同開発に関心がある方は、フォームからご連絡ください。ぜひお話ししましょう。

今後の予定

より大きな目標は、開発者や企業が、あらゆるデバイスでリアルタイムのマルチモーダル体験を構築・実行できるようにすることです。音声はその始まりです。モデルがどんなモダリティも瞬時に理解・生成できるようにしたいと考えています。今後1年で、各モダリティにリアルタイムのマルチモーダル知能を届けていきます。

開発者の皆さんに喜んでいただけると考えている、オープンソースの公開も近日中に予定しています。

採用情報

あらゆるデバイスにリアルタイムのマルチモーダル知能を届けるミッションに関心がある方は、join@cartesia.aiまでご連絡ください。