Cartesiaは、現実に近い音質、高速な応答、細かな制御を備えた音声AIをつくっています。この1年で数百万件の通話を支え、数万人のクリエイターがコンテンツをより多くの人に届けるお手伝いをしてきました。
Kleiner Perkins主導で、6,400万ドルのシリーズA資金調達を実施しました。新たな資金でチームを拡充し、音声向けの次世代モデル、インフラ、製品の研究開発に投資します。その第一歩として、最新の音声生成モデルSonic 2.0を公開します。
Sonic 2.0は新しい状態空間モデルのアーキテクチャを採用し、発表時点で最速かつ最も細かく制御できる音声モデルです。Sonicの2倍の規模でありながら、フルモデルのレイテンシは90ms、turboでは40msと、より高速に動作します。また、未使用の100種類の音声で実施したブラインド比較評価では、次点のプロバイダーよりSonic 2.0を好む人が1.5倍多いという結果でした。
Sonic 2.0は速度と品質だけでなく、生成結果をこれまで以上に細かく制御できます。複雑なアクセントや豊かな音の環境を捉える、高品質な声のクローンにも対応します。さらに、2つの新しいエンドポイントを追加しました。
- Voice changer: 音声の話し方や声を調整できます。
- Infill: 音声内の一部分を編集できます。
Cartesiaは、企業向けのインフラを備えた音声AIプラットフォームを構築しています。開発者向けに設計したSonic APIは、99.9%の稼働率と世界各地で最速のP90レイテンシを備え、音声生成のための信頼性と速度に優れた配信基盤を提供します。SOC-2とHIPAAに準拠し、オンプレミスやデバイス上でのリアルタイム実行にも対応しています。
長期的な研究も進めています。次世代の音声モデルには、ストリーミングアーキテクチャ、コーデック、長いコンテキストのモデリング、デバイス上での推論など、複数の領域でアルゴリズムの進歩が必要です。今後、その成果も紹介していきます。
音声AIへの取り組みはcartesia.ai/sonicをご覧ください。一緒に働くことに関心がある方は、ぜひご連絡ください。
