本日、Voice Changerを公開しました。元の話し方や感情を保ちながら、音声クリップの声を変換する新しいモデルです。
スタジオ品質の音声ライブラリから声を選ぶか、自分の声をクローンできます。発声、感情、韻律などの細かなニュアンスも、思いどおりに制御できます。
自然な話し方を保つ
Voice Changerは、元のクリップが持つ、個性のある自然で魅力的な話し方を保ちます。
こちらは『不思議の国のアリス』第12章「Alice’s Evidence」の朗読です。入力音声を、PlaygroundにあるChild、Movie Guy、Reading Lady、Wizardの4種類の声に変換しました。
変換した各クリップが、元の朗読者の表現、ため息や感嘆などの発声、韻律を保っている点に注目してください。一つのクリップ内で朗読者の声を5回切り替える編集をしても、話し方がそろっているため自然につながります。
この元のクリップを、
以下のように、それぞれ異なる声に変換できました。
話し方を細かく制御する
音声合成は文脈を理解しますが、原稿の読み方を厳密に指定したいこともあります。Voice Changerなら、感情からタイミングまで、話し方の各要素を細かく調整できます。
こちらの例を聴き比べてください。
活用例
Voice Changerには、さまざまな使い方があります。
- クリエイター: 意図したとおりの話し方で録音し、好きな声に変換して、個性と感情のあるコンテンツをつくれます。
- ゲーム・エンターテインメント: 台詞を意図したとおりに演じ、各台詞を好みのキャラクターの声に変換できます。スタジオ品質の体験をつくれます。
- リスナー: 好きなオーディオブック、講義、ポッドキャストの声を変え、登場人物ごとに異なる声を割り当てられます。
- 企業: 従業員が、ブランドや目的に合った表現豊かで自然なスタジオ品質の音声を短時間で作成できます。
Sonicの音声生成とVoice Changerを組み合わせれば、音声を生成したあと、好みの話し方に調整できます。
新しい使い方のアイデアはありますか。Xの@cartesia_aiで教えていただくか、開発者ショーケースに投稿してください。
使い始める
Voice Changerは、Playgroundで次の3ステップで利用できます。
- 自分の声を録音するか、ファイルをアップロードします。
- 変換先の声を選びます。
- 新しい声で高品質な音声を生成します。
詳しい実装ガイドやAPIドキュメントは、開発者ポータルをご覧ください。
状態空間モデルを基盤に
Voice Changerも当社のほかのモデルと同じく、状態空間モデル、SSMのアーキテクチャに関する研究を基盤にしています。この根本的に異なる手法により、音声のような高解像度のモダリティを高品質で処理・生成できます。当社のチームが開発したS4やMambaなどの状態空間モデルは、系列長に対するコストがほぼ線形に増えるため、高品質な音声生成に適しています。
私たちと一緒に
開発者やクリエイターの皆さんが、Voice Changerでどんな体験をつくるか楽しみにしています。
- 試してみる: 登録して、Voice Changerを体験してください。
- 法人向けサポート: 個別のソリューション、SLA、大口料金をご希望の場合はフォームにご記入ください。
- チームに参加する: AIの開発を進めるため、幅広い職種で採用しています。
