テキストを音声に変換、MP3ファイルに

Sonicで文章を自然な音声に変換。声を選んで原稿を聴き、アプリでの再生、電話の案内、ナレーション用のMP3をダウンロードできます。
58/500

文章を入力し、声を選んでMP3を作成できます。

あなたの原稿を、すぐ聴ける音声に

短い文章で声を確認してから、プレーヤー用のファイルを生成します。後で録音を修正できるよう、原稿を保存しておきましょう。

01

原稿を準備する

音声ファイルにする文章を書きます。なじみのない略語は正式な表現にし、最終版を生成する前に名前、日付、数字を確認してください。

02

プレビューを聴く

プレビューで文章を試し、声を比較します。MP3を作る前に、話し方を確認してください。

03

MP3を保存する

「MP3を作成」を選び、音声ファイルをダウンロードします。聞き手が使うプレーヤーでもう一度確認してください。

MP3を生成、APIから

原稿をSonicに送り、応答をナレーション、教材、アプリ再生用のMP3として保存できます。

リクエストを設定する

MP3出力を選び、Bytes APIのリクエストに原稿、声、モデルを含めます。APIキーを公開しないよう、バックエンドから送信してください。

音声の応答を保存する

リクエストの成功を確認してから、応答のバイト列をMP3ファイルとして保存します。APIエラーを先に処理し、保存した音声を再生して結果を確認してください。

MP3の出力設定
output_format = {
    "container": "mp3",
    "sample_rate": 44100,
    "bit_rate": 128000,
}

形式
MP3
サンプルレート
44.1 kHz
ビットレート
128 kbps

使う場所に合った形式を選ぶ

プレーヤーが対応する形式から選んでください。電話連携とダウンロード用のナレーションでは、必要な設定が異なる場合があります。

MP3

再生と共有に

ナレーション、アプリのメッセージ、MP3対応プレーヤー向けの圧縮音声です。リクエストでビットレートとサンプルレートを選びます。

WAV

編集作業に

PCM音声を格納するファイル形式です。エディターや公開までの工程で、圧縮MP3ではなくWAVが必要な場合に使えます。

raw音声

システム連携に

ファイルヘッダーのない音声サンプルです。エンコーディングとサンプルレートを、プレーヤーや電話システムに合わせてください。

音声ファイルを活用する

固定の電話案内

確認済みの原稿から挨拶や営業時間外の案内を生成できます。アップロード前に電話システムのMP3対応を確認してください。WAVやraw音声が必要なシステムもあります。

アプリ内の音声

操作説明や短いメッセージを保存してアプリで再生できます。各ファイルと原稿を一緒に管理すると、利用者がどの版を聴くか把握できます。

声の評価

同じテスト文章で声を比較できます。お客様向けエージェントの声を選ぶ前に、発音とテンポを確認してください。

テキストからMP3への変換についてのよくある質問

APIの出力形式をMP3に設定するにはどうすればよいですか?

Text-to-Speech Bytesエンドポイントを使い、output_formatを{"container":"mp3","sample_rate":44100,"bit_rate":128000}に設定します。リファレンスに従い、ほかの必須フィールドと認証情報も指定してください。これは44.1 kHz、128 kbpsのMP3を選ぶ設定例で、すべての用途に必須ではありません。応答は音声バイト列で、JSONのダウンロードURLではありません。

結果をMP3ファイルとしてダウンロードできますか?

はい。上のツールに文章を入力し、声を選んで「MP3を作成」を押してください。完成したら「MP3をダウンロード」を選びます。アプリケーションでは、Bytes APIにMP3をリクエストし、成功した応答を.mp3ファイルとして保存してください。

テキストからMP3への変換は無料ですか?

このページでは、アカウントなしで短いMP3サンプルを試聴・ダウンロードできます。APIでの生成にはアカウントのクレジットを使用します。含まれるクレジット、追加利用、商用利用の条件はCartesiaの現在のプランをご覧ください。

リアルタイム音声エージェントにはMP3とPCMのどちらを使えばよいですか?

接続先が求める形式を使ってください。MP3はファイル再生向けに音声を圧縮し、PCMはMP3圧縮をせずに音声サンプルを表します。ライブ通話では、MP3ではなく特定のrawエンコーディングとサンプルレートが必要な場合があります。出力設定を選ぶ前に音声連携ガイドを確認してください。ファイルのダウンロード速度は、会話全体の遅延を示すものではありません。

どの言語と音声コントロールを使えますか?

対応言語は現在のSonicモデルのドキュメントで確認してください。対応モデルには音量、速度、感情のコントロールがあります。選んだ声を対象言語ごとにテストし、名前、略語、数字に注目してください。音声生成の結果は用途に合わせた確認が必要です。

生成した音声をIVRの挨拶に使えますか?

電話システムがそのファイル形式に対応し、声と文章を使うために必要な権利があれば利用できます。確認済みの原稿から固定の挨拶を生成し、電話回線を通してテストしてください。録音済みの挨拶は、相手の返答を理解しません。対話型の通話にはCartesia Managed Agentsをご覧ください。

このページのプレビューからMP3をダウンロードできますか?

はい。「MP3を作成」で、選択した文章、声、言語からファイルを生成します。完了すると「MP3をダウンロード」が表示されます。文章や声を変えると前のダウンロードは消去され、更新した内容で新しいファイルを作れます。

MP3のサンプルレートとビットレートは何が違いますか?

サンプルレートは1秒間に音声を標本化する回数、ビットレートは1秒間に保存する圧縮音声データの量を表します。再生環境に合う対応設定を選んでください。このページの例は1秒あたり44100サンプル、128000ビットですが、すべてのプロジェクトに必須の設定ではありません。

文書やPDFをMP3に変換できますか?

読み上げたい文章をコピーし、生成前に確認してください。ページ番号、繰り返される見出しなど、読み上げ不要な部分を取り除きます。音声APIはテキストを受け取ります。このページでアップロードしたPDFから文章を抽出する機能はありません。

保存したMP3が再生できないのはなぜですか?

まずAPIリクエストが成功し、応答をバイナリ音声として保存したか確認してください。MP3コンテナを指定したことと、選んだ設定にプレーヤーが対応していることも確認します。WAVファイルの名前を.mp3に変えても、音声形式は変換されません。

長い原稿をMP3ナレーションにするにはどう準備すればよいですか?

短い抜粋で声を選び、発音を確認することから始めてください。長い原稿は個別に確認できる単位に分け、声と出力設定を統一します。エディターで最終版を組み立てる前に、各つなぎ目を聴いてください。後の修正で全文を書き直さずに済むよう、原稿を保存しておきましょう。

声を使って、次の制作へ

次の原稿に合う声を比べたり、アプリケーションから音声を生成する方法を確認したりできます。

原稿に合う声を探す

最終ファイルを作る前に、短い文章で声を比較しましょう。音声ジェネレーターで、それぞれの声が自分の文章をどう読むか確認できます。

音声ジェネレーターを試す

Pythonから音声を生成する

Python SDKを設定し、最初の音声合成リクエストを送ります。完全なサンプルから始めて、プロジェクトに必要な出力形式を選んでください。

Pythonで開発する

今すぐ始める

専門家に相談する。

音声体験の開発にCartesiaをどう活用できるか、私たちのチームにご相談ください。

営業に問い合わせる

開発を始める。

APIでモデルにアクセスし、数分で音声エージェントを本番環境に導入できます。

Cartesiaを試す