テキストを音声に変換、MP3ファイルに
文章を入力し、声を選んでMP3を作成できます。
あなたの原稿を、すぐ聴ける音声に
短い文章で声を確認してから、プレーヤー用のファイルを生成します。後で録音を修正できるよう、原稿を保存しておきましょう。
原稿を準備する
音声ファイルにする文章を書きます。なじみのない略語は正式な表現にし、最終版を生成する前に名前、日付、数字を確認してください。
プレビューを聴く
プレビューで文章を試し、声を比較します。MP3を作る前に、話し方を確認してください。
MP3を保存する
「MP3を作成」を選び、音声ファイルをダウンロードします。聞き手が使うプレーヤーでもう一度確認してください。
MP3を生成、APIから
原稿をSonicに送り、応答をナレーション、教材、アプリ再生用のMP3として保存できます。
リクエストを設定する
MP3出力を選び、Bytes APIのリクエストに原稿、声、モデルを含めます。APIキーを公開しないよう、バックエンドから送信してください。
音声の応答を保存する
リクエストの成功を確認してから、応答のバイト列をMP3ファイルとして保存します。APIエラーを先に処理し、保存した音声を再生して結果を確認してください。
- 形式
- MP3
- サンプルレート
- 44.1 kHz
- ビットレート
- 128 kbps
使う場所に合った形式を選ぶ
プレーヤーが対応する形式から選んでください。電話連携とダウンロード用のナレーションでは、必要な設定が異なる場合があります。
MP3
再生と共有に
ナレーション、アプリのメッセージ、MP3対応プレーヤー向けの圧縮音声です。リクエストでビットレートとサンプルレートを選びます。
WAV
編集作業に
PCM音声を格納するファイル形式です。エディターや公開までの工程で、圧縮MP3ではなくWAVが必要な場合に使えます。
raw音声
システム連携に
ファイルヘッダーのない音声サンプルです。エンコーディングとサンプルレートを、プレーヤーや電話システムに合わせてください。
音声ファイルを活用する
固定の電話案内
確認済みの原稿から挨拶や営業時間外の案内を生成できます。アップロード前に電話システムのMP3対応を確認してください。WAVやraw音声が必要なシステムもあります。
アプリ内の音声
操作説明や短いメッセージを保存してアプリで再生できます。各ファイルと原稿を一緒に管理すると、利用者がどの版を聴くか把握できます。
声の評価
同じテスト文章で声を比較できます。お客様向けエージェントの声を選ぶ前に、発音とテンポを確認してください。
テキストからMP3への変換についてのよくある質問
APIの出力形式をMP3に設定するにはどうすればよいですか?
Text-to-Speech Bytesエンドポイントを使い、output_formatを{"container":"mp3","sample_rate":44100,"bit_rate":128000}に設定します。リファレンスに従い、ほかの必須フィールドと認証情報も指定してください。これは44.1 kHz、128 kbpsのMP3を選ぶ設定例で、すべての用途に必須ではありません。応答は音声バイト列で、JSONのダウンロードURLではありません。
結果をMP3ファイルとしてダウンロードできますか?
はい。上のツールに文章を入力し、声を選んで「MP3を作成」を押してください。完成したら「MP3をダウンロード」を選びます。アプリケーションでは、Bytes APIにMP3をリクエストし、成功した応答を.mp3ファイルとして保存してください。
テキストからMP3への変換は無料ですか?
このページでは、アカウントなしで短いMP3サンプルを試聴・ダウンロードできます。APIでの生成にはアカウントのクレジットを使用します。含まれるクレジット、追加利用、商用利用の条件はCartesiaの現在のプランをご覧ください。
リアルタイム音声エージェントにはMP3とPCMのどちらを使えばよいですか?
接続先が求める形式を使ってください。MP3はファイル再生向けに音声を圧縮し、PCMはMP3圧縮をせずに音声サンプルを表します。ライブ通話では、MP3ではなく特定のrawエンコーディングとサンプルレートが必要な場合があります。出力設定を選ぶ前に音声連携ガイドを確認してください。ファイルのダウンロード速度は、会話全体の遅延を示すものではありません。
どの言語と音声コントロールを使えますか?
対応言語は現在のSonicモデルのドキュメントで確認してください。対応モデルには音量、速度、感情のコントロールがあります。選んだ声を対象言語ごとにテストし、名前、略語、数字に注目してください。音声生成の結果は用途に合わせた確認が必要です。
生成した音声をIVRの挨拶に使えますか?
電話システムがそのファイル形式に対応し、声と文章を使うために必要な権利があれば利用できます。確認済みの原稿から固定の挨拶を生成し、電話回線を通してテストしてください。録音済みの挨拶は、相手の返答を理解しません。対話型の通話にはCartesia Managed Agentsをご覧ください。
このページのプレビューからMP3をダウンロードできますか?
はい。「MP3を作成」で、選択した文章、声、言語からファイルを生成します。完了すると「MP3をダウンロード」が表示されます。文章や声を変えると前のダウンロードは消去され、更新した内容で新しいファイルを作れます。
MP3のサンプルレートとビットレートは何が違いますか?
サンプルレートは1秒間に音声を標本化する回数、ビットレートは1秒間に保存する圧縮音声データの量を表します。再生環境に合う対応設定を選んでください。このページの例は1秒あたり44100サンプル、128000ビットですが、すべてのプロジェクトに必須の設定ではありません。
文書やPDFをMP3に変換できますか?
読み上げたい文章をコピーし、生成前に確認してください。ページ番号、繰り返される見出しなど、読み上げ不要な部分を取り除きます。音声APIはテキストを受け取ります。このページでアップロードしたPDFから文章を抽出する機能はありません。
保存したMP3が再生できないのはなぜですか?
まずAPIリクエストが成功し、応答をバイナリ音声として保存したか確認してください。MP3コンテナを指定したことと、選んだ設定にプレーヤーが対応していることも確認します。WAVファイルの名前を.mp3に変えても、音声形式は変換されません。
長い原稿をMP3ナレーションにするにはどう準備すればよいですか?
短い抜粋で声を選び、発音を確認することから始めてください。長い原稿は個別に確認できる単位に分け、声と出力設定を統一します。エディターで最終版を組み立てる前に、各つなぎ目を聴いてください。後の修正で全文を書き直さずに済むよう、原稿を保存しておきましょう。
声を使って、次の制作へ
次の原稿に合う声を比べたり、アプリケーションから音声を生成する方法を確認したりできます。
今すぐ始める
専門家に相談する。
音声体験の開発にCartesiaをどう活用できるか、私たちのチームにご相談ください。
開発を始める。
APIでモデルにアクセスし、数分で音声エージェントを本番環境に導入できます。