音声合成で支える、リアルタイム音声エージェント
声を聴く、あなたの言葉で
アプリケーションで話す一文を試してください。同じ言葉で声を比較し、発音とテンポを聴いてみましょう。
音声を組み込む、あなたのアプリに
Sonicはアプリケーションが作る文章を音声に変換します。アプリケーションが応答内容を用意し、音声モデルがそれを話します。
声を選ぶ
アプリケーションで実際に話す言葉を使ってテストしてください。挨拶だけに頼らず、名前、数字、略語も評価に含めましょう。
APIで音声を生成する
アプリケーションから文章を送り、合成音声を受け取ります。声と出力形式を選び、応答を再生するかファイルとして保存できます。
応答をストリーミングする
会話の再生にはストリーミング音声を使えます。ネットワーク転送や再生バッファーも含め、利用者が音声を聴くまでの時間を測定してください。
ブラウザーで再生する?音声APIを使う?
どちらも文章を音声に変換します。音声をどこで動かすか、アプリケーションでどう使うかに合わせて選んでください。
ブラウザーの音声合成
ブラウザーのSpeechSynthesisインターフェースを使い、端末の声で再生します。利用できる声はブラウザーとOSによって異なります。
適した用途:ウェブページでの文章の読み上げ.
ブラウザーTTSガイドを読むCartesiaの音声API
IDでSonicの声を選び、バックエンドから音声を生成します。ウェブ、モバイル、電話アプリケーションで音声をストリーミング、保存、再生できます。
適した用途:アプリケーション向けの音声生成.
音声APIを見る(英語)あらゆる用途に、人間らしく表現豊かな声を
用途の異なる音声例を聴いてみてください。話し方を比べてから、聞き手が実際に聴く言葉で声を試しましょう。
サポート
英語の原音声
音声合成でカスタマーサポートの回答を音声に変換。サービスの更新や問題解決の手順を、通話やアプリケーションで一貫した声で伝えられます。
ゲーム
原音声サンプル
ゲームの原稿からキャラクターの台詞を生成します。役ごとに声を比べ、新しい台詞を場面の中で聴いて、テンポや演技を確認できます。
コンテンツ
原音声サンプル
動画、チュートリアル、製品解説のナレーションを文章から作れます。原稿を修正して新しい音声を生成できるため、一行ずつ録り直す必要はありません。
メディア
原音声サンプル
記事や物語を音声に変換。ポッドキャストの導入やニュースの読み上げに音声合成を使い、公開前に名前と発音を確認できます。
医療
英語の原音声
チームで確認済みの文章から、予約のリマインダーや患者向けの案内を読み上げます。定型的な説明や予定変更を一貫した声で伝えられます。
営業
英語の原音声
製品デモや営業用の解説に音声ナレーションを加えられます。原稿を複数の声で試し、製品やメッセージが変わったら音声を更新できます。
音声エージェント
英語の原音声
アプリケーションの文章から、AI音声エージェントの応答を生成します。挨拶や会話の声を選び、短い返答と長い応答の両方をテストしてください。
吹き替え
日本語の原音声
翻訳済みの原稿から、ローカライズ用の音声を生成します。対応言語の声を比較し、動画に追加する前に発音とタイミングを確認してください。
アバター
原音声サンプル
デジタルアバターに合成音声を組み合わせ、プレゼンテーションやガイドを作れます。文章から台詞を生成し、アバターのアニメーションに再生を合わせます。
物流
英語の原音声
配送状況や配車の指示を音声メッセージに変換。音声合成をアプリケーションに接続し、最新の配送情報を音声に反映できます。
採用
原音声サンプル
承認済みの原稿から、面接の導入や候補者向けの日程案内を作れます。説明の一貫性を保ち、採用手順が変わったら音声を再生成できます。
アクセシビリティ
原音声サンプル
ガイド、記事、教材を音声でも提供できます。利用者は自分のペースで内容を聴き、原文を追うことができます。
世界中で、自然に、流暢に
Sonicで世界の市場へ。44言語と多様なアクセントを、ネイティブ話者の品質で提供します。
音声デモから、会話へ
音声合成は、応答を声にする工程です。会話エージェントには、入力を理解し、発言内容を決め、割り込みに対応する仕組みも必要です。
音声処理を構築する
原稿が完成しているならBytes API、文章が部分ごとに届くならWebSocketを使えます。出力形式をプレーヤーに合わせ、利用者が割り込んだら待機中の音声を停止してください。
WebSocketガイドを読む(英語)音声合成についてのよくある質問
音声合成とは何ですか?
文章から話し声を生成する技術で、テキスト読み上げやTTSとも呼ばれます。CartesiaのSonicモデルは、音声アプリケーションのこの工程を担います。音声認識は逆に、話された音声を文章に変換します。
CartesiaはブラウザーのSpeechSynthesis APIと同じですか?
いいえ。ブラウザーのwindow.speechSynthesisは、聞き手の端末で利用できる声を使い、その端末で再生します。Cartesiaは生成した音声をアプリケーションに返すホスト型APIです。APIキーなしでブラウザー再生だけが必要なら、JavaScript音声合成チュートリアルをお試しください。ブラウザーの声はOSによって異なり、ローカルまたはリモートの音声サービスを使う場合があります。
音声合成をアプリケーションに組み込むにはどうすればよいですか?
Python音声合成ガイドで、WAVファイルの生成と保存から始めてください。APIキーはバックエンドで管理します。音声エージェントには再生や割り込みへの対応も必要で、ファイル保存の例だけではそれらは実装されません。Cartesia Managed Agentsで構築することもできます。
音声合成は常に正しく発音しますか?
選んだ声を、アプリケーションの名前、略語、数字でテストしてください。文脈の中で言葉を聴き、必要に応じて原稿を修正します。代表的なサンプルを使うと、内容に合う声を選びやすくなります。
Cartesiaはどの言語に対応していますか?
現在のSonic対応言語一覧を確認し、対象言語の例を聴いてください。話してほしい言語で文章を入力します。TTSは文章を自動翻訳しません。
Cartesiaの音声合成をオフラインや無料で使えますか?
ホスト型APIの利用には、インターネット接続とアカウントへのアクセスが必要です。ファイルに保存した生成音声はオフラインで再生できます。利用量はアカウントのプランと上限によるため、リクエストを実行する前に現在の料金を確認してください。
音声合成と音声認識は同じですか?
生成中の音声をストリーミングできますか?
はい。Cartesiaは音声を順次受信できるストリーミングエンドポイントを提供しています。音声が届き次第、アプリケーションで再生を始められます。ストリーミングAPIリファレンスで応答形式を確認し、連携先が求める音声設定に合わせて再生を実装してください。
合成音声の速さや感情を調整できますか?
対応するSonicモデルには速度、音量、感情のコントロールがあります。選んだ声と原稿で設定を試し、話し方への影響を聴いてください。音声コントロールガイドで、現在のコントロールと対応モデルを確認できます。
音声合成で別の言語に翻訳できますか?
話してほしい言語の文章を入力してください。原稿の翻訳と音声の合成は別の工程です。最終音声を生成する前に、翻訳した名前、数字、地域特有の表現を確認しましょう。言語別の例で声を聴いてから選べます。
ボイスクローニングと音声合成は何が違いますか?
ボイスクローニングは話者の録音から再利用できる声を作ります。音声合成は、その声で新しい文章を読み上げます。既存の声を使うか、使用許可のあるクローンを作り、その音声IDで音声を生成できます。録音要件はボイスクローニングガイドをご覧ください。
今すぐ始める
専門家に相談する。
音声体験の開発にCartesiaをどう活用できるか、私たちのチームにご相談ください。
開発を始める。
APIでモデルにアクセスし、数分で音声エージェントを本番環境に導入できます。