音声合成で支える、リアルタイム音声エージェント

Cartesiaの音声合成モデルSonicで、テキストを音声に変換。Playgroundで声を試し、APIからアプリケーションの音声を生成できます。

声を聴く、あなたの言葉で

アプリケーションで話す一文を試してください。同じ言葉で声を比較し、発音とテンポを聴いてみましょう。

58/500

音声を組み込む、あなたのアプリに

Sonicはアプリケーションが作る文章を音声に変換します。アプリケーションが応答内容を用意し、音声モデルがそれを話します。

声を選ぶ

アプリケーションで実際に話す言葉を使ってテストしてください。挨拶だけに頼らず、名前、数字、略語も評価に含めましょう。

APIで音声を生成する

アプリケーションから文章を送り、合成音声を受け取ります。声と出力形式を選び、応答を再生するかファイルとして保存できます。

応答をストリーミングする

会話の再生にはストリーミング音声を使えます。ネットワーク転送や再生バッファーも含め、利用者が音声を聴くまでの時間を測定してください。

ブラウザーで再生する?音声APIを使う?

どちらも文章を音声に変換します。音声をどこで動かすか、アプリケーションでどう使うかに合わせて選んでください。

ブラウザーの音声合成

ブラウザーのSpeechSynthesisインターフェースを使い、端末の声で再生します。利用できる声はブラウザーとOSによって異なります。

適した用途:ウェブページでの文章の読み上げ.

ブラウザーTTSガイドを読む

Cartesiaの音声API

IDでSonicの声を選び、バックエンドから音声を生成します。ウェブ、モバイル、電話アプリケーションで音声をストリーミング、保存、再生できます。

適した用途:アプリケーション向けの音声生成.

音声APIを見る(英語)

あらゆる用途に、人間らしく表現豊かな声を

用途の異なる音声例を聴いてみてください。話し方を比べてから、聞き手が実際に聴く言葉で声を試しましょう。

サポート

英語の原音声

音声合成でカスタマーサポートの回答を音声に変換。サービスの更新や問題解決の手順を、通話やアプリケーションで一貫した声で伝えられます。

ゲーム

原音声サンプル

ゲームの原稿からキャラクターの台詞を生成します。役ごとに声を比べ、新しい台詞を場面の中で聴いて、テンポや演技を確認できます。

コンテンツ

原音声サンプル

動画、チュートリアル、製品解説のナレーションを文章から作れます。原稿を修正して新しい音声を生成できるため、一行ずつ録り直す必要はありません。

メディア

原音声サンプル

記事や物語を音声に変換。ポッドキャストの導入やニュースの読み上げに音声合成を使い、公開前に名前と発音を確認できます。

医療

英語の原音声

チームで確認済みの文章から、予約のリマインダーや患者向けの案内を読み上げます。定型的な説明や予定変更を一貫した声で伝えられます。

営業

英語の原音声

製品デモや営業用の解説に音声ナレーションを加えられます。原稿を複数の声で試し、製品やメッセージが変わったら音声を更新できます。

音声エージェント

英語の原音声

アプリケーションの文章から、AI音声エージェントの応答を生成します。挨拶や会話の声を選び、短い返答と長い応答の両方をテストしてください。

吹き替え

日本語の原音声

翻訳済みの原稿から、ローカライズ用の音声を生成します。対応言語の声を比較し、動画に追加する前に発音とタイミングを確認してください。

アバター

原音声サンプル

デジタルアバターに合成音声を組み合わせ、プレゼンテーションやガイドを作れます。文章から台詞を生成し、アバターのアニメーションに再生を合わせます。

物流

英語の原音声

配送状況や配車の指示を音声メッセージに変換。音声合成をアプリケーションに接続し、最新の配送情報を音声に反映できます。

採用

原音声サンプル

承認済みの原稿から、面接の導入や候補者向けの日程案内を作れます。説明の一貫性を保ち、採用手順が変わったら音声を再生成できます。

アクセシビリティ

原音声サンプル

ガイド、記事、教材を音声でも提供できます。利用者は自分のペースで内容を聴き、原文を追うことができます。

世界中で、自然に、流暢に

Sonicで世界の市場へ。44言語と多様なアクセントを、ネイティブ話者の品質で提供します。

よく使われる言語・地域

音声デモから、会話へ

音声合成は、応答を声にする工程です。会話エージェントには、入力を理解し、発言内容を決め、割り込みに対応する仕組みも必要です。

音声処理を構築する

原稿が完成しているならBytes API、文章が部分ごとに届くならWebSocketを使えます。出力形式をプレーヤーに合わせ、利用者が割り込んだら待機中の音声を停止してください。

WebSocketガイドを読む(英語)

Managed Agentsで構築する

声にエージェントの指示とツールを接続します。音声とともに会話も作り込みたい場合は、Managed Agentsを使えます。

Managed Agentsを見る

音声合成についてのよくある質問

音声合成とは何ですか?

文章から話し声を生成する技術で、テキスト読み上げやTTSとも呼ばれます。CartesiaのSonicモデルは、音声アプリケーションのこの工程を担います。音声認識は逆に、話された音声を文章に変換します。

CartesiaはブラウザーのSpeechSynthesis APIと同じですか?

いいえ。ブラウザーのwindow.speechSynthesisは、聞き手の端末で利用できる声を使い、その端末で再生します。Cartesiaは生成した音声をアプリケーションに返すホスト型APIです。APIキーなしでブラウザー再生だけが必要なら、JavaScript音声合成チュートリアルをお試しください。ブラウザーの声はOSによって異なり、ローカルまたはリモートの音声サービスを使う場合があります。

音声合成をアプリケーションに組み込むにはどうすればよいですか?

Python音声合成ガイドで、WAVファイルの生成と保存から始めてください。APIキーはバックエンドで管理します。音声エージェントには再生や割り込みへの対応も必要で、ファイル保存の例だけではそれらは実装されません。Cartesia Managed Agentsで構築することもできます。

音声合成は常に正しく発音しますか?

選んだ声を、アプリケーションの名前、略語、数字でテストしてください。文脈の中で言葉を聴き、必要に応じて原稿を修正します。代表的なサンプルを使うと、内容に合う声を選びやすくなります。

Cartesiaはどの言語に対応していますか?

現在のSonic対応言語一覧を確認し、対象言語の例を聴いてください。話してほしい言語で文章を入力します。TTSは文章を自動翻訳しません。

Cartesiaの音声合成をオフラインや無料で使えますか?

ホスト型APIの利用には、インターネット接続とアカウントへのアクセスが必要です。ファイルに保存した生成音声はオフラインで再生できます。利用量はアカウントのプランと上限によるため、リクエストを実行する前に現在の料金を確認してください。

音声合成と音声認識は同じですか?

音声合成は文章を話し声に変換し、音声認識は音声を文章に変換します。音声エージェントは認識で相手を理解し、言語モデルで応答を作り、音声合成でその応答を話せます。音声合成はSonic、音声認識はInkをご覧ください。

生成中の音声をストリーミングできますか?

はい。Cartesiaは音声を順次受信できるストリーミングエンドポイントを提供しています。音声が届き次第、アプリケーションで再生を始められます。ストリーミングAPIリファレンスで応答形式を確認し、連携先が求める音声設定に合わせて再生を実装してください。

合成音声の速さや感情を調整できますか?

対応するSonicモデルには速度、音量、感情のコントロールがあります。選んだ声と原稿で設定を試し、話し方への影響を聴いてください。音声コントロールガイドで、現在のコントロールと対応モデルを確認できます。

音声合成で別の言語に翻訳できますか?

話してほしい言語の文章を入力してください。原稿の翻訳と音声の合成は別の工程です。最終音声を生成する前に、翻訳した名前、数字、地域特有の表現を確認しましょう。言語別の例で声を聴いてから選べます。

ボイスクローニングと音声合成は何が違いますか?

ボイスクローニングは話者の録音から再利用できる声を作ります。音声合成は、その声で新しい文章を読み上げます。既存の声を使うか、使用許可のあるクローンを作り、その音声IDで音声を生成できます。録音要件はボイスクローニングガイドをご覧ください。

今すぐ始める

専門家に相談する。

音声体験の開発にCartesiaをどう活用できるか、私たちのチームにご相談ください。

営業に問い合わせる

開発を始める。

APIでモデルにアクセスし、数分で音声エージェントを本番環境に導入できます。

Cartesiaを試す