ブログ / 製品

Multilingual Voicesのご紹介

Akki Shafiqullah, Aiqi Liu 
helloとholaと書かれた二つの吹き出しの間にある、青い水彩の手描きの地球

Cartesiaは、基盤となるアーキテクチャに支えられたモデルと、その能力を聞き手に届ける声の両方が、最高水準であるべきだと考えてきました。

声の個性は、複数の特徴の組み合わせで生まれます。

  • 高さ。声の音域と、その変化の幅。
  • 温かみ。息の混ざり方と柔らかさ。
  • 質感。かすれた声から滑らかな声までの手触り。
  • 速さと強調。どこでゆっくり話し、どこに力を込めるか。

これらを一つの言語で再現するだけでも難しく、多くの言語で同じ声を保つことはさらに困難です。声の個性と、録音で使われている言語が絡み合っているからです。

長年、ブランドにはよい選択肢がありませんでした。五つの言語でブランドの声を届けるには、五人の声優を起用して、それぞれの市場向けに録音する必要がありました。英語ではある人の声なのに、日本語では別人のように聞こえてしまいます。

本日、Multilingual Voicesをご紹介します。50以上のライブラリ音声が最大25言語を母語話者のように話せるようになり、自分で作成した声のクローンも多言語に対応できます。一つの声を選べば、どこでもその個性を保ち、お客様は居場所を問わず同じブランドの声を聴けます。

その言語を話す人に自然に聞こえてこそ、言語対応は意味を持ちます。この原則に沿って提供しています。すべての言語とアクセントを母語話者が評価基準に従って採点し、アクセントを保てているか、日付、数字、通貨が現地の読み方になっているかを確認します。

ブランドの声を新しい言語に対応させる

私たちが支援する方の多くは英語を母語としておらず、住宅の手続きはもともと複雑です。私たちのエージェントは、入居資格、収入の確認、再認定に、複数の言語で24時間対応しています。月500万件以上の通話と50万戸の低価格住宅にわたり、その人が実際に話す言語で対応することで、住まいを見つけやすくしています。

Tony StoyanovCTO

大切な人の声が留守番電話や動画にしか残っておらず、もっと聴きたいと願うことは珍しくありません。Forevermoreでは、その短い音声クリップをアップロードして声を再現できます。家族が異なる言語を使っていても、それぞれが自分の言語で入力し、あの聞き慣れた声で言葉を聴けるようになりました。

Hasan ZalkoutCTO

説明が言葉の壁で止まってはいけません。Cartesiaを使うことで、Guidelessのお客様は自分の言語でガイドを作成し、ワンクリックで他の言語にも公開できます。同じ声、同じガイドを、翻訳で意味を損なわずに届けられます。

Dovydas Remeika共同創業者

用途に合う声を見つける

さまざまな業界や用途に取り組むほど、高品質な声が必ずしもその用途に適した声ではないことが明らかになります。私たちは先ほどの特徴だけでなく、実際の用途に照らしてすべての声を評価します。声は文脈の中で初めて意味を持ちます。落ち着いて心を和らげる声は瞑想アプリに適していますが、不正利用の警告には不向きで、その用途では評価も低くあるべきです。次は英語の音声です。

We've noticed a $2,000 charge on your account.

Soft, sleepy voice

Crisp, confident voice

50以上あり、今後も増える多言語音声から、用途に合う声を見つけられます。特に信頼と地域への対応が重要な場面に適しています。次の録音は、それぞれ元の言語のまま掲載しています。

カスタマーサポート:

I can see the charge you're asking about. Let me get that refunded for you right now.

Ya veo el cargo del que me hablas. Voy a hacerte el reembolso ahora mismo.

Parker · English

Parker · Spanish

営業:

You were looking at the Pro plan last week. Want me to walk you through it?

Você deu uma olhada no plano Pro semana passada. Quer que eu te mostre como funciona?

Skylar · English

Skylar · Portuguese

医療:

Your appointment with Dr. Okafor is confirmed for Monday at 9:15.

डॉक्टर ओकाफ़ोर के साथ आपका अपॉइंटमेंट सोमवार सुबह 9:15 बजे तय हो गया है।

Henry · English

Henry · Hindi

ライブラリから始める

音声を生成するには、テキストとlocaleを送信します。自然に話せる対応言語であれば、同じ声のIDを使えます。

POST /tts/bytes
{
  "model_id": "sonic-3.6",
  "voice": "ef191366-f52f-447a-a398-ed8c0f2943a1",
  "transcript": "Your order shipped on Tuesday.",
  "locale": "en-GB"
}

Your order shipped on Tuesday.

Cartesiaのダッシュボードでは、次のように操作します。

  1. Voice Libraryを開いて多言語音声を選び、英語UIで次の順に操作します。 More actions → Try in playground.
  2. 言語メニューから言語を選びます。
  3. テキストを入力し、再生します。同じ声が新しい言語で話します。

自分の声を多言語に対応させる

独自の声が必要なら、わずか10秒の音声からInstant Voice Cloneを作成できます。

POST /voices/clone
curl -X POST https://api.cartesia.ai/voices/clone \
  -H "Authorization: Bearer $CARTESIA_API_KEY" \
  -H "Cartesia-Version: 2026-08-14" \
  -F "name=My Brand Voice" \
  -F "clip=@sample.wav"

続いて、ダッシュボードで最大9つの新しいアクセントと言語を追加します。英語UIの操作順は次のとおりです (Voice Library → More actions → Manage voice → Supported languages & accents → Add):

または、同じvoice_idを保ったまま、Add Voice Accents APIを使用します。

PATCH /voices/{voice_id}/accents
curl -X PATCH https://api.cartesia.ai/voices/{voice_id}/accents \
  -H "Authorization: Bearer $CARTESIA_API_KEY" \
  -H "Cartesia-Version: 2026-08-14" \
  -H "Content-Type: application/json" \
  -d '{ "accents": ["korean", "parisian"] }'

言葉の壁のない音声体験をつくる

私たちは、あらゆる声とモデルがどこでも流暢に話せるようにすることを目指しています。Multilingual Voicesを試して、すべての言語と地域で信頼される製品をつくりましょう。