TTSモデルと声を別々の入力として示す図

TTSモデルと声は別のもの

TTSモデルは音声を生成します。しかしモデルと、そのモデルが使う声は別のものです。両者を混同すると、音声AIの設計判断を誤ります。

[製品]

2×2に並ぶ四角形。三つはセージグリーンと薄いグレーの水彩、一つは黒い輪郭線

適合率と再現率が重要な理由

何もしないモデルでも正解率90%になることがあります。適合率と再現率がより正確に性能を伝える理由と、音声AIでの意味を解説します。

[製品]

3.6と書かれた緑の水彩の吹き出しに重なる、手描きの紙の輪郭

Sonic-3.6のご紹介

Sonic-3.6は、Sonic-3.5から自然さと品質が大きく向上しました。15のロケールにわたるブラインド比較では、最大93%の割合でリスナーに選ばれています。

[製品]

マイクを囲むenclomiphene、zuclopenthixol、pityriasisなどの認識が難しい語と、隣に鮮明に表示されたaminophylline

Ink-2にキーワード指定と調整可能なターン検出を追加

Ink-2に二つの新機能を追加しました。専門用語の文字起こし精度を高めるキーワード指定と、速度や精度に合わせて発話終了の判定を調整できるターン検出です。

[製品]

このTTSモデルはよいモデルか?

このTTSモデルはよいモデルか?

モデルの進歩とともに音声合成の評価が難しくなる理由と、本当に重要なことを測る方法を考えます。

[研究]

話し言葉の質問が一語ずつ渦を描いてマイクに入り、音声の文字起こしを表す図

Ink-2のご紹介:音声エージェント向けのランキング1位のSTT

リアルタイム音声エージェント向けのInk-2を公開しました。Artificial Analysisのストリーミングランキングで1位となり、最も正確な内蔵ターン検出を備えます。

[ニュース]

半透明の緑の花びらが重なる円形の模様と、中央で交差する三つの円の輪郭

音声AIモデルの選び方

実際の用途に合わせて、ASR、TTS、ターン検出のモデルを評価するための実践的な考え方を紹介します。

[製品]

緑の水彩による六つの図。それぞれ塗られた四角と手描きの長方形の輪郭を異なる配置で組み合わせている

はじめての音声AI用語ガイド

会話型音声AIを理解し、評価し、開発するために必要な20の主要用語を、わかりやすく解説します。

[製品]

緑に塗られた帯を左右に走る暗い平行線が、中央の交差部分を織りながら通り抜ける図

Mamba-3:推論を第一に設計した状態空間モデル

Mamba-3は現代の推論処理を中心に状態空間モデルを見直し、線形モデルの低レイテンシを保ちながら品質を高めます。

[研究]

薄緑、緑、グレー、濃緑で描かれた同じループ状の線の記号が四つ並ぶ

Claudeの大部隊を育てるソフトウェアエンジニアを募集しています

コードを書くことは解決したように感じます。でも、エンジニアリングはまだです。その差を埋める人を募集しています。

[エンジニアリング]

「now GDPR compliant」の文字の上にCartesiaのワードマーク。その横に琥珀色のEUの星の輪

CartesiaがGDPRに準拠

Cartesiaの音声合成プラットフォームがGDPRに準拠しました。データ保護、プライバシー、責任ある人間中心のAIへの取り組みを進めています。

[ニュース]

半透明の緑の水彩の四角が少しずつ角度を変えて重なり、中央ほど濃くなる図

Lineのご紹介:コードでつくる音声エージェント開発基盤

Cartesiaの音声エージェント開発プラットフォーム、Lineを公開しました。優れた製品はコードから生まれるという考えから、コードを中心に設計しました。

[製品]

緑の水彩と手描きの輪郭のブロックが三段に並ぶ。上ほど幅広く濃く、下ほど細く淡い

階層的モデリング

生データを上位の概念にまとめて直接学習し、トークン化の制約を越える階層アーキテクチャ、H-Netを紹介します。

[研究]

Inkのご紹介:リアルタイム会話のための音声認識モデル

Inkのご紹介:リアルタイム会話のための音声認識モデル

リアルタイム音声アプリケーション向けのストリーミング音声認識モデル群、Inkを公開しました。最初のモデルInk-Whisperは、企業向け音声エージェントのために設計した高速で低価格なSTTです。

[製品]

OrganizationsとDashboardsのご紹介

OrganizationsとDashboardsのご紹介

音声AIを拡大する開発者のために、チームでの共同作業と利用状況の把握を助けるOrganizationsとDashboardsを公開しました。

[製品]

Professional Voice Cloningのご紹介

Professional Voice Cloningのご紹介

Sonicで学習する高品質な声のクローン、Professional Voice Cloningを公開しました。Startup以上のプランで利用できます。

[製品]

Cartesia Python SDK v2.0.0

Cartesia Python SDK v2.0.0

PythonでCartesiaのAI音声機能を利用する際の開発体験を改善した、Python SDK v2.0.0を公開しました。

[エンジニアリング]

CartesiaがWing Venture Capital主催の第7回Enterprise Tech 30に選出

CartesiaがWing Venture Capital主催の第7回Enterprise Tech 30に選出

音声生成モデルを提供するCartesiaが、成長段階を問わず有望な非上場エンタープライズ技術企業を選ぶ第7回Enterprise Tech 30に選出されました。

[ニュース]

シリーズAの資金調達と音声AIの未来

シリーズAの資金調達と音声AIの未来

Kleiner Perkins主導で6,400万ドルのシリーズA資金調達を実施しました。チームの拡充と、次世代モデルをつくるための研究に投資します。

[ニュース]

Llamba:蒸留した再帰モデルを拡張し、言語処理を効率化する

Llamba:蒸留した再帰モデルを拡張し、言語処理を効率化する

デバイス上のAIが、スマートフォンの個人アシスタントからARグラスのリアルタイム翻訳まで、幅広い用途を支える時代に向けた研究を紹介します。

[研究]

Cartesiaで音声AIエージェントをつくる方法

Cartesiaで音声AIエージェントをつくる方法

Cartesiaの音声合成Sonicで自然で低レイテンシな音声AIエージェントを開発する手順を、構成から本番導入まで紹介します。

[エンジニアリング]

音声AIの現在地 2024

音声AIの現在地 2024

初のState of Voiceレポートでは、2024年の業界を動かしたインフラの進歩と新たな用途を振り返り、2025年を展望します。

[研究]

シード資金調達のお知らせ

シード資金調達のお知らせ

Index Ventures主導で2,700万ドルを調達しました。Lightspeed、Factory、Conviction、General Catalyst、A*、SV Angelと90人のエンジェル投資家が参加しています。

[ニュース]

Cartesiaのハッカソンシーズン

Cartesiaのハッカソンシーズン

2024年10月、Cartesiaはサンフランシスコで2,000人以上の開発者を集め、Sonicを使った独創的なアイデアに総額20,000ドルの賞金を贈りました。

[エンジニアリング]

Voice Changerのご紹介:音声を思いどおりに変える

Voice Changerのご紹介:音声を思いどおりに変える

Voice Changerは元の話し方、感情、韻律を保ちながら、音声クリップの声を変換します。スタジオ品質の音声やクローン音声を利用できます。

[製品]

Sonic Multilingualに新たな8言語を追加

Sonic Multilingualに新たな8言語を追加

Sonic Multilingualでヒンディー語、イタリア語、韓国語、オランダ語、ポーランド語、ロシア語、スウェーデン語、トルコ語のアルファ版を公開しました。

[製品]

デバイス上の知能に関する最新情報

デバイス上の知能に関する最新情報

Cartesiaは、どこにいても動作する双方向の知能を、あらゆるデバイスに届ける次世代AIを開発しています。

[研究]

Sonicの発表:自然な音声を生成する低レイテンシの音声モデル

Sonicの発表:自然な音声を生成する低レイテンシの音声モデル

自然な話し声を生成する、低レイテンシの音声モデルSonicを公開しました。

[研究]

Based:単純な線形注意で再現能力と処理量を両立

Based:単純な線形注意で再現能力と処理量を両立

Basedはプロンプト処理でFlashAttention-2より56%、Mambaより44%高速です。テキスト生成のスループットはFlashAttention-2の24倍に達します。

[研究]

Mamba-3B-SlimPJ:有力なTransformerに匹敵する状態空間モデル

Mamba-3B-SlimPJ:有力なTransformerに匹敵する状態空間モデル

CartesiaとTogetherの協力により、Mamba-3B-SlimPJをApache 2.0ライセンスで公開します。600Bトークンで学習した、これまでで最も高性能なMamba言語モデルです。

[研究]

今すぐ始める

専門家に相談する。

音声体験の開発にCartesiaをどう活用できるか、私たちのチームにご相談ください。

営業に問い合わせる

開発を始める。

APIでモデルにアクセスし、数分で音声エージェントを本番環境に導入できます。

Cartesiaを試す