
TTSモデルと声は別のもの
TTSモデルは音声を生成します。しかしモデルと、そのモデルが使う声は別のものです。両者を混同すると、音声AIの設計判断を誤ります。
[製品]

適合率と再現率が重要な理由
何もしないモデルでも正解率90%になることがあります。適合率と再現率がより正確に性能を伝える理由と、音声AIでの意味を解説します。
[製品]

Sonic-3.6のご紹介
Sonic-3.6は、Sonic-3.5から自然さと品質が大きく向上しました。15のロケールにわたるブラインド比較では、最大93%の割合でリスナーに選ばれています。
[製品]

Ink-2にキーワード指定と調整可能なターン検出を追加
Ink-2に二つの新機能を追加しました。専門用語の文字起こし精度を高めるキーワード指定と、速度や精度に合わせて発話終了の判定を調整できるターン検出です。
[製品]

このTTSモデルはよいモデルか?
モデルの進歩とともに音声合成の評価が難しくなる理由と、本当に重要なことを測る方法を考えます。
[研究]

Ink-2のご紹介:音声エージェント向けのランキング1位のSTT
リアルタイム音声エージェント向けのInk-2を公開しました。Artificial Analysisのストリーミングランキングで1位となり、最も正確な内蔵ターン検出を備えます。
[ニュース]

音声AIモデルの選び方
実際の用途に合わせて、ASR、TTS、ターン検出のモデルを評価するための実践的な考え方を紹介します。
[製品]

はじめての音声AI用語ガイド
会話型音声AIを理解し、評価し、開発するために必要な20の主要用語を、わかりやすく解説します。
[製品]

Mamba-3:推論を第一に設計した状態空間モデル
Mamba-3は現代の推論処理を中心に状態空間モデルを見直し、線形モデルの低レイテンシを保ちながら品質を高めます。
[研究]

Claudeの大部隊を育てるソフトウェアエンジニアを募集しています
コードを書くことは解決したように感じます。でも、エンジニアリングはまだです。その差を埋める人を募集しています。
[エンジニアリング]

CartesiaがGDPRに準拠
Cartesiaの音声合成プラットフォームがGDPRに準拠しました。データ保護、プライバシー、責任ある人間中心のAIへの取り組みを進めています。
[ニュース]

Lineのご紹介:コードでつくる音声エージェント開発基盤
Cartesiaの音声エージェント開発プラットフォーム、Lineを公開しました。優れた製品はコードから生まれるという考えから、コードを中心に設計しました。
[製品]

階層的モデリング
生データを上位の概念にまとめて直接学習し、トークン化の制約を越える階層アーキテクチャ、H-Netを紹介します。
[研究]

Inkのご紹介:リアルタイム会話のための音声認識モデル
リアルタイム音声アプリケーション向けのストリーミング音声認識モデル群、Inkを公開しました。最初のモデルInk-Whisperは、企業向け音声エージェントのために設計した高速で低価格なSTTです。
[製品]

OrganizationsとDashboardsのご紹介
音声AIを拡大する開発者のために、チームでの共同作業と利用状況の把握を助けるOrganizationsとDashboardsを公開しました。
[製品]

Professional Voice Cloningのご紹介
Sonicで学習する高品質な声のクローン、Professional Voice Cloningを公開しました。Startup以上のプランで利用できます。
[製品]

Cartesia Python SDK v2.0.0
PythonでCartesiaのAI音声機能を利用する際の開発体験を改善した、Python SDK v2.0.0を公開しました。
[エンジニアリング]

CartesiaがWing Venture Capital主催の第7回Enterprise Tech 30に選出
音声生成モデルを提供するCartesiaが、成長段階を問わず有望な非上場エンタープライズ技術企業を選ぶ第7回Enterprise Tech 30に選出されました。
[ニュース]

シリーズAの資金調達と音声AIの未来
Kleiner Perkins主導で6,400万ドルのシリーズA資金調達を実施しました。チームの拡充と、次世代モデルをつくるための研究に投資します。
[ニュース]

Llamba:蒸留した再帰モデルを拡張し、言語処理を効率化する
デバイス上のAIが、スマートフォンの個人アシスタントからARグラスのリアルタイム翻訳まで、幅広い用途を支える時代に向けた研究を紹介します。
[研究]

Cartesiaで音声AIエージェントをつくる方法
Cartesiaの音声合成Sonicで自然で低レイテンシな音声AIエージェントを開発する手順を、構成から本番導入まで紹介します。
[エンジニアリング]

音声AIの現在地 2024
初のState of Voiceレポートでは、2024年の業界を動かしたインフラの進歩と新たな用途を振り返り、2025年を展望します。
[研究]

シード資金調達のお知らせ
Index Ventures主導で2,700万ドルを調達しました。Lightspeed、Factory、Conviction、General Catalyst、A*、SV Angelと90人のエンジェル投資家が参加しています。
[ニュース]

Cartesiaのハッカソンシーズン
2024年10月、Cartesiaはサンフランシスコで2,000人以上の開発者を集め、Sonicを使った独創的なアイデアに総額20,000ドルの賞金を贈りました。
[エンジニアリング]

Voice Changerのご紹介:音声を思いどおりに変える
Voice Changerは元の話し方、感情、韻律を保ちながら、音声クリップの声を変換します。スタジオ品質の音声やクローン音声を利用できます。
[製品]

Sonic Multilingualに新たな8言語を追加
Sonic Multilingualでヒンディー語、イタリア語、韓国語、オランダ語、ポーランド語、ロシア語、スウェーデン語、トルコ語のアルファ版を公開しました。
[製品]

デバイス上の知能に関する最新情報
Cartesiaは、どこにいても動作する双方向の知能を、あらゆるデバイスに届ける次世代AIを開発しています。
[研究]

Sonicの発表:自然な音声を生成する低レイテンシの音声モデル
自然な話し声を生成する、低レイテンシの音声モデルSonicを公開しました。
[研究]

Based:単純な線形注意で再現能力と処理量を両立
Basedはプロンプト処理でFlashAttention-2より56%、Mambaより44%高速です。テキスト生成のスループットはFlashAttention-2の24倍に達します。
[研究]

Mamba-3B-SlimPJ:有力なTransformerに匹敵する状態空間モデル
CartesiaとTogetherの協力により、Mamba-3B-SlimPJをApache 2.0ライセンスで公開します。600Bトークンで学習した、これまでで最も高性能なMamba言語モデルです。
[研究]
今すぐ始める
専門家に相談する。
音声体験の開発にCartesiaをどう活用できるか、私たちのチームにご相談ください。
開発を始める。
APIでモデルにアクセスし、数分で音声エージェントを本番環境に導入できます。
