ツール / 音声認識
ストリーミング精度No.1のInk-2で動作
上のデモはストリーミング音声認識モデルInk-2で動作します。 VoiceArenaのアメリカ英語ランキング と Artificial Analysisのストリーミングベンチマークで1位を獲得。電話番号、メールアドレス、UUIDなどの構造化データを最初から正しく文字に起こします。ターン検出を内蔵し、発話ごとに自動で区切ります。別のノイズ除去フィルターがなくても、背景音の中で精度を保ちます。
おすすめの用途
- 音声エージェント
- リアルタイム字幕
- 音声入力
- 会議メモ
- 通話分析
使い方
マイクを押して話すと、話している間に文字が表示されます。登録は不要です。
途中で間を置いたり、話題を変えたりできます。Ink-2が発話の始まりと終わりを識別し、会話として読みやすく文字に起こします。
文字起こしをコピーしたり、APIで同じモデルをアプリからストリーミング利用したりできます。
ほかの音声ツールを見る
よくある質問
音声認識とは何ですか?
音声認識はSTT、ASR、文字起こしとも呼ばれ、話した音声を文字に変換します。CartesiaはストリーミングモデルInk-2を使い、話し終わるのを待たずに、発話中から文字を表示します。
無料で使えますか?
はい。このページのデモはアカウントなしでマイクの音声を文字起こしできます。無料のCartesiaアカウントで上限が増え、有料プランでは本番用APIの利用量を追加できます。
対応言語は何ですか?
Ink-2は英語、フランス語、ヒンディー語、日本語、スペイン語に対応し、言語を自動検出します。リアルタイム用途向けのモデルです。録音済みファイルには、ink-whisperで動作するバッチSTT APIをご利用ください。
ターン検出とは何ですか?
話者が話し終えたタイミングを判断し、音声エージェントの割り込みや無言の待ち時間を防ぐ機能です。多くの構成では別の音声活動検出モデルを追加します。Ink-2はturn.eager_endやturn.endなどのイベントを直接返すため、モデルを一つ減らし、応答を速められます。
マイクの代わりに音声ファイルを文字起こしできますか?
このページのデモはマイクを使うライブ文字起こしです。録音には、ファイル全体を受け取り一つの文字起こしを返すバッチSTT APIをご利用ください。
自社の環境で実行できますか?
はい。Ink-2はオンプレミスや外部ネットワークから隔離された環境、AWS・GCP・Azure上の自社VPCに導入できます。製品に組み込むOEMライセンスもあります。これらの導入形態はエンタープライズ契約で提供します。
今すぐ始める
専門家に相談する。
音声体験の開発にCartesiaをどう活用できるか、私たちのチームにご相談ください。
開発を始める。
APIでモデルにアクセスし、数分で音声エージェントを本番環境に導入できます。