ブラウザーでライブ文字起こし

マイクを押して話すと、文字が表示されます。ストリーミング音声認識の精度No.1、Ink-2で動作します。
クリックまたはSpaceで文字起こしを開始
タップして文字起こしを開始
話すテーマに迷ったら
今日、自由な時間が1時間増えたら何をしますか?

ストリーミング精度No.1のInk-2で動作

上のデモはストリーミング音声認識モデルInk-2で動作します。 VoiceArenaのアメリカ英語ランキング と Artificial Analysisのストリーミングベンチマークで1位を獲得。電話番号、メールアドレス、UUIDなどの構造化データを最初から正しく文字に起こします。ターン検出を内蔵し、発話ごとに自動で区切ります。別のノイズ除去フィルターがなくても、背景音の中で精度を保ちます。

おすすめの用途

  • 音声エージェント
  • リアルタイム字幕
  • 音声入力
  • 会議メモ
  • 通話分析

使い方

01

マイクを押して話すと、話している間に文字が表示されます。登録は不要です。

02

途中で間を置いたり、話題を変えたりできます。Ink-2が発話の始まりと終わりを識別し、会話として読みやすく文字に起こします。

03

文字起こしをコピーしたり、APIで同じモデルをアプリからストリーミング利用したりできます。

本番環境で使う

このページはAPIやSDKから使えるInk-2と同じモデルで動作します。WebSocketでライブ音声をストリーミングするか、録音済みのファイルをバッチエンドポイントへ送れます。 重要語の指定 で、製品がよく聴く名前や専門用語を認識しやすくできます。エンタープライズプランではデータを保持せず、オンプレミス、VPC、OEMで導入できます。

よくある質問

音声認識とは何ですか?

音声認識はSTT、ASR、文字起こしとも呼ばれ、話した音声を文字に変換します。CartesiaはストリーミングモデルInk-2を使い、話し終わるのを待たずに、発話中から文字を表示します。

無料で使えますか?

はい。このページのデモはアカウントなしでマイクの音声を文字起こしできます。無料のCartesiaアカウントで上限が増え、有料プランでは本番用APIの利用量を追加できます。

対応言語は何ですか?

Ink-2は英語、フランス語、ヒンディー語、日本語、スペイン語に対応し、言語を自動検出します。リアルタイム用途向けのモデルです。録音済みファイルには、ink-whisperで動作するバッチSTT APIをご利用ください。

ターン検出とは何ですか?

話者が話し終えたタイミングを判断し、音声エージェントの割り込みや無言の待ち時間を防ぐ機能です。多くの構成では別の音声活動検出モデルを追加します。Ink-2はturn.eager_endやturn.endなどのイベントを直接返すため、モデルを一つ減らし、応答を速められます。

マイクの代わりに音声ファイルを文字起こしできますか?

このページのデモはマイクを使うライブ文字起こしです。録音には、ファイル全体を受け取り一つの文字起こしを返すバッチSTT APIをご利用ください。

自社の環境で実行できますか?

はい。Ink-2はオンプレミスや外部ネットワークから隔離された環境、AWS・GCP・Azure上の自社VPCに導入できます。製品に組み込むOEMライセンスもあります。これらの導入形態はエンタープライズ契約で提供します。

今すぐ始める

専門家に相談する。

音声体験の開発にCartesiaをどう活用できるか、私たちのチームにご相談ください。

営業に問い合わせる

開発を始める。

APIでモデルにアクセスし、数分で音声エージェントを本番環境に導入できます。

Cartesiaを試す