学ぶ。

音声ツールを比較し、選択のポイントを理解して、音声アプリケーションを開発しましょう。
音声認識モデルの比較と選び方(2026年)

音声認識モデルの比較と選び方(2026年)

ストリーミングとバッチ、APIとオープンソース。2026年に検討すべき音声認識モデルの得意分野と選び方を解説します。

ElevenLabsの料金(2026年):プラン、クレジット、API

ElevenLabsの料金(2026年):プラン、クレジット、API

2026年のElevenLabsの料金を解説。6つのプラン、クレジットが何分の音声になるか、モデル別のAPI料金、エージェントの料金、実際のワークロードでの合計額をまとめました。

PipecatとCartesiaで音声エージェントを構築する

PipecatとCartesiaで音声エージェントを構築する

Pipecatで処理をつなぎ、Cartesiaで音声を生成。ブラウザーで動く音声エージェントを構築し、Inkの発話終了予測で応答時間を短縮します。

AIコールドコールとは:仕組みと構築方法

AIコールドコールとは:仕組みと構築方法

AIコールドコールは、自ら発信し、見込み客を見極め、商談を予約する音声エージェントです。通話費用、同意に関する法律、2つの構築方法を解説します。

オンプレミス音声AIとは:仕組みと導入方法

オンプレミス音声AIとは:仕組みと導入方法

音声認識、言語モデル、音声合成を自社ネットワーク内で実行するオンプレミス音声AI。クラウド、VPC、オンプレミス、エアギャップ構成を比較します。

2026年に知っておきたい音声AI企業

2026年に知っておきたい音声AI企業

音声モデルの提供企業、音声エージェント基盤、クラウド音声サービス、オープンソース。各社が実際に提供するものに分けて紹介します。

AI音声エージェントとは:仕組みと構築方法

AI音声エージェントとは:仕組みと構築方法

AI音声エージェントの仕組みと、通話者が会話を続けられるかを左右するレイテンシ、ターン交代、テストの判断を解説します。

音声区間検出:音声エージェントのためのVAD

音声区間検出:音声エージェントのためのVAD

音声区間検出の仕組み、ターン検出との違い、リアルタイム音声エージェントで間や割り込みを扱う方法を解説します。

単語誤り率とは。音声AIのWERでは測れないもの

単語誤り率とは。音声AIのWERでは測れないもの

単語誤り率が測るもの、TTS評価で判断を誤らせる理由、実際の会話で重要な音声品質の検証方法を解説します。

対話型IVRで電話メニューを置き換える方法

対話型IVRで電話メニューを置き換える方法

対話型IVRが音声の要望を振り分ける仕組み、音声エージェントの役割、電話メニューを置き換える前に検証すべきことを解説します。

固定した音響評価器はASRの幻覚をどう変えるか

固定した音響評価器はASRの幻覚をどう変えるか

会議音声の挿入誤りを減らす新しい音声認識の研究から、単語誤り率全体だけでなく誤りの種類を見る重要性を考えます。

AIコールセンター:音声エージェントの試験導入

AIコールセンター:音声エージェントの試験導入

サポート窓口の選定、ツール接続、担当者への引き継ぎ、解決率と費用の測定を通じて、AIコールセンターの試験導入を進めます。

エンドポイント単位の測定でTTS APIを比較する

エンドポイント単位の測定でTTS APIを比較する

CovalのQwen3の結果をもとに、レイテンシの数値が示すことと、本番向けの候補を検証する方法を解説します。

AI受付:既製品を買うか、自分で構築するか

AI受付:既製品を買うか、自分で構築するか

既製のAI受付と独自の音声エージェントを比較し、予約、人への引き継ぎ、費用、最初の着信のテストを計画します。

SpeechSynthesisでJavaScriptのテキストを音声に変換する

SpeechSynthesisでJavaScriptのテキストを音声に変換する

JavaScriptでブラウザーの読み上げデモを作成します。音声の取得、読み上げ、停止を実装し、ホステッドTTS APIを使うべき場面も解説します。

CovalのストリーミングSTTベンチマークと推論レイテンシ

CovalのストリーミングSTTベンチマークと推論レイテンシ

Covalの測定から、推論基盤と導入構成が音声認識の速度に与える影響を読み解きます。

Pythonで音声合成:音声をWAVファイルに保存する

Pythonで音声合成:音声をWAVファイルに保存する

PythonとCartesia SDKでテキストからWAVファイルを生成します。APIキーの設定、声の選択、音声や認証に関するよくあるエラーへの対処を解説します。

Speechifyの代替15選:無料・有料の選択肢

Speechifyの代替15選:無料・有料の選択肢

文書を聴くため、または音声を使った製品を作るためのSpeechifyの代替を比較。無料で使える選択肢と、各ツールでできることを紹介します。

ElevenLabsの代替:10の選択肢を比較

ElevenLabsの代替:10の選択肢を比較

リアルタイム音声エージェント、台本付きナレーション、文書の読み上げ、メディア編集という用途別にElevenLabsの代替を比較し、テスト方法も紹介します。

Descriptの代替10選

Descriptの代替10選

Descriptの代替を、録音、文字起こし編集、動画制作、音声APIで比較し、各ツールが作業のどの部分を担うか確認します。

Google Cloud Text-to-Speechの代替10選

Google Cloud Text-to-Speechの代替10選

Googleの音声合成の代替を、APIの処理、対応言語、発話の制御、導入の要件で比較します。

Murf AIの代替11選

Murf AIの代替11選

台本付きナレーションと音声API向けにMurf AIの代替を比較し、選ぶ前に編集、出力、ストリーミングを試します。

Discordでテキスト読み上げを使う方法

Discordでテキスト読み上げを使う方法

Discordの/ttsコマンド、再生と通知の設定、メッセージが読み上げられない場合の確認方法を解説します。

Hume AIの代替10選

Hume AIの代替10選

音声生成とエージェント向けにHume AIの代替を比較し、TTS、会話型インターフェース、表現の分析の違いを解説します。

Lovo AIの代替10選

Lovo AIの代替10選

録音ナレーション、独自の声、ライブの発話向けにLovo AIの代替を比較し、声の一貫性と修正の流れを試します。

Amazon Pollyの代替11選

Amazon Pollyの代替11選

音声APIと録音音声向けにAmazon Pollyの代替を比較し、SSML、音声エンジン、出力形式、移行作業を確認します。

Flikiの代替11選

Flikiの代替11選

ナレーション付き動画と音声生成向けにFlikiの代替を比較し、動画を組み立てるツールと音声を供給するツールの違いを確認します。

Microsoft Azure Text-to-Speechの代替10選

Microsoft Azure Text-to-Speechの代替10選

Azureの音声合成の代替を、声、地域、SSML、統合の要件で比較します。移行前のテストを計画しましょう。

Narakeetの代替10選

Narakeetの代替10選

ナレーションと音声API向けにNarakeetの代替を比較し、スライドのタイミング、発音、完成動画までの手順を確認します。

サービス終了後のPlayHT代替サービス15選

サービス終了後のPlayHT代替サービス15選

PlayHTは2025年12月31日にサービスを終了しました。用途別に15の代替サービスを比較し、移行で何を復元できるかを解説します。

Resemble AIの代替11選

Resemble AIの代替11選

独自の声と音声生成向けにResemble AIの代替を比較し、同意、声の一貫性、導入方法、利用権利を確認します。

Respeecherの代替10選

Respeecherの代替10選

声のクローンと生成した台詞向けにRespeecherの代替を比較し、TTSと録音した演技の変換の違いを解説します。

Speecheloの代替10選

Speecheloの代替10選

ナレーション、文書読み上げ、音声API向けにSpeecheloの代替を比較し、購入条件、修正、商用出力を確認します。

Typecastの代替10選

Typecastの代替10選

台本付きや対話型の声に使うTypecastの代替を比較し、話し方の制御、話者の一貫性、割り込み対応を試します。

WellSaid Labsの代替10選

WellSaid Labsの代替10選

業務用ナレーションと音声アプリ向けにWellSaid Labsの代替を比較し、台本のレビュー、発音修正、APIの動作を試します。