Metaは9月1日(現地時間)、Meta Superintelligence Labs(MSL)が開発した初のリアルタイム音声認識モデル「Muse Voice Transcribe」を発表しました。同モデルは「Meta Model API」を通じて提供され、価格は1時間当たり0.18ドルとしています。
モデル発表料金・制限メタMuse Voice Transcribe
Meta、初のリアルタイム音声認識モデルMuse Voice Transcribeを発表
単一モデルでストリーミングASR(音声認識)に加え、話者分離(ダイアライゼーション)と発話終了検知(エンドポインティング)を処理します。20人以上の話者を区別でき、1時間を超える音声にも後処理なしで対応できるとしています。
学習言語は70以上で、初期リリース時点では日本語を含む25言語が検証済みです。一つの文の中で言語が切り替わる「コードスイッチング」もネイティブに扱い、言語や文脈のバイアス指定によって認識精度を高めることが可能です。
技術面では、Muse Sparkファミリーの自己回帰型マルチモーダルモデルと位置付けられています。音声を80ミリ秒単位のチャンクで処理し、モデル自身が次の音声を聞き続けるかテキストを出力するかを判断します。強化学習により、精度と遅延のトレードオフを改善する「適応的ディレイ」を導入しています。
性能面では、Artificial Analysisのストリーミング音声認識ランキングなどで1位を獲得したと自社は述べています。Artificial Analysisのデータによると、確定文字起こしの単語誤り率(WER)は3.1%、発話終了からの遅延は0.16秒であり、CartesiaやElevenLabsのモデルを上回る結果となっています。
開発者向けのAPIのほか、Mac版のMeta AIおよびコーディング製品のMuse Codeでも利用可能です。なお、公式ブログにモデルの重み公開に関する言及はなく、現時点での提供はAPIと自社アプリ経由に限られます。
出典: Meta、初のリアルタイム音声認識モデル「Muse Voice Transcribe」 20人超の話者識別と多言語混在に対応(ITmedia AI+、2026-09-02)