日本語

モデル発表マイクロソフトMAI-Transcribe-2

Microsoftが音声認識モデルのMAI-Transcribe-2をリリース、競合モデルより高速かつ高精度と発表

Microsoftは、60の言語を自動で検知して文字起こしを行う音声認識モデル「MAI-Transcribe-2」をリリースしました。

同モデルは、ベンチマーク「FLEURS」において平均単語誤り率5.2%を記録し、1位となりました。これにより、1週間前に発表された「Gemini 3.5 Transcribe」などの競合モデルを上回ったとしています。

Artificial Analysisによる検証では、処理速度がOpenAIの「GPT-Transcribe」より10倍、ElevenLabsの「Scribe v2」より7倍、Googleの「Gemini 3.5 Transcribe」より5倍高速であることが示されました。同時に、より高い精度も発揮しています。

機能面では、話者の識別や単語のタイミング把握、専門用語の認識に優れています。また、「えーと」といったフィラーを残すか削除するかを選択できる設定も備わっています。

コストについては、2026年末までの期間限定で1時間あたり0.1ドルに設定されています。これは、Scribe V2やSmallest AI Pulse Proと比較して安価であると指摘されています。


出典: Microsoftが文字起こしAI「MAI-Transcribe-2」をリリース、Gemini 3.5 Transcribeより5倍高速&GPT-Transcribeより10倍高速(GIGAZINE、2026-09-04)