Microsoft Researchは、ストリーミング音声認識モデル「VibeVoice-ASR-Streaming-7B」を公開したと発表しました。このモデルは、音声の入力に合わせて、話者の識別と内容の転記を同時に行う機能を備えています。

本モデルは10言語に対応しています。対象となる言語は、中国語、英語、フランス語、ドイツ語、イタリア語、日本語、韓国語、ポルトガル語、ロシア語、スペイン語です。

また、カスタムホットワード機能も備えています。ユーザーは名前や専門用語などの単語をあらかじめ指定することで、特定のドメインにおける認識精度を向上させることが可能です。

なお、本プロジェクトはMITライセンスの下で公開されています。


出典: microsoft/VibeVoice-ASR-Streaming-7B(HF: Microsoft、2026-09-03)