日本語

モデル発表

mlx-vlm v0.7.1 公開 — モデルサポートの拡大とパフォーマンスの最適化

この記事は翻訳です。 原文を読む

mlx-vlm v0.7.1 がリリースされました。これにより、複数の視覚言語(vision-language)モデルのサポートが拡大し、いくつかのアーキテクチャの最適化が行われました。

新機能と改善

  • モデルサポートの拡大: GLM-5 Next、Hy4、Spark-X2.5,、および PP-DocLayout V3 (MLX) のサポートを追加しました。
  • 視覚・ビデオ機能: レジスタートークンとマスクをサポートしたスタンドアロンのDINOv2モデル、SAM 3.1 マルチプレックス・ビデオトラッキング・ポート、およびMage-VLのビデオ理解サポートを追加しました。
  • パフォーマンスの最適化: Gemma 4 のKV共有プリフィルを最適化し、Qwen MXFP4の検証を高速化しました。
  • その他の機能: MiniCPM-oのTTSサポートとIndic-OCRサポートを追加しました。

バグ修正

  • MiniCPM5の関数呼び出し(function-call)のパース、およびチャンク化されたプリフィル中のMllamaクロスアテンションマスクを修正しました。
  • Gemma 4 の moe_offload における Experts.switch_glu ネストパスの問題を解決しました。
  • Qwenモデルの埋め込みに関する問題の修正、およびGLMとAyaモデルのマーカーストリッピングの問題を解決しました。

出典

  1. v0.7.1 (2026-09-14)