mlx-vlm v0.7.1 がリリースされました。これにより、複数の視覚言語(vision-language)モデルのサポートが拡大し、いくつかのアーキテクチャの最適化が行われました。
新機能と改善
- モデルサポートの拡大: GLM-5 Next、Hy4、Spark-X2.5,、および PP-DocLayout V3 (MLX) のサポートを追加しました。
- 視覚・ビデオ機能: レジスタートークンとマスクをサポートしたスタンドアロンのDINOv2モデル、SAM 3.1 マルチプレックス・ビデオトラッキング・ポート、およびMage-VLのビデオ理解サポートを追加しました。
- パフォーマンスの最適化: Gemma 4 のKV共有プリフィルを最適化し、Qwen MXFP4の検証を高速化しました。
- その他の機能: MiniCPM-oのTTSサポートとIndic-OCRサポートを追加しました。
バグ修正
- MiniCPM5の関数呼び出し(function-call)のパース、およびチャンク化されたプリフィル中のMllamaクロスアテンションマスクを修正しました。
- Gemma 4 の moe_offload における Experts.switch_glu ネストパスの問題を解決しました。
- Qwenモデルの埋め込みに関する問題の修正、およびGLMとAyaモデルのマーカーストリッピングの問題を解決しました。
出典
- v0.7.1 (2026-09-14)