MLX-VLM v0.7.2 がリリースされました。これにより、幅広い視覚言語モデル(Vision-Language Models)への対応が拡大し、ライブラリにいくつかの機能的な洗練がもたらされました。
新モデルのサポートと改善
- 新モデルのサポート: Mistral Large 3 (675B VLM)、Bonsai 2 27B、LLaDA-Imageモデルファミリー、MetaのSapiens2高密度予測モデル、および Qwen-Image-2.1(text-to-imageおよび編集)のサポートを追加しました。
- 互換性の拡大: 現在のmoondream2チェックポイントとmoondream3のMLX量子化モデルのサポートを追加し、サポートされている画像モデルのリポジトリバリエーションに関する処理を改善しました。
- 機能強化: ローカルモデルの検出とステータス公開の改善、およびMLX用のSAM 3D Objectsを追加しました。
バグ修正と洗練
- APC (Attention Placement Cache) 管理: APCキャッシュのレイアウトロジックを洗練させ、フォールバックのない組み込みAPCキャッシュレイアウトの問題に対処し、トークンカウンターの明快さを向上させました。
- モデル固有の修正: LFM2-VL/LFM2.5-VLのビジョントーターの前処理を修正し、Qwen3 Omniのチャンク化されたprefillおよび結合された画像/ビデオ入力の不具合を修正、deepseek_v4の重み正規化の問題を解決しました。
- 全般的な修正: アシスタントのコンテンツが空であることに関するAnthropicのツール呼び出しの問題を修正し、moe_offloadおよびload_audioにおけるオーディオリサンプリングに関連する様々な問題を解決しました。
出典
- v0.7.2 (2026-09-21)