日本語

モデル発表

MLX-VLM v0.7.2 リリース — モデル対応の拡大とAPC管理の強化

この記事は翻訳です。 原文を読む

MLX-VLM v0.7.2 がリリースされました。これにより、幅広い視覚言語モデル(Vision-Language Models)への対応が拡大し、ライブラリにいくつかの機能的な洗練がもたらされました。

新モデルのサポートと改善

  • 新モデルのサポート: Mistral Large 3 (675B VLM)、Bonsai 2 27B、LLaDA-Imageモデルファミリー、MetaのSapiens2高密度予測モデル、および Qwen-Image-2.1(text-to-imageおよび編集)のサポートを追加しました。
  • 互換性の拡大: 現在のmoondream2チェックポイントとmoondream3のMLX量子化モデルのサポートを追加し、サポートされている画像モデルのリポジトリバリエーションに関する処理を改善しました。
  • 機能強化: ローカルモデルの検出とステータス公開の改善、およびMLX用のSAM 3D Objectsを追加しました。

バグ修正と洗練

  • APC (Attention Placement Cache) 管理: APCキャッシュのレイアウトロジックを洗練させ、フォールバックのない組み込みAPCキャッシュレイアウトの問題に対処し、トークンカウンターの明快さを向上させました。
  • モデル固有の修正: LFM2-VL/LFM2.5-VLのビジョントーターの前処理を修正し、Qwen3 Omniのチャンク化されたprefillおよび結合された画像/ビデオ入力の不具合を修正、deepseek_v4の重み正規化の問題を解決しました。
  • 全般的な修正: アシスタントのコンテンツが空であることに関するAnthropicのツール呼び出しの問題を修正し、moe_offloadおよびload_audioにおけるオーディオリサンプリングに関連する様々な問題を解決しました。

出典

  1. v0.7.2 (2026-09-21)