MLX-VLM v0.7.4がリリースされ、いくつかの新しいモデルへの対応と、画像生成ワークフローにおける大幅な改善がもたらされました。
モデル発表DeepSeek V4.1Qwen3.5 MoEInternVL3.5
MLX-VLM v0.7.4 Public — DeepSeek V4.1への対応と複数の画像生成機能強化を追加
この記事は翻訳です。 原文を読む
新機能および改善点
- DeepSeek V4.1(ビジョンおよび言語モデル)とInternVL3.5への対応を追加。
num_imagesパラメーターを介して、1つのプロンプトから複数の画像を生成できる機能を紹介。qwen_image、flux2、およびideogram4のバッチ画像生成を実装。- Qwen3.5 MoE テキスト、および LFM2 エンコーダー/ColBERT への対応を追加。
- ハーモニー・チャネルの推論およびコンテンツ解析を伴う
gpt-ossへの対応を追加。 - モデルベースのサンプリング・デフォルトを使用することで、画像生成を改善。
バグ修正
- サーバーのマルチスレッド環境における MiMo-V2.6 のオーディオ・リクエスト失敗を修正。
- バッチにおける Qwen3.5-arch のレフト・パディング問題、および量子化された
pos_embedを使用した Qwen3-VL のポジション・エンベディングの問題を修正。 - ブーリアン・プロパティ・スキーマ、型のない Qwen3-Coder オブジェクト、および閉じられていないパラメーターに関連するツール・パーサーの失敗を解決。
- 小さい
top-pおよび極端に低い温度設定時におけるサンプリングの問題を修正。 - Gemma 4 のオーディオ・エンコーダーにおける過去フレームのアテンションに関するバグを修正。
- 共有プロンプト・フォーマットにおけるインターリーブされた画像の順序、および特定の量子化モデルにおける KV キャッシュ・パッキングの問題を解決。
情報源
出典
- v0.7.4 (2026-09-28)