日本語

モデル発表DeepSeek V4.1Qwen3.5 MoEInternVL3.5

MLX-VLM v0.7.4 Public — DeepSeek V4.1への対応と複数の画像生成機能強化を追加

この記事は翻訳です。 原文を読む

MLX-VLM v0.7.4がリリースされ、いくつかの新しいモデルへの対応と、画像生成ワークフローにおける大幅な改善がもたらされました。

新機能および改善点

  • DeepSeek V4.1(ビジョンおよび言語モデル)とInternVL3.5への対応を追加。
  • num_images パラメーターを介して、1つのプロンプトから複数の画像を生成できる機能を紹介。
  • qwen_image、flux2、および ideogram4 のバッチ画像生成を実装。
  • Qwen3.5 MoE テキスト、および LFM2 エンコーダー/ColBERT への対応を追加。
  • ハーモニー・チャネルの推論およびコンテンツ解析を伴う gpt-oss への対応を追加。
  • モデルベースのサンプリング・デフォルトを使用することで、画像生成を改善。

バグ修正

  • サーバーのマルチスレッド環境における MiMo-V2.6 のオーディオ・リクエスト失敗を修正。
  • バッチにおける Qwen3.5-arch のレフト・パディング問題、および量子化された pos_embed を使用した Qwen3-VL のポジション・エンベディングの問題を修正。
  • ブーリアン・プロパティ・スキーマ、型のない Qwen3-Coder オブジェクト、および閉じられていないパラメーターに関連するツール・パーサーの失敗を解決。
  • 小さい top-p および極端に低い温度設定時におけるサンプリングの問題を修正。
  • Gemma 4 のオーディオ・エンコーダーにおける過去フレームのアテンションに関するバグを修正。
  • 共有プロンプト・フォーマットにおけるインターリーブされた画像の順序、および特定の量子化モデルにおける KV キャッシュ・パッキングの問題を解決。

情報源

出典

  1. v0.7.4 (2026-09-28)