日本語

モデル発表

vLLM v0.30.0 リリース — モデルサポートの拡大と Model Runner V2 の機能強化

この記事は翻訳です。 原文を読む

vLLM v0.30.0 がリリースされました。今回のリリースでは、モデルサポートの拡大、Model Runner V2 のパフォーマンス向上、そして Fast Start、Watermarking、HiSparse を含む新機能が提供されます。

新機能および改善

  • モデルサポートの拡大: Transformers バックエンドを通じて、DeepSeek-V4.1-Flash、DeepSeek-V4-Flash-Vision-Exp、GLM-5.3-Flash、K2-Horizon、Cohere Compass、Bailing V3 VL、および Nanbeige4.2 のサポートを追加しました。
  • Model Runner V2 の強化: eager モードにおける dual-batch overlap、microbatched steps へのフル CUDA graph への対応、および投機的デコーディング(speculative decoding)のための適応型検証を導入しました。
  • Fast Start: CUDA IPC を使用した、GPU ごとの永続的なウェイトキャッシュデーモンを追加し、エンジン再起動を高速化しました。現在は FP4 チェックポイントとマルチノード TP にも対応しています。
  • Watermarking: キー付き PRF を用いた Gumbel-max ウォーターマーク付きの生成と検知を実装し、リクエストごとのオプトアウトが可能になりました。
  • HiSparse: sparse-MLA デコード用にホスト常駐ティアを導入しました。これにより、KV ページをピン留めされたホストメモリに退避(spill)させることで、GPU メモリの圧力を管理できます。
  • 量子化: ターゲットを絞ったオンライン 量子化 および、NVFP4 や W4A16 を含む様々な新しいフォーマットのサポートを追加しました。
  • パフォーマンスの最適化: NVIDIA (Qwen3.8-Flash-Next, Kimi K3)、AMD ROCm、Intel XPU、および CPU (DeepSeek-V4) に対するハードウェア固有の改善が含まれています。

バグ修正

  • GPU コンパクト・サンプリングマスクに関連する、約 2x の RL ステップ時間のデグレを修正しました。
  • 無効な構造化出力(structured-output)のリクエストによってエンジンが停止しなくなるなどの諸問題の解決、およびレスポンス増幅を防ぐためのバリデーションエラー・レスポンスボディの絶対境界の処理を行いました。

破壊的変更および非推奨事項

  • スケールアウト・エンドポイント: vllm serve を介したスケールアウト・エンドポイント (/render, /derender, __LAB_TERM_0046__推論__LAB_TERM_0047__) の登録は、--enable-scale-out フラグを使用したオプトイン形式となりました。また、VLLM_ENABLE_SCALE_OUT_ENDPOINTS 環境変数は削除されました。
  • 削除された機能: GPTQ アクティベーション順序 (g_idx) を削除し、VLLM_PREFIX_CACHE_RETENTION_INTERVAL および VLLM_MM_HASHER_ALGORITHM を含む環境変数を非推奨としました。
  • 非推奨となったコンポーネント: all Mamba キャッシュモードおよび python -m vllm.entrypoints.grpc_server コマンドが非推奨となりました。
  • YaRN のアライメント: YaRN を Transformers とアライメントさせました。これにより、特定のモデルで異なる max_model_len 値が生じる可能性があります。

出典

  1. v0.30.0 (2026-09-22)