Qwenチームは、テキストからの画像生成と画像編集のために設計された統合モデルであるQwen-Image-2.1をオープンソースとして公開しました。視覚生成コンポーネントは、7十億パラメータと32単一ストリームDiT(Diffusion Transformer)レイヤーアーキテクチャを活用しており、生成品質と推論効率、そして汎用性を両立させています。
Qwen-Image-2.1 がオープンソースの統合型画像生成・編集モデルとしてリリース
この記事は翻訳です。 原文を読む
新しいモデルの主な機能は以下の通りです:
- テキストからの画像生成: ネイティブの2K解像度とさまざまなアスペクト比をサポート。
- 画像編集: 単一画像の編集および複数画像の合成をサポート。複数対象のタスクでは、最大10枚の参照画像を使用可能。
- 透過生成: 透明度を持つ画像を生成するためのRGBA出力をネイティブにサポート。
また、プロンプトの書き換え用に設計された、微調整済みのQwen3.5-VL 9Bチェックポイントもリリースされています。これらのモデルは、曖昧な編集指示と入力画像を受け取り、下流の画像編集タスクに最適化された、正確で実行可能なプロンプトを生成します。
最適な結果を得るために、開発者は提供されているプロンプト書き換えモデルを使用して、短いプロンプトを詳細な説明文へと拡張することを推奨しています。このモデルはQwen Research License Agreementの下で利用可能であり、Diffusers、vLLM-Omni、SGLang-Diffusionを含むさまざまな推論フレームワークをサポートしています。
出典
- Qwen/Qwen-Image-2.1-PE-I2I (HF: Qwen, 2026-09-20)
- GitHub repo
他1件の出典出典を閉じる
- Qwen/Qwen-Image-2.1-PE-T2I (HF: Qwen, 2026-09-20)