拡散モデルは、高次元分布からのデータ生成という困難なタスクを、多くのデノイジング(ノイズ除去)タスクに分割して処理します。各ステップで予測を行い、それらを連続的に繰り返すことが生成の鍵です。
拡散モデルのサンプリングステップ削減における蒸留技術のメカニズムと課題
しかし、近年の研究ではサンプリングステップ数の削減、さらにはシングルステップでのサンプリングを目指す動きがあります。これは、分割された多くのステップがモデルの性能を支えているという性質と矛盾するように見えます。
記事では、この矛盾に触れつつ、蒸留(distillation)に焦点を当てた詳細な解説を行っています。蒸留とは、既存のモデル(教師)の予測を用いて、新しいモデル(生徒)を訓練する手法を指します。
拡散モデルが質の高い結果を得るために多くのステップを要する理由についても掘り下げています。サンプリングにおける各ステップは、入力空間における局所的な更新方向を計算する作業です。更新の歩幅を大きくしすぎると、生成される画像がぼやける原因となります。これは、ノイズによって高周波情報が隠蔽され、複数の可能性が混ざり合ってしまうためです。
出典: The paradox of diffusion distillation (2024)(Hacker News Frontpage、2026-09-04)