Multiverse Computingは、削除するTransformerブロックの選択を制約付きバイナリ最適化(CBO)問題として扱う、新しいLLM圧縮手法に関する論文とオープンソースコードを公開しました。この手法は、異なるブロック間の複雑な相互作用を考慮するために、このタスクを乱れたスピン系であるIsingグラスへとマッピングします。
Ising最適化によるLLMのブロック削除がベースラインの圧縮手法を上回る性能を実現
この記事は翻訳です。 原文を読む
各ブロックを独立してスコアリングする既存のヒューリスティックベースの手法とは異なり、このアプローチではモデルの損失関数の2次テイラー展開を用いてヘッセ行列を構築します。これにより、システムはブロック間のペアごとの結合を考慮することが可能になり、選択プロセスを単純なランキングタスクではなく、組合せ最適化問題として扱うことができます。
この手法の実用的な利点は、その計算効率にあります。小規模なキャリブレーションデータセットを使用してヘッセ行列を一度計算してしまえば、候補となる構成の評価は、モデル全体を実行する必要のない低コストなエネルギー計算となります。複雑なケースについては、タブーサーチのような古典的または量子に着想を得たソルバーを使用して問題を解決できます。
実用的なアプリケーションにおいて、この手法は高度な圧縮シナリオで大幅な改善を示しました。Llama-3.3-70B-Instructにおいて、50%の圧縮率(40の80ブロックを削除)で、CBO手法は77,に近いMMLUスコアを維持したのに対し、最も強力なベースラインは50sの中程度まで低下しました。また、この手法はNVIDIA-Nemotron-3-Nano-30B-A3B-FP8のようなハイブリッドアーキテクチャに対しても、Mixture of Experts(MoE)とアテンション構造内の極めて不要な層を特定することで、その有効性を証明しました。
出典
- Pruning LLMs Like a Physicist: Block Removal as an Ising Optimization Problem (Hugging Face Blog, 2026-09-21)
- GitHub