物理学的アプローチでLLMを高速化するブロック削除手法「CBO」公開

基本情報
| 項目 | 内容 |
|---|---|
| 公開元 | Hugging Face Blog |
| 公開日 | 2026-09-21 |
| 出典の種類 | 公開元の一次情報(Hugging Face公式ブログのチーム記事として掲載されている) |
収集・肉付けの時点で当サイトのコードが確定させた値です。日付はJST。
概要
Multiverse Computingは、大規模言語モデル(LLM)のTransformerブロックを削除して高速化する「深度削減(depth pruning)」を、物理学におけるイジング模型の最適化問題として定式化する手法「CBO (Constrained Binary Optimization)」を発表した。この手法は、各ブロックを削除するか否かをバイナリ変数(スピン)として扱い、ブロック間の相互作用を考慮することで、従来の独立した指標に基づく手法よりも高い圧縮率でモデルの性能を維持することを示している。
主張と根拠
発表者は、ブロックの削除がモデルの損失に与える影響は各ブロックで独立しておらず、どのブロックを同時に削除するかという組み合わせによって変化すると主張している。この相互作用を考慮するため、モデルの損失をバイナリ変数に対して2次テイラー展開し、ブロック間の結合を示すヘッセ行列(Hessian matrix)を構築した。これにより、最適なブロックの組み合わせを探す問題を、イジング・ガラスのエネルギー最小化問題へと変換している。
発表者の測定によれば、Llama-3.3-70B-Instructを用いた検証において、再学習なしで50%のブロックを削除(40/80ブロック)した場合でも、CBOは既存の有力な手法(Block influence)を大きく上回る性能を維持した。具体的には、一般知識を測る指標であるMMLUにおいて、既存手法が54.0まで低下する一方で、CBOは76.9を記録し、約23ポイントの差をつけている。
Llama-3.3-70B-Instruct ベンチマーク結果(再学習なし)
| 削除ブロック数 | 手法 | MMLU (正解率%) |
|---|---|---|
| 0 (Original) | – | 82.2 |
| 32 / 80 | CBO (ours) | 76.6 |
| 32 / 80 | Block influence | 59.3 |
| 40 / 80 | CBO (ours) | 76.9 |
| 40 / 80 | Block influence | 54.0 |
また、Qwen3-14Bにおいて12/40ブロックを削除したケースでは、CBOがMMLUで約10ポイントのリードを示した。さらに、Mamba2、Attention、Mixture-of-Experts (MoE) 層が混在する不均一なアーキテクチャを持つNVIDIA-Nemotron-3-Nano-30B-A3B-FP8に対しても、再学習なしで適用可能であり、AIME25や科学の難問を測るGPQA Diamondにおいて既存手法を上回る構成を発見できることが示された。
この手法の特徴として、エネルギーの基底状態(最小値)だけでなく、低エネルギーの「励起状態」も容易に探索できる点が挙げられる。Llama-3.1-8B-Instructを用いた実験では、基底状態よりも第17励起状態の構成の方が、軽い再学習後に複数のベンチマークで優れた性能を示すことが確認された。これは、単一の連続したブロック群を削除するのが最善であるという一般的な仮定を覆す結果となっている。
計算コストの面では、ヘッセ行列の計算は小規模なキャリブレーションデータセットを用いた1回のフォワード・バックワードパスで完了する。その後、特定の構成のエネルギーを計算するコストは非常に低く、Llama-3.3-70Bから8ブロックを削除する際の290億通りの構成の全探索(ブルートフォース)は、単一のGPUでおよそ2日間で完了した。また、オープンソースのTabuサーチソルバーなどの量子インスパイアアルゴリズムを用いることで、全探索が不可能な巨大な探索空間においても、数秒で低エネルギー状態に到達できるとしている。
前提条件
この手法を適用し、資料と同等の結果を得るための条件は以下の通りである。
- 対象モデル: Llama-3.1-8B-Instruct、Qwen3-14B、Llama-3.3-70B-Instruct、および NVIDIA-Nemotron-3-Nano-30B-A3B-FP8(Mamba2、Attention、MoE層が混在するハイブリッドモデル)。
- ハードウェア:
- ヘッセ行列の計算および小規模な探索(例:Llama-3.3-70Bから8ブロックを削除する290億通りの探索):単一のGPU(具体的なモデル名は未記載)。 – 大規模な探索:古典的な計算機、または量子・量子インスパイアソルバー(QAOA、量子アニーリング、Tabuサーチなど)。
- ソフトウェア:
- 公開リポジトリ:
github.com/CompactifAI/Block_removal_through_constrained_binary_optimization。 – ソルバー:オープンソースのTabuサーチソルバー、およびMultiverse Computingが提供する専用のソルバー群。
- 公開リポジトリ:
- 設定およびデータ:
- キャリブレーション:ブロック間の結合係数(ヘッセ行列)を算出するために、少量のキャリブレーションデータセットを用いた1回分のフォワードおよびバックワードパスが必要。 – 学習設定:基本的には再学習なし(zero-shot)で動作するが、性能を最大化するために「軽い再学習(light retraining)」を組み合わせる場合がある。
手元で再現できる範囲
読者は、公開されているコードと一般的なGPU環境を用いて、この深度削減手法を自分のモデルに適用できる。
- コードの利用: 実装コードがGitHubで公開されており、自身の手元にあるモデルに対してヘッセ行列を計算し、最適なブロック削除構成を探索することが可能である。
- 探索の実行: 数百万通りの構成であれば数秒、Llama-3.3-70Bで8ブロックを削除する290億通りの全探索であっても、単一のGPUで約2日間あれば完了すると報告されている。ヘッセ行列は一度計算すれば、異なる削減目標数(M)に対して再利用できる。
- 効率的な最適化: 全探索が不可能なほど探索空間が広い場合でも、リポジトリに含まれるオープンソースのTabuソルバーを使用することで、数秒以内に良好な低エネルギー状態(削除すべきブロックの組み合わせ)を特定できる。資料によれば、必ずしも厳密な基底状態(最小エネルギー)を見つける必要はなく、いくつかの低エネルギー状態を生成して検証するアプローチが有効である。
- 不均一なモデルへの適用: 密なTransformerモデルだけでなく、MoEやMamba2を含む複雑なアーキテクチャに対しても、特別な変更なしにそのまま適用可能であることが示されている。
資料が触れていないこと
手法の有効性を評価する上で重要だが、資料に記載がない情報は以下の通りである。
- 具体的なハードウェア仕様: ブルートフォース探索に要した「2日間」や、Tabuソルバーの実行に使用したGPUまたはCPUの具体的な型番、および必要となるビデオメモリ(VRAM)容量。
- キャリブレーションデータの詳細: ヘッセ行列を計算するために必要な「少量のキャリブレーションデータ」の具体的なサンプル数、トークン数、およびデータセットの構成内容。
- 推論速度の具体的な向上値: ブロック削除によりモデルが短くなることで「予測可能な推論速度の向上」が得られるとしているが、実機環境での具体的なスループット(tokens/sec)や遅延(latency)の測定データは示されていない。
- 再学習(Healing)のコスト: 「軽い再学習」によって性能が向上する例が示されているが、その再学習に要した計算リソース、時間、および使用したデータ量の詳細。
- 他のモデルファミリーでの検証: Llama、Qwen、Nemotron以外の主要なモデル(例:Mistral、Gemma、Phiなど)における有効性や挙動の違い。

