Pruning LLMs Like a Physicist: Block Removal as an Ising Optimization Problem
Quick Summary
Multiverse Computing은 LLM 블록 제거를 블록 간 상호작용을 반영하는 제약 이진 최적화(CBO)와 Ising glass의 에너지 최소화 문제로 정식화해, Llama 3.3 70B Instruct의 50% 깊이 압축에서 재학습 없이 block influence보다 MMLU를 22.9%포인트 높였다고 보고했다.
🖼️ 인포그래픽

🖼️ 4컷 인포그래픽

💡 한 줄 요약
Multiverse Computing은 LLM 블록 제거를 블록 간 상호작용을 반영하는 제약 이진 최적화(CBO)와 Ising glass의 에너지 최소화 문제로 정식화해, Llama-3.3-70B-Instruct의 50% 깊이 압축에서 재학습 없이 block influence보다 MMLU를 22.9%포인트 높였다고 보고했다.
📌 핵심 요약
- 블록 제거는 모델 깊이를 줄여 추론 속도와 메모리 사용량을 개선하지만, 제거 효과가 다른 블록의 제거 여부에 따라 달라지므로 개별 중요도 순위만으로는 좋은 조합을 찾기 어렵다.
- CBO는 손실의 2차 Taylor 전개로 얻은 근사 Hessian에 개별 블록의 영향과 블록 간 결합을 담고, N개 중 정확히 M개를 제거한다는 제약 아래 xᵀH⁰x를 최소화한다. 작은 보정 데이터셋으로 한 번 계산한 Hessian은 여러 압축 목표에 재사용할 수 있다.
- 단일 GPU로 Llama-3.3-70B의 80개 블록 중 8개를 제거하는 약 290억 조합을 전수 탐색하는 데 약 이틀이 걸렸지만, 오픈소스 tabu solver는 전수 탐색으로 검증 가능한 어려운 사례에서도 수초 만에 최저 에너지 상태에 도달했다. 에너지는 품질의 불완전한 대리 지표이며, Llama-3.1-8B-Instruct에서 16/32개 블록 제거 시 17번째 들뜬 상태가 가벼운 재학습 후 여러 벤치마크에서 바닥 상태보다 우수했다.
- 재학습 없는 Llama-3.3-70B-Instruct 평가에서 원본 MMLU는 82.2였고, 32/80개 제거 시 CBO는 76.6, block influence는 59.3이었다. 40/80개 제거 시 각각 76.9와 54.0으로 격차는 22.9%포인트였으며, 24/80개 제거까지는 대체로 비슷했다. Qwen3-14B의 12/40개 제거에서는 CBO가 MMLU에서 약 10%포인트 앞섰다.
- Mamba2·attention·MoE가 섞인 NVIDIA-Nemotron-3-Nano-30B-A3B-FP8에서도 재학습 없이 MoE 2~3개 층 또는 attention 2개 층을 제거했을 때 CBO가 AIME25와 GPQA에서 block influence를 앞섰다. 블록 제거는 양자화, low-rank/SVD 압축, 너비 가지치기, 지식 증류 기반 복구와 결합할 수 있다.
🧩 주요 포인트
- 개별 블록 점수에서 블록 간 결합으로 탐색 기준 확장 → 깊은 압축에서 커지는 조합 효과를 반영하고, 같은 Hessian으로 여러 제거 개수를 탐색할 수 있음.
- 저에너지와 실제 품질의 상관관계는 강하지만 불완전함 → 바닥 상태 하나에 고정하지 않고 들뜬 상태를 포함한 후보들의 벤치마크 성능과 재학습 영향을 비교할 필요가 있음.
- 높은 제거 비율과 이질적 구조에서 보고된 성능 우위 → CBO의 적용 가능성을 뒷받침하지만, 얕은 압축에서의 비슷한 성능과 모델별 평가 조건을 함께 해석해야 함.
🧠 상세 정리
1. 블록 제거의 장점과 조합 선택의 난점
트랜스포머 블록 전체를 삭제하는 블록 제거 또는 깊이 가지치기는 LLM을 더 빠르게 만드는 저렴하고 직접적인 방법으로 소개된다. 모델 자체가 짧아지므로 메모리 절감에 더해 예측 가능한 추론 속도 개선을 얻을 수 있고, 양자화나 저랭크 압축 같은 다른 기법과도 결합하기 쉽다. 그러나 어떤 블록을 삭제하느냐에 따라 모델 품질이 무너질 수 있으며, 한 블록의 제거 효과도 함께 제거한 다른 블록에 의존한다. 따라서 문제의 핵심은 블록별 중요도 순위를 정하는 것이 아니라 상호작용하는 제거 결정의 조합을 선택하는 데 있다. Multiverse Computing의 논문은 이 구조를 물리학의 스핀 시스템과 연결해, 블록 선택을 제약 이진 최적화 문제로 다루는 접근을 제시한다.
2. 독립적 중요도 평가가 놓치는 상호작용
기존 블록 제거 기법 대부분은 크기, 민감도 또는 block influence 같은 기준으로 블록을 개별 평가한 뒤 덜 중요해 보이는 것부터 제거한다. 원문은 이 접근을 이웃 스핀의 영향을 평균장으로 대체하는 물리학의 평균장 방법에 비유하며, 블록 사이의 개별 결합을 충분히 반영하지 못한다고 설명한다. 연속된 블록 구간 하나만 제거하는 방식도 탐색을 단순화하지만 가능한 조합의 상당 부분을 배제한다. 예를 들어 20번 블록을 제거할 때의 손실은 19번이나 24번 블록도 함께 제거했는지에 따라 달라질 수 있고, 모델이 깊고 이질적일수록 이런 결합을 무시하는 대가가 커질 수 있다. 다수 블록을 동시에 제거하려면 조합을 탐색해야 하지만 후보 수가 지수적으로 늘어나므로, 저자들은 쌍별 결합을 다루는 통계물리학의 도구를 활용한다.
3. Hessian으로 구성하는 Ising 에너지
각 트랜스포머 블록에는 유지할 때 0, 제거할 때 1인 이진 변수를 부여하고, 이 변수에 대한 모델 손실의 2차 Taylor 전개로 근사 Hessian을 구성한다. Hessian의 대각 성분은 각 블록의 개별 영향을, 비대각 성분은 두 블록의 제거 결정 사이에 작용하는 쌍별 결합을 나타낸다. 최적화 목표는 전체 N개 중 정확히 M개를 제거한다는 제약을 지키면서 에너지 xᵀH⁰x를 최소화하는 조합을 찾는 것이다. 물리적으로는 모든 스핀이 서로 결합하고 전체 자화가 고정된 Ising glass에 대응하며, 제거 블록 수를 고정하는 조건이 전체 스핀을 고정하는 역할을 한다. 저자들은 낮은 에너지가 높은 벤치마크 품질을 예측하는 강한 대리 지표라고 보고하지만, 이후 사례에서 드러나듯 그 대응이 완벽한 것은 아니다.
4. 한 번의 보정 계산과 탐색 비용
이 접근이 실용적인 이유는 작은 보정 데이터셋에 대한 순전파와 역전파로 Hessian과 블록 간 결합을 한 번만 계산하면 되기 때문이다. 그 뒤 각 후보 조합을 평가하는 데는 저렴한 에너지 계산만 필요하므로, 모든 후보에 실제 모델 추론이나 벤치마크 실행을 반복할 필요가 없다. 결합은 목표 제거 개수에 의존하지 않아 같은 Hessian을 서로 다른 M에 재사용할 수 있다는 점도 여러 압축 수준을 탐색하는 데 유리하다. 저자들은 단일 GPU에서 수백만 후보는 수초에, 최대 수백억 후보까지는 전수 탐색으로 평가했다고 설명한다. 다만 Llama-3.3-70B의 80개 블록 중 8개를 제거하는 약 290억 조합을 확인하는 데 약 이틀이 걸렸으며, 이는 에너지 평가가 저렴해도 조합 수가 커지면 정확한 전수 탐색이 한계에 부딪힘을 보여준다.
5. QUBO와 저에너지 후보를 찾는 solver
전수 탐색이 어려운 경우에는 제거 개수 제약을 벌점 항에 흡수한 QUBO 형태로 바꾸어 기존 최적화 solver에 문제를 전달할 수 있다. 원문은 양자 어닐링, QAOA, tabu search, 특화된 분기 한정법 등 고전·양자·양자 영감 최적화 수단을 활용 가능한 방법으로 나열한다. 실제 보고된 결과에서는 오픈소스 tabu solver가 전수 탐색과 대조할 수 있는 가장 어려운 사례에서도 수초 만에 최저 에너지 상태에 안정적으로 도달했다. 그러나 저자들은 이 작업의 성공 기준이 언제나 정확한 바닥 상태를 찾는 데 있지는 않다고 강조한다. 필요한 것은 소수의 좋은 저에너지 후보를 빠르게 만드는 것이므로, 가벼운 solver 여러 개를 활용할 여지가 있으며 양자 하드웨어의 실제 우위를 입증하는 주장과는 구분된다.
6. 바닥 상태보다 좋은 들뜬 상태
에너지가 모델 품질을 완벽하게 예측하지는 않으므로, 가장 낮은 에너지의 바닥 상태가 반드시 가장 좋은 가지치기 모델은 아니다. 저자들은 Hamiltonian을 구성한 뒤 바닥 상태뿐 아니라 그 근처의 저에너지 들뜬 상태도 매우 적은 추가 비용으로 얻어, 여러 유망한 후보를 비교할 수 있다고 설명한다. Llama-3.1-8B-Instruct에서 32개 중 16개 블록을 제거하는 사례에서는 상위 후보 대부분이 기존 연구의 예상처럼 모델 뒤쪽 블록을 주로 삭제했다. 하지만 17번째 들뜬 상태는 처음으로 모델 앞부분의 블록 제거를 제안했고, 가벼운 재학습 뒤 여러 벤치마크에서 바닥 상태보다 좋은 성능을 보였다. 이 사례는 최적의 제거 대상이 항상 중간이나 후반의 연속 구간이라는 가정을 반박하며, 실제 품질 평가에서 저에너지 후보군 전체를 살펴볼 이유를 제공한다.
7. 깊은 압축에서 벌어지는 성능 격차
Llama-3.1-8B-Instruct, Qwen3-14B, Llama-3.3-70B-Instruct에 대한 결과에서 CBO는 최신 블록 제거 기준 방법과 비슷하거나 더 나은 성능을 보였고, 압축이 강해질수록 우위가 커졌다고 보고됐다. 재학습 없는 Llama-3.3-70B-Instruct 평가에서는 80개 중 24개를 제거할 때까지 block influence와 대체로 비슷했지만, 32개와 40개를 제거하면 차이가 뚜렷해졌다. 원본 MMLU가 82.2인 가운데 32/80개 제거에서는 CBO가 76.6, block influence가 59.3이었고, 40/80개 제거에서는 각각 76.9와 54.0이었다. 50% 깊이 압축에서의 차이는 22.9%포인트이며, 이 설정에서는 평가한 모든 벤치마크에서 CBO가 비교 기준을 앞섰다. Qwen3-14B도 12/40개 제거에서 MMLU가 약 10%포인트 높았으며, 저자들은 얕은 압축에서 성능이 비슷한 점과 함께 이를 많은 블록을 제거할수록 결합이 중요해진다는 근거로 해석한다.
8. 하이브리드 모델로의 확장과 압축 기법 결합
저자들은 Mamba2, attention, MoE 층이 비균일하게 섞인 NVIDIA-Nemotron-3-Nano-30B-A3B-FP8에도 재학습 없이 방법을 적용해, 동질적인 트랜스포머 구조를 넘어서는 적용 가능성을 살폈다. MoE 층 2~3개 또는 attention 층 2개를 제거했을 때 CBO가 찾은 조합은 AIME25와 GPQA에서 block influence보다 좋은 성능을 보였다. 원문은 이를 하이브리드 모델에도 중복성이 있지만 층마다 고르게 분포하지는 않는다는 근거로 해석하며, 이 경우에도 최상의 조합은 종종 바닥 상태가 아닌 들뜬 상태였다고 설명한다. Multiverse Computing은 이런 Ising Hamiltonian 기반 접근이 자사의 고전 및 양자 영감 최적화 역량과 맞물리고, 양자화·low-rank/SVD 압축·너비 가지치기·지식 증류 기반 복구와도 함께 쓰일 수 있다고 설명한다. 상세 유도, QUBO 변환, solver 비교, 보정 데이터셋 분석과 전체 결과는 Hugging Face의 논문에 안내되어 있으며, 코드는 github.com/CompactifAI/Block_removal_through_constrained_binary_optimization에 공개되어 있다.
🧾 핵심 주장 / 시사점
- 이 방법의 핵심은 개별 블록의 중요도를 더 정교하게 매기는 데 그치지 않고, 블록 간 결합을 포함한 조합의 가치를 저렴하게 평가하도록 문제를 바꾸는 데 있다.
- 에너지 최소화는 실제 품질을 찾기 위한 대리 목적이므로, 정확한 바닥 상태 탐색보다 다양한 저에너지 후보의 확보가 실용적으로 더 중요할 수 있다.
- 보고된 이점은 압축 강도와 모델 구조에 따라 달라진다. 깊은 압축과 하이브리드 모델의 결과는 유망하지만, 얕은 압축에서도 같은 폭의 개선이 나타난다고 일반화할 근거는 없다.
✅ 액션 아이템
- Llama-3.3-70B-Instruct의 32/80개·40/80개 제거 결과를 재학습 없는 조건과 함께 비교해 CBO의 깊은 압축 이점 평가.
- Llama-3.1-8B-Instruct의 17번째 들뜬 상태 사례를 바탕으로 바닥 상태와 저에너지 후보들의 벤치마크 성능 및 재학습 영향 비교.
- NVIDIA-Nemotron-3-Nano-30B-A3B-FP8의 MoE 2~3개 층·attention 2개 층 제거 결과를 기준으로 이질적 구조에서 CBO의 적용 가능성 검토.
❓ 열린 질문
- Llama-3.3-70B-Instruct에서 24/80개 제거까지는 성능이 비슷하지만 32/80개와 40/80개 제거에서 격차가 커지는 현상을 블록 간 결합이 어느 정도 설명하는가?
- 에너지가 품질의 불완전한 대리 지표라면, 바닥 상태와 들뜬 상태 후보를 얼마나 비교해야 높은 벤치마크 성능의 조합을 안정적으로 찾을 수 있는가?
- NVIDIA-Nemotron-3-Nano-30B-A3B-FP8에서 확인된 CBO의 우위는 MoE 2~3개 층 또는 attention 2개 층보다 많은 층을 제거할 때도 유지되는가?