2026년 9월 22일 화요일
METABRIEF — Insights. Connection. Innovation.
AI

멀티버스 컴퓨팅, LLM 블록 제거를 '이징 모형' 최적화로 푼다

허깅페이스에 공개된 멀티버스 컴퓨팅 연구팀의 블로그 글에 따르면, 이 팀은 대형언어모델(LLM)에서 트랜스포머 블록을 통째로 삭제하는 '깊이 가지치기'를 물리학의 이징(Ising) 모형 최적화 문제로 바꿔 푸는 방법을 논문 'LLM Compression by Block Removal with Constrained Binary Optimization'에서 제시했다.


방법의 핵심은 각 블록에 '유지=0, 제거=1'의 이진 변수를 붙이고 손실 함수를 2차 테일러 전개해 헤세 행렬을 구하는 것이다. 대각 성분은 블록 하나의 중요도, 비대각 성분은 블록 간 상호작용(결합)에 해당한다. 기존 기법이 블록을 개별 평가해 순위를 매기는 것과 달리, 연구팀은 이 상호작용까지 반영한 에너지를 최소화하는 조합을 찾는다. 헤세 행렬은 소규모 교정 데이터로 한 번만 계산하면 되고 이후에는 실제 모델을 돌리지 않고도 후보 조합을 값싸게 평가할 수 있으며, 어려운 사례는 QUBO 형태로 바꿔 타부 탐색 등 기존 솔버에 넘길 수 있다고 설명했다.


성능 차이는 압축률이 높을 때 두드러졌다. 라마-3.3-70B-인스트럭트의 블록 80개 중 40개를 제거한 50% 압축 조건에서 MMLU 점수가 약 77로, 50점대 중반에 머문 기존 최고 기법보다 23%포인트가량 높았다. 큐원3-14B는 40개 중 12개 제거 시 MMLU에서 약 10점 앞섰다. 또 최저 에너지 상태가 항상 최선은 아니어서, 라마-3.1-8B에서는 모델 앞부분 블록을 제거하는 17번째 들뜬 상태가 가벼운 재학습 후 여러 벤치마크에서 바닥상태를 앞섰다. 코드는 깃허브에 공개됐다.



메타브리프 편집팀