← 최신 논문
🤖 machine learning

NIRVANA: Structured Pruning Reimagined for Large Language Model Compression

NIRVANA는 신경 탄젠트 커널(Neural Tangent Kernel)에서 영감을 받은 돌출도(saliency), 최적 할당을 포함한 전역 유닛 순위 지정 전략, 그리고 KL-발산 기반의 데이터 선택을 활용하여, 계산 비용이 많이 드는 재학습 없이도 제로샷 성능과 미세 조정 능력을 보존하면서 거대 언어 모델의 최첨단 압축을 달성하는 새로운 하드웨어 인지형 구조적 가지치기 프레임워크입니다.

원저자: Mengting Ai, Tianxin Wei, Sirui Chen, Jingrui He

게시일 2026-07-21
📖 6 분 읽기🧠 심층 분석

원저자: Mengting Ai, Tianxin Wei, Sirui Chen, Jingrui He

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 어떤 질문에도 답하고, 농담을 던지거나 코드를 작성할 수 있는, 엄청나게 똑똑하고 거대한 도서관이 있다고 상상해 보세요. 이 도서관은 너무나 방대해서 그 불을 밝히는 데만도 컴퓨터 한 대의 창고 전체가 필요할 정도입니다. 인공지능의 세계에서 이것들은 거대 언어 모델(LLM)이라고 불립니다. 이들은 마치 슈퍼 브레인과 같지만, 너무 무겁고 전기를 많이 잡아먹어서 오직 거대 기술 기업들만이 이를 운영할 비용을 감당할 수 있습니다. 과학자들은 이 브레인을 읽고 이해하는 능력을 잃지 않으면서도, 마치 백과사전을 주머니 속 수첩에 담아 넣는 것처럼 크기를 줄이는 방법을 연구해 왔습니다.

이를 위해 연구자들은 "프루닝(pruning, 가지치기)"이라는 기법을 사용합니다. 겨울철의 나무를 생각해 보세요. 봄에 더 잘 생존하고 빠르게 자랄 수 있도록, 정원사는 죽었거나 불필요한 가지를 잘라냅니다. AI에서 프루닝이란 모델에서 별로 하는 일이 없는 부분들을 잘라내는 것을 의미합니다. 여기에는 두 가지 주요 방법이 있습니다. 모델 곳곳에 흩어진 아주 작은 실(가중치)들을 하나하나 자를 수도 있는데, 이는 나무를 지저분하게 만들고 실제로 컴퓨터에서 실행 속도를 높여주지는 않습니다. 또는 아예 가지 전체(뉴런이나 어텐션 헤드)를 통째로 쳐낼 수도 있는데, 이는 나무의 형태를 깔끔하게 유지하며 훨씬 더 빠르게 작동하게 만듭니다. 문제는 너무 많은 가지를 쳐내면 나무가 성장을 멈추거나 제대로 말하는 법을 잊어버린다는 것입니다. 나무는 다시 배우기 위해 많은 비용이 드는 "회복 훈련"이 필요하며, 그렇게 하더라도 여전히 다소 서툴 수 있습니다.

여기서 NIRVANA라는 새로운 방법이 등장합니다. 이 연구진은 단순히 어떤 가지를 자를지 추측하는 것이 아니라, 나무가 어떻게 생각하는지를 실제로 이해하는 프루닝 전략을 만들고자 했습니다. 그들은 단순히 가지가 얼마나 "강한지"(가중치)를 보는 것만으로는 충분하지 않다는 것을 깨달았습니다. 대신, 그들은 **뉴럴 탄젠트 커널(Neural Tangent Kernel, NTK)**이라는 수학적 개념을 사용했습니다. NTK를 나무의 "성장 잠재력"을 보여주는 지도라고 생각하면 됩니다. 이는 단순히 가지가 얼마나 큰지를 보여주는 것이 아니라, 모델의 미래 학습이 해당 부분에 얼마나 의존하는지를 보여줍니다. NIRVANA는 이 지도를 사용하여 어떤 가지를 잘라야 나무가 건강을 유지하고, 기억력을 보존하며, 절단 직후에도 즉시 새로운 것을 배울 준비가 될 수 있는지 정확히 파악합니다.

핵심 아이디어: AI 나무를 위한 스마트한 정원사

이 논문은 거대 AI 모델을 스마트하고 하드웨어 친화적인 방식으로 줄이는 새로운 방법인 NIRVANA(NTK-InfoRmed adaptiVe neuron & AttentioN heAd pruning의 약자)를 소개합니다. 저자들은 기존 방식들이 나무의 전반적인 건강 상태를 살피지 않고 그저 가장 큰 가지를 잘라내는 정원사와 같다고 주장합니다. 이는 종종 나무를 무너뜨리거나 수학이나 코딩 같은 복잡한 작업을 수행하는 능력을 상실하게 만듭니다.

NIRVANA는 특별한 "성장 지도"(NTK)를 사용하는 숙련된 식물학자처럼 행동함으로써 판도를 바꿉니다. 작동 방식은 다음과 같습니다.

1. "성장 지도" (NTK 기반 살리언시)
단순히 "이 가중치가 큰가?"라고 묻는 대신, NIRVANA는 "이것을 자르면 나무의 학습 능력이 얼마나 변할까?"라고 묻습니다. 그들은 NTK에서 영감을 받은 1차 함수 공간 살리언시 점수를 사용합니다. 쉽게 말해, 이것은 특정 부분이 모델의 출력값 향후 미세 조정(새로운 작업에 대한 학습) 능력에 얼마나 기여하는지를 측정합니다.

  • 비유: 밴드가 노래를 연주하고 있다고 상み해 보세요. 어떤 악기들은 소리가 크지만, 그것을 음소거해도 노래는 괜찮을 수 있습니다. 반면 어떤 악기들은 조용하지만, 그것을 음소거하면 노래 전체가 무너질 수 있습니다. NIRVANA는 "노래"(모델의 출력)와 "악보"(학습 역학)를 모두 들어봄으로써, 단순히 소리가 가장 큰 악기가 아니라 진정으로 필수적인 악기가 무엇인지 찾아냅니다.

2. 잎사귀가 아닌 가지 전체를 자르기 (구조적 프루닝)
오래된 많은 방법들은 모델 곳곳에 흩어진 개별적인 실(가중치)을 자르려고 시도합니다. 이는 나무의 모든 잎에서 아주 작은 조각들을 잘라내는 것과 같습니다. 이렇게 하면 나무는 가벼워지지만, 컷팅이 지저 nes하기 때문에 컴퓨터 하드웨어(정돈된 행 단위로 처리하도록 설계된)가 모델을 더 빠르게 실행할 수 없습니다.
NIRVANA는 한 번에 전체 "가지"를 자릅니다. AI 모델에서 이러한 가지는 어텐션 헤드(모델이 중요한 단어에 집중하도록 돕는 역할) 또는 MLP 뉴런(모델이 사실과 논리를 저장하도록 돕는 역할)입니다. 전체 단위를 제거함으로써 모델은 더 작아지고 표준 컴퓨터에서 훨씬 더 빠르게 실행됩니다.

3. 완벽한 균형 (적응형 희소성)
여기에는 까다로운 부분이 있습니다. 모든 가지가 다 같은 것은 아닙니다. 어떤 부분(MLP 뉴런 등)은 사실을 저장하는 데 뛰어나고, 다른 부분(어텐션 헤드 등)은 문맥을 이해하는 데 뛰어납니다. 만약 한 종류를 너무 많이 자르면 모델은 특정 기술을 잃게 됩니다.
NIRVANA는 최적의 비율을 결정하기 위해 특별한 공식 γ\gamma(감마)를 사용합니다. 이를 통해 "사실 저장" 부분과 "집중" 부분 중 어디를 얼마나 자를지 결정합니다.

  • 발견: 논문은 테스트한 모델들(Llama3.1-8B 등)에 대해, 균형을 유지하려면 어텐션 헤드보다 MLP 뉴런에서 약 3.36배 더 많이 잘라내야 한다고 제안합니다. 이는 무작위 추측이 아니라, 수학적으로 도출되었으며 동일하게 자르는 것보다 더 효과적임이 증명되었습니다.

4. 적절한 "테스트 질문" 선택 (KL-Divergence 데이터 선택)
어떤 가지를 자를지 알기 위해서는 나무를 테스트할 과정이 필요합니다. 여기에는 작은 규모의 데이터(교정 데이터)가 필요합니다. 기존 방식들은 흔히 무작위 텍스트를 가져와 테스트했습니다. 저자들은 프루닝 시 모델의 출력 변화를 측정하는 KL 발산(두 대상의 차이를 측정하는 방법)을 통해 최적의 테스트 데이터를 선택하는 방법을 도입했습니다.
그들은 여러 작은 텍-배치를 테스트하여 프루닝 시 모델의 출력에 가장 적은 변화를 일으키는 데이터를 찾았습니다.

  • 결과: 그들은 단 32개의 예시(길이 128 토큰)만으로도 충분하다는 것을 발견했습니다. 놀랍게도 "최적의" 데이터가 항상 인간이 보기에 일관되거나 사실적으로 정확한 텍스트는 아니었습니다. 때로는 이상하거나 일관성 없는 텍스트가 프루닝에 더 효과적이었는데, 이는 데이터의 인간 중심적 품질보다 통계적 패턴이 더 중요하다는 것을 시사합니다.

무엇을 발견했는가 (그리고 발견하지 못한 것)

연구진은 Llama3.1-8B, Llama3.2-3B, Qwen2.5, T5를 포함한 여러 유명 AI 모델에 대해 NIRVANA를 테스트했습니다. 그들은 LLM-Pruner, SliceGPT, FLAP과 같은 다른 최고 수준의 프루닝 방법들과 비교했습니다.

긍정적인 소식:

  • 더 나은 성능: 동일한 수준의 축소(희소성) 단계에서, NIRVANA는 수학, 코딩 및 일반 지식 테스트에서 일관되게 더 높은 점수를 기록했습니다. 예를 들어, 코드 생성 테스트(MBPP)에서 다른 방법들이 20% 희소성에서 성능이 거의 0에 가깝게 떨어질 때, NIRVANA는 23.80의 점수를 유지하며 다음으로 좋은 방법(4.40 기록)을 크게 앞질렀습니다.
  • 빠른 회복: LoRA라는 경량화된 방법을 사용하여 프루닝된 모델을 "재학습"했을 때, NIRVA는 다른 방법들보다 훨씬 빠르고 효과적으로 기술을 회복했습니다. 이는 프루닝이 모델의 학습 능력을 망가뜨리지 않았음을 시사합니다.
  • 실제 속도: 전체 가지를 자르고 남은 크기를 컴퓨터 칩이 빠르게 작동할 수 있도록 8의 배수로 맞추었기 때문에, NIRVANA는 실제로 모델을 더 빠르게 실행했습니다. NVIDIA A100 칩에서, 단순히 수학 연산만 줄이고 하드웨어 속도는 높이지 못한 다른 방법들과 달리, NIRVANA는 텍스트 생성 시간(지연 시간)을 크게 단축했습니다.

한계점:

  • 높은 희소성은 어렵다: 모든 프루닝 방법과 마찬가지로, 너무 많이 자르면(예: 50% 이상) 모델의 성능은 떨어집니다. 논문은 매우 높은 압축률에서는 모델이 완전히 회복하기 위해 더 광범위한 재학습이 필요할 수 있음을 인정합니다.
  • One-Shot vs. Iterative: NIRVANA는 한 번에 컷을 결정하는 "원샷(one-shot)" 방식입니다. 일부 다른 방법들은 최적의 컷을 찾기 위해 몇 시간 동안 시행착오(반복 탐색)를 거칩니다. NIRVANA는 훨씬 빠르지만(프루닝에 2초 미만 소요), 반복적인 방법들이 며칠을 기다린다면 조금 더 나은 컷을 찾아낼 수도 있다는 점을 논문은 언급합니다.

이것이 왜 중요한가

이 논문은 NIRVANA가 AI를 더 작게 만드는 "이론적으로 타당하고 실용적인 접근 방식"을 제공한다고 제안합니다. 이 방식은 모델이 어떻게 학습하는지를 존중하면서 자르는 방식을 통해, 모델이 너무 커져서 일반 컴퓨터에서 돌리기 힘든 문제를 해결합니다. "성장 지도"(NTK)를 사용하고 컷을 신중하게 조절함으로써, AI가 똑똑함과 속도를 유지하면서도 거대한 창고급 컴퓨터 없이도 작동할 수 있게 합니다.

요약하자면, NIRVANA는 AI를 줄이는 더 스마트한 방법입니다. 단순히 모델을 난도질하는 것이 아니라, AI가 건강을 유지하고, 빠르게 배우며, 우리가 가진 기기에서 빠르게 실행될 수 있도록 세심하게 다듬습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →