← 최신 논문
💻 computer science

LLMs can Compress LLMs: Adaptive Pruning by Agents

이 논문은 파운데이션 모델이 민감도 프로필과 자기 성찰을 사용하여 레이어별 희소성 비율을 적응적으로 결정하는 에이전트 유도형 프루닝 프레임워크를 소개하며, 이는 재학습 없이도 기존 방식 대비 사실적 지식 유지 및 퍼플렉시티 측면에서 상당한 개선을 달성한다.

원저자: Sai Varun Kodathala, Rakesh Vunnam

게시일 2026-01-15
📖 3 분 읽기☕ 가벼운 읽기

원저자: Sai Varun Kodathala, Rakesh Vunnam

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

문제점: 너무 무거운 무게

당신에게 아주 거대하고 똑똑한 도서관(거대 언어 모델, 즉 LLM)이 있다고 상상해 보세요. 이 도서관은 거의 모든 것을 알고 있지만, 규모가 너무 커서 창고 하나를 통째로 차지하며 이를 옮기기 위해 트럭 부대가 필요합니다. 당신은 이 도서관을 일반 컴퓨터에서도 실행할 수 있도록 배낭 안에 들어갈 정도로 줄이고 싶지만, 단순히 무작위로 책을 버릴 수는 없습니다. 만약 그렇게 한다면, 도서관이 시간을 읽는 법을 잊어버리거나 역사에 관한 간단한 질문에 답하는 능력을 잃어버릴 수도 있기 때문입니다.

이러한 도서관을 줄이기 위한 기존 방식들은 마치 쿠키 커터를 사용하는 것과 같습니다. 그들은 어떤 선반이 중요한 역사책을 담고 있는지, 아니면 그저 오래된 카탈로그를 담고 있는지와 상관없이 모든 선반에서 동일한 양의 "내용물"을 잘라냅니다. 이는 종종 크기는 작아졌지만 가장 중요한 지식은 잃어버린 도서관을 만드는 결과를 초래합니다.

해결책: 스마트한 사서 에이전트

이 논문의 저자들은 이러한 모델을 줄이는 새로운 방법을 제안합니다. 이들은 쿠키 커터를 사용하는 대신, 정확히 무엇을 버릴지 결정하는 **스마트한 사서(AI 에이전트)**를 사용합니다.

이들의 "에이전트 유도 프루닝(Agent-Guided Pruning)"이 작동하는 방식은 다음과 같습니다.

1. 검사 (민감도 프로파일링)

사서가 물건을 버리기 시작하기 전에, 사서는 모든 선반을 상세히 검사합니다. 사서는 두 가지를 살펴봅니다:

  • 책이 얼마나 자주 사용되는가: (가중치-활성화 지표).
  • 그 책을 제거했을 때 도서관의 "목소리"가 얼마나 변하는가: (그래디언트 중요도).

그들은 이러한 관찰 내용을 간단한 점수(z-score)로 변환합니다. 낮은 점수는 "이 책은 거의 사용되지 않으며 없어도 티가 나지 않을 것"임을 의미합니다. 높은 점수는 "이 책은 매우 중요하므로 절대 건드리지 마시오"를 의미합니다.

2. 의사 결정자 (LLM 에이전트)

이 부분이 마법 같은 부분입니다. 단순한 컴퓨터 프로그램이 "모든 선반에서 10%를 잘라내라"와 같은 규칙을 맹목적으로 따르는 대신, 두 번째 AI(에이전트)가 점수를 살펴봅니다.

  • 에이전트는 전략적인 편집자처럼 행동합니다. 에이전트는 검사 보고서를 읽고 이렇게 말합니다. "좋아, 역사 섹션은 매우 민감하니 가장자리만 조금 다듬자. 하지만 '잡학 사전' 섹션은 탄탄하니까 거기서 많이 잘라내도 되겠어."
  • 에이전트는 반복적으로 이러한 결정을 내립니다. 즉, 조금 자르고, 결과를 확인하고, 다음에 무엇을 자를지 결정합니다.

3. 안전망 (자기 성찰 및 롤백)

에이전트도 완벽하지는 않습니다. 때때로 너무 욕심을 부려 너무 많이 잘라내는 바람에 도서관의 "목소리"가 웅얼거리는 것처럼 들릴 수도 있습니다(모델이 얼마나 혼란스러운지를 나타내는 척도인 "퍼플렉시티(perplexity)"의 급증).

  • 안전망: 시스템은 매 절단 작업 전에 체크포인트를 저장합니다. 만약 도서관이 너무 혼란스러워 보이면, 시스템은 즉시 마지막으로 상태가 좋았던 버전으로 되돌아갑니다(롤백).
  • 자기 성찰: 에이전트는 "당신은 실수했습니다. 너무 많이 잘라냈어요"라는 피드백을 받습니다. 에이전트는 이 피드백으로부터 학습하여 다음 라운드의 전략을 조정하고, 더 신중해집니다.

결과: 더 작고 똑똑한 도서관

연구진은 이 방법을 Qwen3 모델의 두 가지 버전(40억 및 80억 파라미터)에 테스트했습니다. 그들은 모델을 약 45% 줄이고자 했습니다(원래 크기의 절반 미만으로 만들기).

기존의 "쿠키 커터" 방식과 비교했을 때 다음과 같은 결과가 나타났습니다:

  • 일반 지식 (MMLU): 기존 방식은 모델이 일반적인 질문에 답하는 법을 잊게 만들었습니다. 새로운 에이전트 유도 방식은 모델이 기존의 가장 좋은 방식보다 56% 더 높은 정확도를 유지하도록 했습니다.
  • 사실적 기억 (FreebaseQA): 이것이 가장 큰 승리였습니다. 기존 방식은 모델이 대통령이 누구인지와 같은 사실적 기억을 거의 모두 잃게 만들었습니다. 새로운 방식은 기존 방식보다 19배 더 많은 사실적 지식을 유지했습니다.
  • 혼란 수준 (Perplexity): 새로운 방식은 기존 방식보다 모델이 훨씬 덜 혼란스럽게 유지했습니다.

핵심 요약

이 논문은 한 AI가 다른 AI에게 어떻게 스스로를 줄여나갈 수 있는지 효과적으로 가르칠 수 있음을 보여줍니다.

무작위로 또는 균일하게 잘라내는 대신, 어떤 부분의 뇌를 제거할지 결정하기 위해 스마트하고 자기 성찰적인 에이전트를 사용함으로써, 그들은 사실을 기억하고 질문에 올바르게 답할 수 있는 훨씬 작은 모델을 만들 수 있었습니다. 에이전트는 모델을 작게 만들면서도 똑똑함을 유지하는 완벽한 균형을 찾기 위해 롤백 메커니즘을 통해 자신의 실수로부터 배웠습니다.

요약하자면: 그들은 책을 읽을 수 있는 상태를 유지하면서도 단지 더 작게 만들 수 있도록 어떤 페이지를 찢어낼지 정확히 아는 사려 깊은 편집자로 눈먼 쿠키 커터를 대체했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →