← 최신 논문
💬 NLP

From Local to Global: Revisiting Structured Pruning Paradigms for Large Language Models

본 논문은 1 차 손실 기반 중요도 점수를 집계하여 어텐션 헤드와 MLP 채널을 효율적으로 제거함으로써 고도 희소성 수준에서 정확도를 안정화하고 중간 미세 조정 없이 작업별 최적화를 가능하게 하여 기존 지역적 패러다임보다 우수한 성능을 보이는 GISP 라는 전역 반복적 구조 가지치기 방법을 소개합니다.

원저자: Ziyan Wang, Enmao Diao, Qi Le, Pu Wang, Minwoo Lee, Shu-ping Yeh, Evgeny Stupachenko, Hao Feng, Li Yang

게시일 2026-04-29
📖 4 분 읽기☕ 가벼운 읽기

원저자: Ziyan Wang, Enmao Diao, Qi Le, Pu Wang, Minwoo Lee, Shu-ping Yeh, Evgeny Stupachenko, Hao Feng, Li Yang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 수십억 권의 책으로 가득 찬 거대하고 지극히 똑똑한 도서관 (대규모 언어 모델) 이 있다고 가정해 봅시다. 이 도서관은 거의 모든 것을 알고 있지만, 너무 거대해서 특정 사실을 찾는 데는 영원히 걸릴 뿐만 아니라, 이를 저장하려면 거대하고 비싼 건물이 필요합니다. 당신은 이 도서관을 질문을 정확하게 답할 수 있는 능력을 잃지 않은 채 배낭에 들어갈 정도로 축소하고 싶습니다.

이 논문이 다루는 문제가 바로 이것입니다. 저자들은 GISP(Global Iterative Structured Pruning, 전역 반복적 구조 가지치기) 라는 새로운 방법을 소개합니다. 이것이 어떻게 작동하는지 간단한 비유로 설명해 보겠습니다.

문제: "국소적" 접근법 vs "전역적" 관점

옛 방법 (국소적 가지치기):
각 방을 하나씩 살펴보며 도서관을 축소하려고 한다고 상상해 보세요. 당신은 "이 방에는 책이 너무 많다; 20% 를 버리자"라고 결정합니다. 그리고 각 방을 독립적으로 이렇게 처리합니다.

  • 결함: 당신은 "역사" 방에서 locally(국소적으로) 쓸모없어 보이는 책을 버릴 수 있지만, 그 책이 나중에 복잡한 이야기를 이해하는 열쇠가 될 수 있습니다. 한 번에 한 방만 보기 때문에 전체 그림을 놓치게 됩니다. 결과적으로 여전히 "무겁게" 느껴지는 도서관이 되어, 일반적인 테스트에서는 괜찮아 보일지라도 수학 문제를 풀거나 까다로운 수수께끼를 답하는 것과 같은 특정 작업에 어려움을 겪게 됩니다.

새 방법 (GISP - 전역 반복적 가지치기):
방을 하나씩 보는 대신, 저자들은 도서관 전체를 한 번에 바라보며 이렇게 묻는 것을 제안합니다. "이 특정 책을 제거하면, 이 도서관이 이 특정 질문에 답할 능력이 얼마나 손상될까?"

GISP 의 작동 원리: 세 가지 마법 단계

1. "원샷" 실수 (한 번에 모두 하려고 함)
만약 한 번에 책의 50% 를 제거하려고 한다면, 가장 중요한 책들을 실수로 버릴 수 있습니다. 하루에 50 파운드를 감량하려는 것과 같습니다; 당신은 완전히 무너질 것입니다. 논문은 이렇게 "한 번에" 하는 방식이 도서관을 붕괴시키고 의미를 잃게 만든다고 보여줍니다.

2. "반복적" 해결책 (천천히 다듬기)
GISP 는 작은 단계로 나아가며 이를 해결합니다. 조각상을 조각한다고 상상해 보세요. 거대한 돌 덩어리를 찍어내는 대신, 조금씩 조각을 떼어내고 모양을 확인한 뒤, 조금 더 떼어내고 다시 확인합니다.

  • 과정: GISP 는 모델의 아주 작은 부분을 제거한 후, 여전히 작동하는지 확인하고, 그다음 아주 작은 부분을 더 제거합니다. 이를 여러 번 반복합니다.
  • 이익: 이 방식은 모델이 축소되는 동안 "조정"할 수 있게 합니다. 매우 작은 크기 (높은 희소성) 에 도달하더라도 도서관이 붕괴되는 것을 방지합니다.

3. "중첩된" 도서관 (한 번 가지치기, 여러 번 배포)
이것은 교묘한 수입니다. GISP 는 책을 천천히 그리고 신중하게 제거하기 때문에, 과정의 모든 단계에서 작동하는 도서관이 만들어집니다.

  • 비유: 러시아 인형 세트를 가지고 있다고 상상해 보세요. 작은 인형, 중간 크기 인형, 큰 인형을 따로 만들 필요가 없습니다. 큰 인형 하나만 만들고 레이어를 벗겨내면 자연스럽게 그 안에 완벽한 작은 버전들이 드러납니다.
  • 결과: 당신은 "가지치기"라는 힘든 작업을 한 번만 수행하면 됩니다. 그 단일 과정으로부터 20% 더 작은 모델, 40% 더 작은 모델, 그리고 50% 더 작은 모델이라는 온 가족을 얻게 됩니다. 추가 작업 없이 배낭에 가장 잘 맞는 모델을 선택할 수 있습니다.

비밀 소스: 특정 작업을 위한 훈련

이 논문은 대부분의 옛 방법들이 "작업 무관적 (task-agnostic)"이라고 강조합니다. 그들은 도서관이 일반적으로 모든 것에 좋게 유지되도록 시도합니다. 하지만 만약 당신이 도서관이 의학 시험이나 수학에만 뛰어나기를 원한다면 어떨까요?

  • 옛 방법: 가지치기 방법은 "중요한 책"의 일반적인 목록을 살펴보고, 그 책들이 수학에 도움이 되는지 여부를 무시합니다.
  • GISP 방식: GISP 는 "우리는 수학 문제만 관심 있다"라고 지시받을 수 있습니다. 그런 다음 책을 살펴보며 "이 책은 수학에는 쓸모없지만, 이 책은 결정적으로 중요하다"라고 말합니다. 이는 당신이 관심 있는 특정 작업에 기반한 특별한 "점수"를 사용합니다.
  • 결과: 저자들이 이를 수학 및 추론 작업에 테스트했을 때, GISP 는 특히 모델이 크게 축소되었을 때 기존 방법들보다 모델을 훨씬 더 똑똑하게 유지했습니다.

평이한 영어로 된 결과

저자들은 Llama 와 Mistral 과 같은 유명한 여러 AI 모델에서 이를 테스트했습니다. 그들은 다음과 같은 사실을 발견했습니다:

  1. 더 잘 작동합니다: 높은 수준의 축소 (모델의 40~50% 제거) 에서 GISP 는 이전 최고 방법들보다 AI 를 훨씬 더 똑똑하게 유지했습니다.
  2. 유연합니다: 하나의 단일 가지치기 실행을 통해 다양한 크기의 모델 세트를 얻을 수 있습니다.
  3. 견고합니다: 가지치기 과정을 "가르치기" 위한 방대한 양의 데이터가 없더라도 여전히 잘 작동합니다.

요약

GISP를 마스터 정원사로 생각하세요. (옛 방식처럼) 무작위로 가지를 잘라내는 대신, 그들은 나무를 인치 단위로 신중하게 다듬습니다 (반복적). 그리고 나무가 여전히 열매를 맺을 수 있는지 (성능) 항상 확인합니다. 또한 그들은 당신이 원하는 특정 열매에 맞춰 가지치기를 조정합니다 (작업 특정적), 그리고 그들이 매우 신중하기 때문에, 무언가를 다시 심을 필요 없이 같은 원래 식물에서 작은 분재, 중간 크기의 나무, 또는 큰 나무를 모두 제공할 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →