← 최신 논문
💬 NLP

PALS: Percentile-Aware Layerwise Sparsity for LLM Pruning

이 논문은 활성화 크기에 따라 트랜스포머 레이어 전반의 희소성 비율을 동적으로 조정하여 LLaMA-2-7B에 대해 균등 프루닝(uniform pruning) 대비 유의미한 퍼플렉시티(perplexity) 향상을 달ach하는 원샷 프루닝 방법인 PALS를 제안하며, 동시에 그래디언트 기반 할당이 이산적 가중치 제거에는 효과적이지 않다는 점을 입증한다.

원저자: Yazdan Jamshidi, Alexey Shvets

게시일 2026-07-09
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yazdan Jamshidi, Alexey Shvets

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 수십억 권의 책(파라미터)을 가진 거대하고 믿을 수 없을 정도로 똑똑한 도서관(거대 언어 모델)이 있다고 상상해 보세요. 이 도서관을 당신의 휴대폰에 담을 수 있도록 작은 배낭 크기로 줄이려면, 책의 절반을 버려야 합니다. 이것을 "프루닝(pruning, 가지치기)"이라고 부릅니다.

문제는 모든 책이 똑같이 중요한 것은 아니라는 점입니다. 어떤 책은 그저 채우기용일 뿐이지만, 어떤 책은 세상을 이해하는 데 가장 결정적인 지도와 열쇠를 담고 있습니다.

기존 방식: "일률적인(One-Size-Fits-All)" 접근법

이전의 방법들(Wanda나 SparseGPT 같은)은 엄격한 사서와 같았습니다. 그들은 이렇게 말합니다: "우리는 책의 50%를 줄여야 합니다. 그러니 내용이 무엇이든 상관없이 모든 선반에서 정확히 절반의 책을 버리겠습니다."

저자들은 이것이 어리석은 일이라고 주장합니다. 어떤 선반(레이어)은 매우 중요하고 독특한 정보로 가득 차 있는 반면, 어떤 선반은 반복적인 메모들로 가득 차 있습니다. 만약 중요한 선반에서 50%를 잘라낸다면 도서관은 의미를 잃게 됩니다. 하지만 반복적인 선반에서 50%를 잘라낸다면 아무도 눈치채지 못할 것입니다.

새로운 방식: PALS (스마트한 사서)

저자들은 PALS(Percentile-Aware Layerwise Sparsity)라는 새로운 방법을 제안합니다. 모든 선반에서 동일한 양을 자르는 대신, PALS는 먼저 선반을 살펴보는 스마트한 사서처럼 행동합니다.

작동 방식:

  1. "아웃라이어(Outlier)" 확인: 사서는 각 선반의 책들을 살펴보며 묻습니다. "여기에 아주 다르거나 유난히 크게 소리 지르는 책이 있는가?" 기술적인 용어로, 그들은 활성화 아웃라이어(activation outliers), 즉 특정 부분이 매우 "흥분"하거나 활발하게 움직이는 순간들을 찾아냅니다.
  2. 규칙:
    • 만약 어떤 선반에 이러한 "크게 소리 지르거나 흥분한" 순간들이 있다면, 그 선반은 중요한 일을 하고 있다는 뜻입니다. 여기서는 많이 자르지 마세요. 책을 더 많이 남겨두어야 합니다.
    • 만약 선반이 조용하고 균일하다면, 그것은 아마도 반복적인 일을 하고 있다는 뜻일 것입니다. 여기서는 더 많이 자르세요. 더 많은 책을 버리세요.
  3. 안전장치: 너무 무모해지지 않도록 사서는 규칙을 정합니다: "자르는 양을 아주 조금(플러스 또는 마이너스 5%)만 변경할 수 있습니다." 이는 실수로 중요한 선반을 텅 비게 만들거나, 쓸모없는 선반을 완전히 가득 채워두는 것을 방지하기 위함입니다.

거대한 놀라움: "그래디언트(Gradient)"의 함정

"소리의 크기"를 기준으로 삼기 전에, 연구진들은 다른 아이디어를 시도했습니다. 그들은 생각했습니다. "혹시 **그래디언트(gradients)**를 살펴보면 어떨까?"

AI의 세계에서 "그래디언트"는 책을 어떻게 미세하게 조정해야 더 나아질지를 보여주는 지도와 같습니다. 보통 이것은 무엇을 남길지 결정하는 매우 똑똑한 방법입니다.

하지만 충격적인 사실은 이렇습니다: 연구진이 무엇을 자를지 결정하기 위해 그래디언트를 사용했을 때, 도서관은 무너져 내렸습니다. 결과는 그냥 무작위로 책을 던져 버렸을 때보다도 나빴습니다.

왜 그럴까요? 저자들은 그래디언트가 아주 작은 발걸음을 떼기 위한 지도라고 추측합니다. 하지만 프루닝은 거대하고 대폭적인 발걸음(책의 50%를 한꺼번에 제거하는 것)과 같습니다. 작은 발걸음을 위한 지도가 무엇을 제거할 때 발생하는 상황까지 알려주지는 않습니다. 마치 언덕의 경사가 어느 방향인지 아는 것이, 산의 절반을 불도저로 밀어버렸을 때 어떤 일이 벌어질지를 알려주지는 않는 것과 같습니다.

결과

  • 이전 모델들에서 (LLaMA-2): "스마트한 사서"(PALS)는 환상적인 성과를 냈습니다. 도서관은 크기가 절반으로 줄어들었지만, 원래 버전만큼이나 언어를 거의 그대로 이해할 수 있었습니다. 이는 "일률적인" 방식보다 훨씬 더 똑똑했습니다.
  • 최신 모델들에서 (Mistral, LLaMA-3): "스마트한 사서"는 별다른 도움이 되지 않았습니다. 저자들은 이것이 이 최신 모델들이 이미 너무 잘 훈련되어 있어서 모든 선반이 똑같이 중요하다는 점 때문이라고 생각합니다. 더 많이 자를 수 있는 "중복된" 선반이 없기 때문에, 스마트한 전략이 이점을 찾을 수 없는 것입니다.

핵심 요약

PALS는 AI 모델의 지능을 잃지 않으면서 모델을 더 작게 만드는 간단하고 저렴한 기술입니다. 이 방법은 모델의 어떤 부분이 "소리를 지르고 있는지"(높은 활성도)를 듣고 그 부분을 보호하는 동시에, 조용한 부분은 다듬는 방식으로 작동합니다.

또한 이는 우리에게 귀중한 교훈을 줍니다: 그래디언트와 같은 방법이 미세한 조정에는 효과적일지라도, 그것이 큰 폭의 절단에는 반드시 효과적이라는 보장은 없습니다. 때로는 가장 복잡한 수학보다 가장 단순한 신호(현재 얼마나 활발한지를 보는 것)가 더 나을 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →