← 최신 논문
🤖 machine learning

Locality-Aware Redundancy Pruning for LLM Depth Compression

본 논문은 대규모 언어 모델의 성능을 유지하면서 중복성을 효과적으로 줄이기 위해 새로운 표현 국소성 점수에 기반하여 계층 제거를 동적으로 할당하는 훈련 불필요한 원샷 깊이 가지치기 프레임워크인 LoRP를 제안합니다.

원저자: Vincent-Daniel Yun, Youngrae Kim, Woosang Lim, YoungJin Heo, Minkyu Kim, Sunwoo Lee

게시일 2026-05-28
📖 3 분 읽기☕ 가벼운 읽기

원저자: Vincent-Daniel Yun, Youngrae Kim, Woosang Lim, YoungJin Heo, Minkyu Kim, Sunwoo Lee

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 방대하고 놀라울 정도로 깊은 지식의 도서관 (대형 언어 모델) 이 있다고 상상해 보세요. 이 도서관에는 수백 개의 층 (레이어) 이 있으며, 각 층에는 정보를 처리하는 도움을 주는 사서들 (뉴런) 팀이 있습니다. 문제는 이 도서관이 너무 크고, 운영 비용이 많이 들며, 탐색이 느리다는 것입니다. 당신은 속도를 높이기 위해 몇몇 층을 제거하고 싶지만, 잘못된 층을 제거하면 도서관이 더 이상 의미를 잃을 것이라고 두려워합니다.

이 논문은 LoRP(Locality-Aware Redundancy Pruning, 지역성 인식 중복 제거) 라는, 어떤 층을 철거할지 결정하는 새로운 방법을 소개합니다. 이것이 어떻게 작동하는지 간단히 설명해 드리겠습니다:

구식 방법: 추측과 확인

이전에는 이러한 도서관을 축소하기 위해 두 가지 주요 전략을 사용했습니다:

  1. "지역적" 접근법: 그들은 각 층을 개별적으로 살펴보며 "이 층은 약해 보이니 제거하자"라고 말했습니다. 그들은 모든 층이 고유하고 독립적이라고 가정했습니다.
  2. "연속적" 접근법: 그들은 중복성 (불필요한 반복) 이 10 층부터 15 층까지와 같은 특정 층 블록에서만 발생한다고 가정했습니다. 따라서 그들은 그 전체 덩어리를 잘라내었습니다.

문제점: 저자들은 서로 다른 도서관 (AI 모델) 이 서로 다른 "아키텍처"를 가지고 있음을 발견했습니다. 어떤 도서관에서는 불필요하고 쓸모없는 작업이 하나의 특정 블록에 집중되어 있는 반면, 다른 도서관에서는 불필요한 작업이 건물 전체에 고르게 퍼져 있습니다. 구식 방법들은 "만능" 규칙을 사용했는데, 이는 종종 중요한 층을 잘라내거나 쓸모없는 층을 남겨두는 결과를 초래했습니다.

새로운 방법: LoRP (스마트 건축가)

LoRP 는 어떤 절단도 하기 전에 층들이 실제로 어떻게 서로 관련되어 있는지 확인하기 위해 도서관을 돌아다니는 스마트 건축가와 같습니다. 이 도서관을 다시 훈련시킬 필요가 없습니다 (훈련 불필요); 사서들이 서로 어떻게 대화하는지 관찰하기만 하면 됩니다.

다음은 단계별 과정입니다:

1. "메아리" 테스트 (유사성 측정)

건축가는 몇 가지 샘플 문장을 도서관으로 보내고 층마다 "숨겨진 생각" (표상) 이 어떻게 변하는지 듣습니다.

  • 만약 5 층과 6 층이 거의 똑같은 말을 하고 있다면, 그들은 중복입니다.
  • 만약 5 층이 6 층과 완전히 다른 말을 하고 있다면, 그들은 고유합니다.

2. "지역성 점수" (RLS)

건축가는 표상 지역성 점수 (Representation Locality Score, RLS) 라는 점수를 계산합니다. 이를 "뭉침계"로 생각하세요:

  • 높은 점수 (뭉쳐 있음): 도서관에 "메아리 방"이 있습니다. 10 층부터 20 층까지 모두 같은 아이디어를 반복하고 있습니다. 중복성은 지역화되어 있습니다.
  • 낮은 점수 (퍼져 있음): 도서관에는 "확산된 메아리"가 있습니다. 반복은 지하실부터 지붕까지 건물 전체에 흩어져 있습니다. 중복성은 전역적으로 분포되어 있습니다.

3. 층 그룹화 (클러스터링)

그 점수에 따라 건축가는 층들을 유사한 사고를 가진 "이웃" (클러스터) 로 그룹화합니다.

  • 도서관이 "뭉쳐 있다면", 이웃은 동일한 층들의 빽빽한 그룹입니다.
  • 도서관이 "퍼져 있다면", 이웃은 더 다양합니다.

4. 2 단계 절단 (프루닝)

이제 건축가는 두 단계 전략을 사용하여 어떤 층을 제거할지 결정합니다:

  • 1 단계 (커버리지): 먼저, 그들은 모든 이웃에서 하나의 층을 제거하도록 합니다. 이렇게 하면 실수로 고유한 이웃 전체를 지워버리는 것을 방지할 수 있습니다.
  • 2 단계 (정리): 그런 다음, 그들은 각 이웃에 남아 있는 층들을 살펴봅니다. 목표 크기에 도달할 때까지 가장 "중복된" (가장 반복적인) 층들을 계속 제거합니다.

왜 더 잘 작동하는가

이 논문은 LLaMA, Mistral, Qwen 등 여러 다른 유형의 AI 모델에서 이를 테스트했습니다.

  • "뭉쳐 있는" 모델의 경우: LoRP 는 특정 영역에서 큰 층 덩어리를 안전하게 제거할 수 있음을 정확히 파악했습니다.
  • "퍼져 있는" 모델의 경우: LoRP 는 큰 블록을 잘라내는 대신 여러 다른 영역에서 조금씩 가져와야 함을 정확히 깨달았습니다.

결과:
LoRP 는 도서관의 특정 모양에 적응하기 때문에, 구식 "만능" 방법들보다 AI 를 더 똑똑하고 정확하게 유지합니다. 상당한 수의 층을 제거한 후에도 질문을 답변하고 언어를 이해하는 도서관의 능력을 훨씬 더 잘 보존합니다.

한 마디로 요약하자면

이를 영화 편집과 같다고 생각하세요.

  • 구식 방법은 영화가 특정 방식으로 반복된다고 가정하고 맹목적으로 10 번째 장면을 잘라내거나 5 분짜리 블록 전체를 잘라내는 것과 같습니다.
  • LoRP는 영화 전체를 먼저 보고, 대사가 정확히 어디에서 반복되는지 파악한 후, 영화가 원래 어떻게 구조화되었든 간에 이야기 흐름을 유지하면서 특정 중복된 대사를 잘라내는 감독과 같습니다.

이 논문은 AI 에서 정보가 어디에서 그리고 어떻게 반복되는지를 이해하는 것이 이를 깨뜨리지 않고 효율적으로 축소하는 열쇠라고 결론지었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →