← 최신 논문
💻 computer science

LEAP: Learnable End-to-End Adaptive Pruning of Large Language Models

이 논문은 대규모 언어 모델에서 계산적으로 다루기 쉬운 비구조적 희소성 학습을 가능하게 하기 위해 가중치별 베르누이-구분-시그모이드 완화 기법을 활용하는 학습 가능한 엔드투엔드 적응형 가지치기 방법인 LEAP 을 소개하며, 이는 고도 희소성 수준에서 제로샷 정확도 측면에서 기존 계층별 기준 방법들을 크게 능가합니다.

원저자: Mohammad Mozaffari, Younes Hourri, Mohammad Rastegari, Mahyar Najibi

게시일 2026-05-19
📖 4 분 읽기☕ 가벼운 읽기

원저자: Mohammad Mozaffari, Younes Hourri, Mohammad Rastegari, Mahyar Najibi

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 거의 모든 것을 알고 있는 거대하고 지극히 똑똑한 도서관 (대형 언어 모델) 이 있다고 가정해 봅시다. 하지만 이 도서관은 너무 커서 전체 창고를 차지하고, 가동하려면 거대한 발전소가 필요하며, 일반적인 컴퓨터에서 실제로 사용하기에는 너무 느립니다.

이를 해결하기 위해 책 (모델의 '가중치' 또는 연결) 의 50% 에서 60% 를 버려 더 작고 빠르게 만들고자 합니다. 목표는 책이 절반으로 줄어도 도서관이 똑똑함을 유지하는 것입니다.

이때 LEAP이라는 논문이 등장합니다. 그들이 어떻게 문제를 해결했는지 간단히 설명해 드리겠습니다.

문제: "선택지가 너무 많다"는 함정

오랜 기간 동안 과학자들은 두 가지 주요 전략을 사용하여 책을 제거해 왔습니다.

  1. 레이어별 접근법 (구식 방법): 한 번에 한 선반씩 보며 "이 책은 쓸모없어 보이니 버리자"라고 결정하는 사서라고 상상해 보세요. 그들은 다른 선반들과 상의하지 않고 모든 선반에 대해 이렇게 합니다.

    • 결함: 때로는 한 선반에서 쓸모없어 보이는 책이 실제로는 도서관 전체에 걸친 이야기에는 결정적으로 중요할 수 있습니다. 선반을 고립시켜 바라보는 이 방법은 실수로 중요한 연결고리를 버리게 만들어 도서관을 덜 똑똑하게 만듭니다.
  2. "패턴" 접근법 (새롭지만 고장 난 방법): 최근 일부 연구자들은 도서관 전체를 한 번에 보려고 시도했습니다. "어떤 책을 남겨야 할지 정확히 배워보자"라고 말입니다. 하지만 그들은 책을 작은 묶음 (예: 4 권씩) 으로 그룹화하고 "이 4 권 중 어떤 패턴을 남겨야 할까?"라고 물어보며 이를 시도했습니다.

    • 결함: 이는 작은 그룹에는 훌륭하게 작동합니다. 하지만 현대 AI 모델이 가진 4,000 권의 책 한 줄 전체에 대해 이를 시도해 보려면, 가능한 "패턴"의 수가 너무 커서 적어 놓을 수 없는 숫자가 됩니다. 이는 10 억 장의 로또 티켓에 대한 모든 가능한 번호 조합을 나열해 보려는 것과 같습니다. 컴퓨터가 마비되고 수학이 붕괴됩니다.

해결책: LEAP ("개별 투표" 시스템)

이 논문의 저자들, LEAP은 수학에 압도되지 않고 어떤 책을 남겨야 할지 투표할 새로운 방법이 필요하다는 것을 깨달았습니다.

"어떤 그룹 패턴을 남겨야 할까?" (거대한 그룹에는 불가능함) 라고 묻는 대신, 각각의 책 하나하나에 대해 훨씬 더 간단한 질문을 던졌습니다. "이 특정 책은 남아야 할까, 아니면 버려야 할까?"

  • 비유: 거대한 선거를 상상해 보세요. 각 유권자 (모델의 각 가중치) 가 작은 투표용지를 받습니다. 복잡한 "팀 전략"을 투표하는 대신, 단순히 "예" (유지) 또는 "아니오" (폐기) 로 투표합니다.
  • 마법 같은 트릭: 이를 작동시키기 위해 그들은 컴퓨터가 처음에는 부드럽게 투표를 "추측"하게 하고, 그다음 그 추측을 점점 더 단단하고 날카롭게 만들어 모든 투표를 명확한 "예" 또는 "아니오"로 만들 수 있게 해주는 수학적 트릭 ("Gumbel-sigmoid"라고 함) 을 사용했습니다.

그들이 어떻게 했는지 (레시피)

그들은 처음부터 시작하지 않았습니다. 그들은 현명한 시작점을 사용했습니다.

  1. 웜 스타트 (Warm Start): 그들은 먼저 빠르고 간단한 방법 (Wanda 라고 함) 을 사용하여 어떤 책이 쓸모없을 가능성이 있는지 대략적으로 파악했습니다. 컴퓨터가 맹목적으로 추측하지 않도록 이 결과를 "출발선"으로 사용했습니다.
  2. 학습: 그들은 컴퓨터가 소량의 텍스트 (보정 스트림) 를 읽으면서 "예/아니오" 투표를 조정하여 도서관의 지능을 높게 유지하는 최상의 투표 세트를 "학습"하도록 했습니다.
  3. 책 고정: 결정적으로 그들은 책 안의 글자 (모델 가중치) 를 변경하지 않았습니다. 그들은 어떤 책을 남겨야 할지라는 결정만 변경했습니다. 이는 도서관의 원래 "성격"과 지식을 작은 패키지에 그대로 유지하는 것입니다.

결과: 더 똑똑하고, 더 빠르고, 더 날렵함

그들은 작음에서 매우 큼까지 다양한 다섯 가지 유명한 AI 모델에 대해 이를 테스트하여 50% 와 60% 를 줄였습니다.

  • 점수판: 그들은 LEAP 을 기존 최상위 방법들과 비교했습니다.
  • 승리: LEAP 은 일관되게 더 좋았습니다. 평균적으로 이전 최상위 방법보다 모델의 정확도를 2.59 점 향상시켰습니다. 어떤 경우에는 향상 폭이 5.40 점에 이르기도 했습니다.
  • 속도: 그들은 이 작업을 위해 설계된 새로운 고속 컴퓨터 칩 (GPU) 과 완벽하게 호환되도록 모델을 축소했기 때문에, 결과적으로 생성된 모델은 지능을 잃지 않으면서 훨씬 더 빠르게 실행됩니다.

왜 이것이 중요한가

이전에는 거대한 AI 모델을 더 작고 빠르게 만들고 싶다면 다음 중 하나를 선택해야 했습니다.

  • 옵션 A: 정확도는 유지하되 크고 느리게 만들기.
  • 옵션 B: 작고 빠르게 만들되, 멍청하게 만들기.

LEAP은 두 마리 토끼를 다 잡을 수 있음을 보여줍니다. 이 방법은 거대한 AI 두뇌를 절반으로 줄이면서도 똑똑함을 유지할 수 있는 실용적인 방법을 제공하여, 슈퍼컴퓨터가 아닌 일반적인 컴퓨터에서 실행될 수 있게 합니다.

간단히 말해: LEAP 은 각 연결이 유지되어야 하는지 투표하게 함으로써 거대한 AI 모델을 편집하는 새로운, 더 똑똑한 방법이며, 그 결과 더 작고, 더 빠르고, 여전히 매우 지능적인 AI 가 됩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →