← 최신 논문
🤖 machine learning

SHAPE: Coalition-Aware Expert Pruning for Sparse Mixture-of-Experts LLMs

SHAPE는 레이어 내부의 전문가 협력을 협력 게임으로 모델링하여 샤플리 방식의 기여도를 통해 필수적인 협력적 부분 집합을 식별하고 유지함으로써, 추가 학습 없이 정확도를 유지하면서 메모리 점유율을 줄이는 Sparse Mixture-of-Experts LLM을 위한 태스크 중심의 전문가 프루닝 프레임워크이다.

원저자: Yuhao Zhang

게시일 2026-06-10
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yuhao Zhang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대하고 강력한 주방(대규모 언어 모델)을 상상해 보세요. 이 주방은 복잡한 요리를 만들어내도록 설계되었습니다. 대신, 한 명의 거대한 셰프가 모든 것을 다 하는 것이 아니라, 전문가 혼합(Mixture-of-Experts, MoE) 시스템을 사용합니다. 이것은 100명의 전문 수셰프(전문가)들로 구성된 팀이라고 생각하면 됩니다.

고객이 요리(프롬프트)를 주문하면, 헤드 웨이터(라우터)가 주문을 살펴보고 그 요리에 함께 작업할 상위 3명의 셰프를 뽑습니다. 이 주방의 마법은 매 순간 100명의 셰프가 모두 활동할 필요가 없다는 점입니다. 오직 그 순간에 필요한 특정 3명만을 사용합니다. 덕분에 이 주방은 매우 빠르고 효율적입니다.

문제점: "메모리 벽(The Memory Wall)"
비록 매 초마다 3명의 셰프만 요리를 하고 있더라도, 주방 주인은 100명의 셰프 모두가 옷을 갖춰 입고 즉시 투입될 수 있도록 대기시켜야 합니다. 왜냐하면 웨이터가 다음 주문을 위해 어떤 셰프라도 필요로 할 수 있기 때문입니다.

  • 문제: 100명의 셰프가 있는 주방이라면, 그들을 모두 수용할 수 있는 거대하고 비싼 방(GPU 메모리)이 필요합니다. 이 때문에 이러한 강력한 주방을 더 작고 저렴한 공간(예: 노트북 한 대나 작은 서버)에서 실행하는 것이 불가능해집니다.
  • 과거의 해결책: 이전의 시도들은 마치 매니저가 "이번 주에 요리를 많이 하지 않은 셰프들을 해고하자"라고 말하는 것과 같았습니다. 이는 결함이 있는 방식입니다. 어떤 셰프는 자주 요리하지 않을 수도 있지만, 특정 파트너와 함께 요리할 때 걸작을 만들어낼 수도 있기 때문입니다. 그들을 해고하는 것은 그 특별한 팀워크를 깨뜨립니다.

해결책: SHAPE (팀워크 탐정)
이 논문은 음식의 맛을 해치지 않으면서 주방을 축소하는 새로운 방법인 SHAPE를 소개합니다. 단순히 셰프가 얼마나 자주 호출되었는지를 세는 대신, SHAPE는 그들이 얼마나 잘 협력하는지를 살펴봅니다.

SHAPE가 작동하는 방식은 다음과 같습니다 (간단한 비유를 사용합니다):

  1. "게임" 관찰: SHAPE는 짧은 시간 동안 주방을 관찰합니다(작은 "보정 세트"를 사용하여). 단순히 누가 호출되는지만 보는 것이 아니라, 어떤 3명의 셰프 그룹이 함께 호출되는지, 그리고 그 그룹들이 얼마나 자주 성공하는지를 관찰합니다.
  2. "샤플리(Shapley)" 점수 (공정성): 3명의 셰프 그룹이 완벽한 요리를 만들어냈다고 가정해 봅시다. 각 셰프에게는 어느 정도의 공로가 돌아갈까요?
    • 만약 셰프 A는 혼자서는 훌륭하지만 셰프 B가 셰프 C 없이는 무용지물이라면, 단순한 횟수 계산은 이를 놓칠 수 있습니다.
    • SHAPE는 **샤플리 값(Shapley Value)**이라는 수학적 개념(공정성 계산기라고 생각하세요)을 사용합니다. SH-A는 이렇게 묻습니다: "이 특정 3인조에서 셰프 A를 제외한다면, 요리가 망가질까?"
    • 만약 요리가 망가진다면, 셰프 A는 그 팀에 필수적인 존재입니다. 비록 그가 가장 유명한 셰프가 아닐지라도 말입니다.
    • 만약 셰프 A 없이도 요리 맛이 그대로라면, 셰프 A는 **불필요(redundant)**한 존재입니다. 그러면 그를 내보낼 수 있습니다.
  3. "품질 커버리지" 규칙: SHAPE는 단순히 점수가 낮은 하위 20%의 셰프를 해고하는 것이 아닙니다. 그것은 주방의 모든 "층"(모델의 모든 레이어)이 가장 중요한 팀워크 조합을 커버할 수 있도록 충분한 셰프를 유지하도록 보장합니다. SHAPE는 "이분법(bisection)" 방법(스마트한 추측 게임)을 사용하여, 주방이 작아지면서도 99%의 동일한 요리를 완벽하게 만들어낼 수 있도록 적절한 셰프 수를 찾아냅니다.

결과
연구진은 세 가지 현대적인 "주방"(Qwen, GPT-OSS, DeepSeek)에서 이를 테스트했습니다.

  • 결과: 그들은 음식의 맛을 전혀 떨어뜨리지 않고도 **20%에서 40%**의 셰프를 해고(메모리 요구량 대폭 감소)할 수 있었습니다.
  • 성공 이유: 단순히 '바쁜' 셰프가 아니라 '팀워크'에 필수적인 셰프들을 남김으로써, 주방의 안정성을 유지했기 때문입니다.
  • 보너스: 많은 셰프를 해고했기 때문에, 주방을 실행하는 데 필요한 방(GPU 메모리)이 훨씬 작아졌으며, 이로 인해 이 강력한 모델들을 더 저렴한 하드웨어에서도 실행할 수 있게 되었습니다.

요약하자면
SHAPE는 승리하는 팀의 비밀스러운 접착제 역할을 하는 '조용한' 셰프를 해고하는 것이 나쁘다는 것을 깨달은 스마트한 매니저와 같습니다. 대신, 쉽게 대체 가능한 '시끄러운' 셰프들을 해고합니다. 이를 통해 작업의 질은 똑같이 유지하면서도 팀 규모와 사무실 공간을 줄일 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →