← 최신 논문
💻 computer science

Attribution-Guided and Coverage-Maximized Pruning for Structural MoE Compression

본 논문은 높은 압축률에서도 정확도를 유지하면서 메모리 점유율을 크게 줄이기 위해, 기여도 기반 근사를 통해 채널 점수 커버리지를 극대화함으로써 미세한 수준의 중복 제거를 달성하는 혼합 전문가(Mixture-of-Experts, MoE) 모델을 위한 구조적 프루닝 프레임워크를 제안한다.

원저자: Yifu Ding, Jiacheng Wang, Ge Yang, Yongcheng Jing, Jinyang Guo, Xianglong Liu, Dacheng Tao

게시일 2026-06-19
📖 4 분 읽기☕ 가벼운 읽기

원저자: Yifu Ding, Jiacheng Wang, Ge Yang, Yongcheng Jing, Jinyang Guo, Xianglong Liu, Dacheng Tao

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

개요: "너무 많은 요리사" 문제

거대한 고급 레스토랑(Mixture-of-Experts 또는 MoE AI 모델)을 상상해 보세요. 이 주방에는 모든 요리를 만드는 한 명의 거대한 셰프 대신, 수백 명의 전문 셰프(Experts)가 있습니다. 주문(텍스트 토큰)이 들어올 때마다 헤드 웨이터(Router)는 그 특정 요리를 위해 몇 명의 셰프만을 골라냅니다.

이 시스템은 매우 효율적입니다. 사용하는 셰프에 대해서만 비용을 지면 되기 때문입니다. 하지만 레스토랑 자체는 여전히 거대하고 운영 비용이 많이 들며, 한 번에 몇 명의 셰프만 활동하더라도 수백 명의 셰프를 고용하고 있기 때문에 많은 공간(메모리)을 차지합니다.

이 논문의 목표는 음식의 맛을 망치지 않으면서 주방의 규모를 줄이는 것입니다. 그들은 일부 셰프를 해고하거나 그들의 작업대를 축소하여 공간과 비용을 절약하고자 합니다. 하지만 레스토랑이 여전히 5성급 식사를 제공할 수 있도록 보장해야 합니다.

기존 방식의 문제점: "투박한 칼질"

이 모델들을 축소하려는 이전의 시도들은 정교한 메스 대신 **투박한 마체테(정글도)**를 사용하는 것과 같았습니다.

  • 기존 방식: 그들은 셰프 전체를 보고 "이 셰프는 중요하니 유지하자" 또는 "이 셰프는 거의 호출되지 않으니 해고하자"라고 결정했습니다.
  • 결함: 이것은 너무 뭉툭합니다. "중요한" 셰프라 할지라도 그들의 주방에는 낭비되는 공간이 많을 수 있습니다. 예를 들어, 셰프에게 100개의 도마가 있지만 실제로 사용하는 것은 상위 20개뿐일 수 있습니다. 나머지 80개는 그냥 먼지만 쌓여 있는 상태입니다.
  • 결과: 기존 방식은 셰프 전체를 유지하거나(80개의 사용되지 않는 도마까지 낭비하며), 혹은 셰프 전체를 해고했습니다(사용 가능한 20개의 도마까지 잃게 됨). 그들은 셰프의 작업 공간 내부의 내부적 중복성을 보지 못했습니다.

새로운 솔루션: 3단계 "스마트 리모델링"

저자들은 정밀한 건축가처럼 행동하는 새로운 프레임워크를 제안합니다. 그들은 단순히 누가 중요한지를 보는 것이 아니라, 각 전문가 내부의 어디에 가치가 있는지를 봅니다.

1단계: "기여도(Attribution)" 탐정 (진정한 가치 찾기)

먼저, 모델의 어떤 부분이 실제로 중요한지 알아내야 합니다.

  • 비유: 복잡한 소스에서 어떤 재료가 실제로 맛을 내는지 알아내려고 노력한다고 상상해 보세요. 단순히 누가 재료를 샀는지(라우터 통계)나 재료의 무게가 얼마인지(원시 데이터)만 보고는 추측할 수 없습니다.
  • 혁신: 그들은 **기여도 기반 손실 근사화(Attribution-Guided Loss Approximation)**라는 영리한 수학적 기법을 사용합니다. 모든 재료를 하나씩 제거하며 테스트하는 대신(시간이 너무 오래 걸림), "뒷면의 메모지"에 적는 듯한 빠른 계산법을 사용하여 각 부분이 최종적인 맛에 얼마나 기여하는지 즉각적으로 추정합니다.
  • 이점: 이는 기존 방식보다 20배 더 빠릅니다. 마치 요리를 직접 다 해보지 않고도 재료의 영향을 알아내는 초고속 맛 테스터를 가진 것과 같습니다.

2단계: "커버리지(Coverage)" 지도 (좋은 것을 극대화하기)

어떤 부분이 가치 있는지 알았다면, 이제 공간을 얼마나 남길지 결정해야 합니다.

  • 비유: 모래 한 양동이가 있다고 상상해 보세요. 어떤 알갱이는 금이고, 어떤 것은 흙입니다. 당신은 금은 남기고 흙은 버리고 싶습니다.
  • 기존 방식: "모래의 50%를 남겨라." 이렇게 하면 실수로 흙을 많이 남기고 금을 버릴 수도 있습니다.
  • 새로운 방식 (커버리지 극대화): "90%의 금을 덮을 수 있을 만큼의 모래를 남겨라."
  • 작동 원리: 그들은 이러한 모델에서 "금"(중요한 정보)이 단 몇 개의 채널(예: 상위 20개의 도마)에 고도로 집중되어 있다는 것을 발견했습니다. 따라서 그들은 거의 모든 가치를 포착하기 위해 얼마나 많은 채널을 유지해야 하는지 정확히 계산합니다. 그들은 중요한 정보를 "커버"할 때까지 자르기를 멈추며, 이 과정에서 어떤 전문가에게는 아주 적은 채널을 남기고 어떤 전문가에게는 더 많은 채널을 남기게 됩니다.

3단계: "얼라이먼트(Alignment)" 타일공 (퍼즐 조각 맞추기)

마สุดท้าย로, 유지할 채널의 목록이 생겼지만 문제가 하나 있습니다. 컴퓨터 칩(하드웨어)은 까다롭습니다. 그들은 64나 128의 배수(그리드에 타일을 완벽하게 맞추는 것과 같음)와 같은 숫자를 선호합니다. 만약 125개의 채널을 가지고 있다면, 컴퓨터는 공간을 낭비하며 128로 패딩(padding) 처리를 하거나 속도가 느려집니다.

  • 비유: 다양한 크기의 벽돌 더미가 있습니다. 당신은 모든 섹션이 정확히 128개의 벽돌 너비가 되어야 하는 벽을 쌓아야 합니다.
  • 혁신: 그들은 **해밀턴 최대 잔여법(Hamilton's Largest Remainder)**이라는 공정한 재분배 방법을 사용하여 남은 공간을 재조정합니다. 만약 어떤 전문가는 3개의 벽돌이 부족하고 다른 전문가는 60개가 부족하다면, 가장 완벽한 128-블록 크기에 가까워질 수 있도록 필요한 곳에 여분의 공간을 나누어 줍니다.
  • 이점: 이를 통해 축소된 모델이 컴퓨터의 메모리에 완벽하게 들어맞게 하여, 속도를 늦추지 않고도 저비트(압축된) 저장 공간을 사용하며 빠르게 실행될 수 있도록 합니다.

결과: 더 작고, 더 빠르며, 똑똑함은 그대로

그들은 QwenDeepSeek와 같은 유명한 모델들로 테스트를 진행했습니다.

  • 결과: 그들은 모델을 5배 축소(5x 압축)하면서도 정확도는 거의 동일하게 유지했습니다.
  • 증거: Qwen3-30B 모델의 경우, 메모리 점유율을 5.27배 줄였습니다. 50%라는 공격적인 프루닝(가지치기)을 수행했음에도 불구하고, 모델은 수학 및 추론 테스트(MATH500 벤치마크에서 94.5 기록)에서 여전히 매우 높은 점수를 기록했습니다.

요약

이 논인을 AI를 위한 궁극적인 정리 정돈 가이드라고 생각하세요.

  1. 어떤 전문가 전체를 해고할지 추측하는 것을 멈추세요.
  2. 가치를 담고 있는 특정 "황금 채널"을 찾기 위해 내부를 들여다보세요.
  3. 금을 덮기에 충분한 만큼만 남기고, 나머지는 잘라내세요.
  4. 남은 조각들이 컴퓨터 하드웨어에 완벽하게 들어맞도록 재구성하세요.

그 결과, 거인처럼 생각하면서도 당신의 주머니 속에 들어갈 수 있는 작고 효율적인 AI가 탄생했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →