← 최신 논문
💬 NLP

Pruning and Distilling Mixture-of-Experts into Dense Language Models

본 논문은 전문가들을 점수 매기고 선택하여 그룹화한 후 지식 증류를 수행함으로써 훈련된 전문가 혼합 (MoE) 모델을 표준 밀집 아키텍처로 변환하는 새로운 프레임워크를 제시하며, 이 접근 방식이 정확도와 훈련 효율성 측면에서 기존 밀집-밀집 가지치기보다 현저히 우수함을 입증합니다.

원저자: Junhyuck Kim, Jihun Yun, Haechan Kim, Gyeongman Kim, Joonghyun Bae, Jaewoong Cho

게시일 2026-05-28
📖 4 분 읽기☕ 가벼운 읽기

원저자: Junhyuck Kim, Jihun Yun, Haechan Kim, Gyeongman Kim, Joonghyun Bae, Jaewoong Cho

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

"Pruning and Distilling Mixture-of-Experts into Dense Language Models"라는 논문에 대한 설명을 간단한 언어와 창의적인 비유로 풀어냅니다.

큰 문제: "전원 투입" 병목 현상

상상해 보세요. 엄청나게 복잡하고 고급스러운 요리를 만들도록 설계된 거대한 고급 레스토랑 주방 (MoE 모델) 이 있습니다. 이 주방에는 128 명의 다양한 전문 셰프 (전문가) 가 고용되어 있습니다. 하지만 어떤 단일 주문이 들어오더라도, 수석 셰프 (라우터) 는 그중 8 명만 불러서 일하게 합니다. 나머지 120 명의 셰프들은 차례를 기다리며 가만히 서 있습니다.

이런 구성은 요리 속도와 다양성에는 훌륭하지만, 치명적인 문제가 하나 있습니다. 주방을 열려면 128 명의 셰프 모두를 고용하고 급여를 지급해야 합니다. 한 번에 8 명만 사용하더라도, 128 명 모두를 고용 상태로 유지할 만큼의 공간 (메모리) 과 자금 (컴퓨팅 파워) 이 필요합니다. 이로 인해 이 레스토랑을 작은 가게 (휴대폰이나 단일 컴퓨터 같은) 에 지어 지점을 내는 것은 불가능해집니다. 모든 직원을 수용할 공간이 부족하기 때문입니다.

현재의 해결책들은 주방을 작게 만들기 위해 일부 셰프를 해고하려 하지만, 남은 셰프들을 별도의 전문 스테이션에 배치해야 합니다. 여전히 모든 사람을 건물 안으로 불러들여야 합니다.

해결책: "마스터 셰프" 변형

이 논문의 저자들은 급진적인 새로운 레시피를 제안합니다. 단순히 셰프를 해고하는 대신, 팀이 해왔던 모든 일을 할 수 있는 8 명의 최고의 셰프를 하나로 합쳐서 '슈퍼 셰프'를 만드는 것입니다. 그렇게 하면 추가 공간 없이도 모든 일을 해낼 수 있습니다.

그들은 훈련된 128 명의 전문가 팀을 작은 가게에 들어맞으면서도 마스터처럼 요리를 할 수 있는 표준적인 밀집형 주방 (Dense 모델) 으로 변환합니다.

그들이 어떻게 했는지: 3 단계 프로세스

이 논문은 "MoE 주방"을 "Dense 주방"으로 변환하는 3 단계 프로세스를 제시합니다.

1. 점수 매기기: "스타" 셰프 찾기

먼저, 어떤 셰프를 유지할지 결정해야 합니다. 단순히 가장 자주 호출된 셰프 (빈도) 를 고를 수는 없습니다. 왜냐하면 그들은 모든 것을 평균적으로 잘하지만, 아무것도 뛰어나게 잘하지 않는 "만능형"일 수 있기 때문입니다.

  • 옛 방법: 가장 많이 호출된 셰프를 고릅니다. (가장 인기 있는 직원을 뽑는 것과 같습니다).
  • 새 방법 (다양성 인식 점수 매기기): 저자들은 DO-ACP라는 새로운 지표를 고안했습니다. 스포츠 팀을 뽑는다고 상상해 보세요. 단순히 가장 많은 경기를 뛰는 선수 8 명을 뽑는 것이 아니라, 가장 다양한 기술을 가지고 있으며 그 특정 기술에서 가장 뛰어난 선수 8 명을 뽑는 것입니다.
    • 셰프 A 는 베이킹을, 셰프 B 는 그릴링을 잘한다면 둘 다 원합니다.
    • 셰프 C 와 셰프 D 가 모두 그릴링을 잘한다면, 둘 중 하나만 필요합니다.
    • 새로운 방법은 수학적으로 선택된 셰프들이 중복 없이 가장 넓은 범위의 "맛" (지식) 을 커버하도록 보장합니다.

2. 그룹화 및 병합: 슈퍼 셰프 만들기

최고의 8 명의 셰프 (안전起见로 조금 더) 를 뽑은 후, 이를 결합해야 합니다.

  • 순수 가지치기 (승자): 대부분의 경우, 최고의 결과는 레시피를 섞지 않고 단순히 상위 8 명의 셰프를 새로운 주방으로 직접 복사하는 것에서 나왔습니다. 레시피를 평균적인 하나의 레시피로 섞어 보는 것보다, 8 명의 뚜렷하고 고품질의 전문가들이 나란히 일하는 것이 더 낫다는 것이 밝혀졌습니다.
  • 병합: 8 명 이상을 뽑아야 한다면, 유사한 셰프들의 레시피를 그들의 능력에 따라 가중치를 두어 섞습니다.

3. 지식 증류: "맛보기" 훈련

이제 8 명의 셰프로 구성된 새로운 주방 (학생) 을 갖게 되었지만, 아직 완벽하지는 않습니다. 올바른 직원을 채용했지만 비밀 가족 레시피를 배우지 못한 새로운 레스토랑과 같습니다.

그들은 새로운 주방을 원래의 128 명 셰프 주방 (선생님) 과 함께 일하게 합니다.

  • 선생님이 요리를 합니다.
  • 학생이 똑같은 요리를 만들어 보려고 합니다.
  • 선생님이 학생을 교정합니다. "아니, 소금을 너무 많이 넣었어" 또는 "미묘한 향신료를 빠뜨렸어."
  • 학생은 이러한 교정을 통해 배웁니다. 이 과정을 **지식 증류 (Knowledge Distillation)**라고 합니다.

결과: 이것이 중요한 이유

저자들은 Qwen3, DeepSeek, GPT-OSS 와 같은 여러 거대 AI 모델을 대상으로 이를 테스트했습니다. 그들이 발견한 바는 다음과 같습니다.

  1. 올바른 셰프를 뽑는 것이 모든 것: 셰프를 그룹화하는 방식보다 셰프를 점수 매기는 방식이 더 중요했습니다. 그들의 새로운 "다양성 인식" 점수 매기기가 모든 이전 방법들을 압도적으로 능가하는 명백한 승자였습니다.
  2. 섞지 말고 선택만 하라: 놀랍게도, 최고의 전략은 정확히 8 명의 셰프를 뽑고 아예 섞지 않는 것이었습니다. 단순히 8 명의 가장 뛰어나고 다양한 전문가들이 함께 일하는 것이 그들을 평균화하는 것보다 더 좋았습니다.
  3. 경쟁을 이기다: 그들은 기존의 작은 모델을 만드는 방법 (큰 밀집형 모델을 가져와서 잘라내는 방식) 과 그들의 "MoE 에서 Dense 로" 방법을 비교했습니다.
    • 결과: 그들의 새로운 방법은 평균 작업에서 6.3% 더 정확한 학생 모델을 생성했습니다.
    • 속도: 원래의 "선생님" 주방이 훈련 과정에서 실행하는 데 더 효율적이었기 때문에, 훈련 속도는 1.6 배 더 빨랐습니다.

결론

이 논문을 거대한 기업 본사를 회사의 지적 능력 (브레인파워) 을 잃지 않고 작고 효율적인 스타트업 사무실로 축소하는 청사진으로 생각하세요.

임금을 아끼기 위해 단순히 사람을 해고하는 대신, 가장 다양하고 재능 있는 8 명의 직원을 신중하게 선정하여 작고 컴팩트한 사무실을 제공하고, 원래의 큰 팀으로부터 회사의 비밀을 배우게 했습니다. 결과는? 큰 사무실만큼이나 잘 수행하면서도 훨씬 작은 공간에 들어맞는 작은 사무실입니다.

핵심 교훈: 결과를 얻기 위해 거대한 팀 전체를 유지할 필요는 없습니다. 올바른 8 명을 뽑고, 그들을 독특하게 유지하며, 잘 가르치기만 하면 됩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →