← 최신 논문
🤖 machine learning

SlimQwen: Exploring the Pruning and Distillation in Large MoE Model Pre-training

본 논문은 사전 학습 중 대규모 전문가 혼합 (MoE) 모델 압축을 위한 구조적 가지치기와 지식 증류에 대해 체계적으로 조사하여, 가지치기가 우수한 초기화를 제공하며 점진적 압축 일정이 한 번에 수행하는 방법보다 성능이 뛰어나고, 언어 모델링과 다 토큰 예측 증류를 결합하면 훨씬 작은 모델에서도 경쟁력 있는 성능을 달성함을 보여줍니다.

원저자: Shengkun Tang, Zekun Wang, Bo Zheng, Liangyu Wang, Rui Men, Siqi Zhang, Xiulong Yuan, Zihan Qiu, Zhiqiang Shen, Dayiheng Liu

게시일 2026-05-12
📖 4 분 읽기☕ 가벼운 읽기

원저자: Shengkun Tang, Zekun Wang, Bo Zheng, Liangyu Wang, Rui Men, Siqi Zhang, Xiulong Yuan, Zihan Qiu, Zhiqiang Shen, Dayiheng Liu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 거대하고 초강력한 지식 도서관 (거대한 AI 모델) 이 있는데, 운영 비용이 엄청나게 비싸고 읽는 속도도 매우 느리다고 가정해 봅시다. 도서관을 처음부터 다시 짓지 않고도 거의 모든 것을 아는 채로 주머니에 들어갈 만한 작은 버전으로 축소하고 싶다면 어떻게 해야 할까요?

이 논문은 **"SlimQwen"**이라는 제목으로, **전문가 혼합 (Mixture-of-Experts, MoE)**이라는 특정 AI 아키텍처를 위해 정확히 그 일을 수행하는 방법을 안내하는 가이드북입니다. MoE 모델을 단일한 두뇌가 아니라 거대한 전문가 팀으로 생각하세요. 어떤 이는 수학 천재이고, 어떤 이는 코딩 마법사이며, 어떤 이는 언어 전문가입니다. 보통은 어떤 질문이든 주어지면 소수의 전문가만 호출되어 답변합니다.

연구자들은 다음과 같은 질문을 던졌습니다: 이 거대한 전문가 팀을 집단적 천재성을 잃지 않으면서 더 작고 빠른 팀으로 축소하려면 어떻게 해야 할까요?

간단한 비유를 사용하여 그들의 발견 사항을 다음과 같이 정리해 보겠습니다:

1. "중고차" 대 "처음부터 새로 짓기" 비유

질문: 같은 금액으로 중고차를 약간 개조해 사는 것 (큰 모델을 가지치기) 이 더 나을까, 아니면 처음부터 새 차를 만드는 것이 더 나을까요?
발견: "중고차"를 사는 것이 항상 승리합니다.
이 논문은 거대하게 사전 훈련된 모델을 가져와서 더 작은 크기로 잘라내면 (가지치기), 그 작은 모델이 엄청난 출발선 상의 이점을 갖게 된다는 것을 보여줍니다. 마치 베테랑 셰프에게 더 작은 주방을 주는 것과 같습니다. 그들은 즉시 훌륭한 요리를 할 수 있습니다. 반면, 그 작은 주방에서 처음부터 새 셰프를 훈련시키면 배우는 데 훨씬 더 오래 걸리며, 같은 양의 연습 시간을 주더라도 베테랑 셰프를 따라잡지 못합니다.

2. "문서함" 비유 (전문가 압축)

질문: 전문가 팀을 축소할 때, 누구를 해고하고 누구를 유지할지 어떻게 결정합니까? 가장 적게 말하는 사람을 해고해야 할까요?
발견: 팀이 그 후에 "재훈련"을 받기만 한다면, 초기 절단을 어떻게 선택하든 그다지 중요하지 않습니다.
연구자들은 어떤 전문가를 유지할지 결정하는 다양한 방법 (가장 적게 말하는 사람을 해고하거나, 점수가 가장 낮은 사람을 해고하는 등) 을 시도했습니다. 그들은 더 작은 팀이 새로운 연습 (지속적 사전 훈련) 을 많이 받은 후에는 모두 거의 동일한 성능을 발휘한다는 것을 발견했습니다.
비결: 그러나 그들은 **"부분 보존 (Partial Preservation)"**이라는 트릭을 발견했습니다. 100 명의 전문가가 있고 50 명을 유지해야 한다고 가정해 봅시다. 상위 50 명만 선택하고 나머지를 해고하는 대신, 상위 25 명은 그대로 유지하고 나머지 25 개 자리는 "해고된" 전문가들을 "유지된" 전문가들과 병합하여 채웠습니다. 이는 스타 플레이어는 그대로 유지하면서 벤치 플레이어들이 그들의 기술을 스타터들에게 합류시키는 것과 같습니다. 이 특정 전략은 단순히 상위 50 명을 무작위로 선택하는 것보다 최종 팀을 약간 더 똑똑하게 만들었습니다.

3. "튜터" 비유 (증류)

질문: 작은 팀이 큰 팀처럼 생각하도록 가르치려면 어떻게 해야 할까요?
발견: 정답만 알려주는 것이 아니라, 그들이 교과서에서도 배우는 동안 큰 팀의 "사고 과정"을 듣게 하세요.
보통 모델을 축소할 때, 작은 모델이 큰 모델의 답을 복사하도록 하는 **지식 증류 (Knowledge Distillation)**라는 기법을 사용합니다. 이 논문은 가장 좋은 방법이 하이브리드 접근법이라는 것을 발견했습니다:

  • 교과서: 작은 모델이 실제 정답에서 배우게 하세요 (표준 언어 모델링).
  • 튜터: 또한 큰 모델의 "부드러운" 추측을 듣게 하세요 (증류).
    큰 모델을 단순히 복사하는 것보다 두 가지를 함께 수행하는 것이 더 효과적입니다.

새로운 트릭 (MTP 증류): 그들은 또한 **Multi-Token Prediction (다중 토큰 예측)**이라는 새로운 교육 방식을 도입했습니다.

  • 일반적인 교육: "여기 문장이 있습니다. 다음 단어는 무엇입니까?"
  • MTP 교육: "여기 문장이 있습니다. 다음 단어, 그리고 그 다음 단어, 그리고 그 다음 다음 단어는 무엇입니까?"
    이것은 작은 모델이 미리 계획을 세우는 법을 배우도록 도와주어, 나중에 실제로 텍스트를 생성할 때 더 빠르고 정확하게 만듭니다.

4. "계단" 대 "절벽" 비유 (점진적 가지치기)

질문: 모델을 한 번에 (원샷) 잘라내야 할까요, 아니면 단계별로 천천히 잘라내야 할까요?
발견: 계단이 더 좋습니다.
거대 모델을 가져와서 크기의 75% 를 즉시 잘라내면 절벽에서 뛰어내리는 것과 같습니다. 모델은 혼란을 겪고 지식을 잃습니다.
대신 연구자들은 **점진적 가지치기 (Progressive Pruning)**가 가장 잘 작동한다는 것을 발견했습니다. 계단을 내려가는 것을 상상해 보세요:

  1. 모델을 조금 잘라냅니다 (예: 일부 레이어 제거).
  2. 연습하고 안정화되도록 합니다.
  3. 조금 더 잘라냅니다.
  4. 다시 연습하게 합니다.
    이 점진적인 전환은 모델이 각 새로운 더 작은 크기에서 작동하는 방법을 "재학습"할 수 있게 하여, "절벽 점프" 방식보다 훨씬 더 똑똑한 최종 결과를 만들어냅니다.

최종 결과: SlimQwen

가지치기된 모델로 시작하고, 전문가를 위한 스마트한 "부분 보존" 전략을 사용하며, 교과서 학습과 튜터 지도를 혼합하고, 절벽이 아닌 계단을 따라 모델을 축소하는 등 이러한 모든 트릭을 결합함으로써, 그들은 거대한 800 억 개 파라미터 모델을 작은 230 억 개 파라미터 모델로 성공적으로 압축했습니다.

거의 4 배나 작음에도 불구하고, 이 "SlimQwen" 모델은 수학, 코딩, 일반 지식과 같은 어려운 작업에서 여전히 경쟁력 있는 성능을 발휘합니다. 이는 올바르게 축소하는 방법을 안다면 거대한 두뇌가 없어도 똑똑한 일을 할 수 있음을 증명합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →