← 최신 논문
💬 NLP

Post-Trained MoE Can Skip Half Experts via Self-Distillation

본 논문은 파라미터가 없는 제로-출력 전문가를 주입하고 2 단계 자기 증류 기법을 적용하여 사전 훈련된 정적 전문가 혼합 모델을 효율적인 동적 모델로 변환함으로써 50% 이상의 전문가 FLOPs 를 감소시키고 경미한 정확도 손실로 상당한 추론 속도 향상을 달성하는 저비용 프레임워크인 제로-전문가 자기 증류 적응 (ZEDA) 을 소개합니다.

원저자: Xingtai Lv, Li Sheng, Kaiyan Zhang, Yichen You, Siyan Gao, Xueheng Luo, Yuxin Zuo, Yuchen Fan, Junlin Yang, Ganqu Cui, Bingning Wang, Fan Yang, Youbang Sun, Ning Ding, Bowen Zhou

게시일 2026-05-19
📖 4 분 읽기☕ 가벼운 읽기

원저자: Xingtai Lv, Li Sheng, Kaiyan Zhang, Yichen You, Siyan Gao, Xueheng Luo, Yuxin Zuo, Yuchen Fan, Junlin Yang, Ganqu Cui, Bingning Wang, Fan Yang, Youbang Sun, Ning Ding, Bowen Zhou

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

ZEDA 논문을 쉬운 언어와 일상적인 비유로 설명합니다.

큰 문제: 과로하는 주방

고급 레스토랑 (대형 언어 모델) 이 상상해 보세요. 이 레스토랑에는 128 명의 전문가 셰프 (MoE 아키텍처의 '전문가'들) 가 있는 거대한 주방이 있습니다.

일반적인 설정에서는 어떤 주문이 들어오든—간단한 "안녕하세요"이든 교향곡 작성을 요청하는 복잡한 주문이든—주방은 항상 주문을 같은 8 명의 셰프에게 보냅니다. 이렇게 하면 음식이 항상 완벽하지만, 한 개의 당근을 다듬는 데 8 명의 셰프를 고용해 임금을 지불하는 것과 같아 매우 비싸고 느립니다.

이 논문의 목표는 주방을 더 똑똑하게 만드는 것입니다: 주문이 몇 명의 셰프가 필요한지 결정하게 하세요. 주문이 간단하면 셰프를 적게 쓰고, 어렵다면 많이 쓰세요. 이를 '동적' 주방이라고 합니다.

도전 과제: 아직 아무도 해고하지 마세요!

보통 똑똑하고 동적인 주방을 만들기 위해서는 완전히 새로운 팀을 고용하고 처음부터 훈련시켜야 합니다. 이는 수년이 걸리고 천문학적 비용이 듭니다.

하지만 이 논문은 묻습니다: 이미 완벽하게 요리하는 법을 알고 있는 기존에 완전히 훈련된 주방을 해고나 재훈련 없이 동적인 주방으로 바꿀 수 있을까요?

그 답은 ZEDA(Zero-Expert Self-Distillation Adaptation, 제로 전문가 자기 증류 적응) 입니다.

ZEDA 솔루션: '유령 셰프'

ZEDA 는 유령 셰프(Zero Experts) 를 활용한 교묘한 트릭을 사용합니다.

  1. 유령 주입: 연구자들은 기존 주방에 손도 없고 칼도 들고 있지 않은 새로운 '셰프'들을 비밀리에 대거 추가합니다. 이들은 제로 전문가입니다. 그들은 절대 아무것도 하지 않습니다. 그들의 출력은 항상 0 입니다.
  2. 새로운 규칙: 주방 관리자 (라우터) 는 이제 다음과 같이 지시받습니다: "여전히 모든 주문에 대해 8 명을 뽑아야 하지만, 이제 128 명의 실제 셰프와 이 새로운 유령 셰프들 중에서 고르면 됩니다."
  3. 마법: 주문이 간단하다면 (예: "날씨가 어때요?"), 관리자는 4 명의 실제 셰프와 4 명의 유령 셰프를 뽑는 법을 배웁니다. 유령들은 일을 하지 않으므로 주방은 4 명의 셰프 분량의 일만 합니다. 주문이 어렵다면 (예: "이 수학 문제를 풀어줘"), 관리자는 8 명의 실제 셰프와 0 명의 유령을 뽑습니다.

관리자를 어떻게 가르칠까요? (자기 증류)

문제는 관리자가 아직 언제 유령 셰프를 뽑아야 하는지 모른다는 점입니다. 만약 어려운 수학 문제에 유령을 뽑으면 음식이 타버릴 것입니다.

이를 해결하기 위해 ZEDA 는 자기 증류를 사용하는데, 이는 '그림자 훈련' 프로그램과 같습니다:

  • 선생님: 128 명의 실제 셰프가 있는 기존에 완전히 훈련된 주방이 엄격한 선생님 역할을 합니다. 완벽한 답변이 어떤 모습인지 정확히 알고 있습니다.
  • 학생: 유령이 있는 새로운 주방이 선생님을 따라 하려고 노력합니다.
  • 과정:
    1. 1 단계 (SFT): 학생이 선생님이 요리하는 것을 지켜봅니다. 선생님은 말합니다. "이 간단한 주문에 대해서는 내가 8 명의 셰프를 썼겠지만, 너는 4 명의 실제 셰프와 4 명의 유령을 써보아라. 다만 맛이 같아야 한다."
    2. 2 단계 (OPD): 학생이 혼자 요리를 시작합니다. 실수를 하면 선생님이 나서서 말합니다. "너는 어려운 수학 문제에 유령을 뽑았구나! 그래서 답이 틀린 거야. 다음에는 이런 유형의 질문에는 실제 셰프를 더 많이 뽑아라."

비밀 소스: '그룹 균형'

관리자가 에너지를 아끼려고 유령만 뽑거나, 유령을 전혀 뽑지 않고 에너지를 낭비할 위험이 있었습니다.

이를 막기 위해 연구자들은 그룹 균형 규칙을 추가했습니다. 그들은 관리자에게 말했습니다: "건강한 비율을 유지해야 한다. 실제 셰프 2 명을 사용할 때마다 유령 셰프 1 명을 사용하려고 노력해야 하지만, 절대로 실제 셰프들 사이의 균형을 무너뜨려서는 안 된다."

이것은 주방이 (가능할 때 유령을 사용하여) 효율적으로 유지되지만 음식의 품질을 해치지 않도록 보장합니다.

결과: 더 빠르고, 더 저렴하며, 같은 맛

이 훈련 (원래 훈련에 수 년이 걸린 것과 비교해 강력한 컴퓨터에서 2 일 미만 소요) 후:

  • 속도: 불필요한 작업에 비용을 지출하지 않게 되어 주방이 20% 빨라졌습니다.
  • 효율성: 전문가 작업의 50% 를 건너뛰었습니다(토큰의 약 절반을 유령을 사용하여 처리).
  • 품질: 음식 맛은 이전과 거의 정확히 동일했습니다. 일부 테스트에서는 관리자가 에너지를 더 잘 집중하는 법을 배워 오히려 약간 더 좋아지기도 했습니다.

요약

ZEDA 는 "정적"인 AI 모델 (항상 같은 양의 작업을 수행하는 모델) 을 "동적"인 모델 (쉬운 작업에는 더 적은 작업을 수행하는 모델) 로 바꾸는 방법입니다. 방법은 다음과 같습니다:

  1. 아무것도 하지 않는 보이지 않는 '유령' 전문가를 추가합니다.
  2. 스스로의 '선생님' 버전을 복사하여 이 유령들을 쉬운 작업에 사용하도록 모델을 가르칩니다.
  3. 유령을 너무 많이 써서 답변이 나빠지지 않으면서도 돈을 아낄 만큼 충분히 사용하도록 보장하는 특별한 규칙을 사용합니다.

이는 항상 50 명의 승객을 태우는 버스 (승객이 5 명뿐일 때도) 를 승객이 5 명뿐일 때 자동으로 밴으로 줄어드는 버스로 바꾸는 것과 같습니다. 아무도 남겨두지 않으면서 연료를 절약하는 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →