← 최신 논문
💬 NLP

UMoE:Unlocking Every Expert in Domain-Specific Training

UMoE는 저중요도 전문가를 가지치기하고 미세 조정을 하기 전에 섭동을 통해 전문가 풀을 다시 키움으로써 혼합 전문가 모델의 도메인 특화 학습을 강화하는 예산 보존형 파이프라인으로, 추론 비용을 증가시키지 않으면서 다양한 아키텍처와 도메인에 걸쳐 표준 지도 미세 조정보다 일관되게 우수한 성능을 보여준다.

원저자: Xuefeng Li, Pengfei Liu

게시일 2026-07-14
📖 4 분 읽기☕ 가벼운 읽기

원저자: Xuefeng Li, Pengfei Liu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 거대하고 매우 똑똑한 로봇 뇌인 "Mixture-of-Experts"(MoE)가 있다고 상상해 보세요. 이 뇌를 하나의 거대한 근육이 아니라, 각기 다른 분야에 정통한 128개 또는 256개의 작은 전문가들로 구성된 팀이라고 생각하는 것입니다. 로봇이 질문을 받으면, 스마트한 "라우터(router)"가 어떤 몇 명의 전문가(예: 8명)가 문제를 해결하는 데 도움을 줄지 결정합니다.

여기 문제가 있습니다. 이 팀은 수학, 코딩, 과학, 요리 등 모든 것에 대해 훈련되었습니다. 그런데 이제 당신은 이 로봇을 수학 천재로 만들고 싶습니다. 논문은 만약 당신이 그냥 팀 전체에게 수학을 가르치기 시작한다면(이를 "Direct SFT"라고 부릅니다), 시간을 낭비하게 될 것이라고 주장합니다. 왜냐하면 256명의 전문가 중 일부는 수학에 정말 형편없기 때문입니다. 그들은 시 쓰기나 역사에는 뛰어날지 몰라도, 수학 수업에서는 그저 "소음(noise)"일 뿐입니다. 하지만 라우터는 실수로 그들을 계속 호출하며, 로봇은 그들에게 수학을 억지로 가르치려 노력하게 되는데, 이는 매우 비효율적입니다.

핵심 아이디어: UMoE (MoE의 역량 해방하기)
저자들인 Xuefeng Li와 Pengfei Liu는 영리한 기술인 UMoE를 제안합니다. 단순히 팀 전체를 가르치는 대신, 먼저 빠른 "오디션"을 보는 것입니다.

  1. Prune (가지치기/자르기): 그들은 적은 양의 수학 문제 샘양을 가져와서 "누가 실제로 이 일을 잘하는가?"라고 묻습니다. 그리고 수학에 가장 도움이 되지 않는 하위 50%의 전문가들을 찾아내어 방 밖으로 쫓아냅니다.
  2. Regrow (다시 키우기/복제하기): 이제 팀이 너무 작아졌습니다! 로봇은 속도와 비용을 동일하게 유지하기 위해 256명의 전문가라는 전체 예산을 유지해야 합니다. 그래서, 그들은 남은 수학에 능숙한 전문가들을 복제합니다. 하지만 여기서 반전이 있습니다. 그들은 단순히 복사해서 붙여넣는 것이 아닙니다. 원본과 복제본에 아주 작은 무작위 "흔들림(mathematical perturbation)"을 줍니다. 이를 통해 복제본이 원본과 약간 다르게 만들어지며, 서로 발을 밟지 않으면서도 각각 독립적으로 학습하고 전문화될 수 있게 합니다.
  3. SFT (학습): 이제 수학을 배울 준비가 된(또는 될 준비가 된) 전문가들로 가득 찬 방에서, 팀 전체에게 수학을 가르칩니다.

결과: 효과가 있는가?
논문은 이 "오디션 및 재성장" 방식이 놀라울 정도로 잘 작동함을 보여주며, 저자들은 시뮬레이션이 아닌 실제 벤치마크를 통해 이를 테스트했기에 결과에 확신을 가지고 있습니다.

  • 수학: 어려운 수학 경시대회 세트에서, UMoE는 한 모델에서 평균 점수를 3.4점 높였고, 더 최신인 더 큰 모델에서는 1.67점을 높였습니다. 심지어 표준 방식이 이미 유명한 다른 모델들을 앞서고 있는 매우 강력하고 고품질인 수학 데이터셋을 사용했을 때도, UMoE는 여전히 1.36점을 추가로 뽑아냈습니다.
  • 코딩 및 과학: 이것은 수학뿐만이 아닙니다. 코딩, 과학, 심지어 "에이전틱(agentic)" 작업(AI가 도구를 사용하는 작업)에 대해서도 일관되게 승리했습니다. 예를 들어, SWE-bench Verified라는 까다로운 코딩 벤치마크에서 점수가 6.0점(16.2%에서 22.2%로) 상승했습니다.
  • 데이터 크기: 논문은 이것이 적은 데이터에서만 작동하는지 확인했습니다. 그들은 0.5억에서 41억 개의 토큰에 이르는 다양한 데이터 크기로 테스트했습니다. 모든 경우에서 UMoE가 더 우수했습니다.

논문이 말하는 "정답이 아닌 것"
저자들은 무엇이 작동하지 않는지, 혹은 무엇이 핵심이 아닌지에 대해 매우 명확히 밝히고 있습니다:

  • 단순히 데이터를 더 많이 추가하는 것은 충분하지 않습니다: 그들은 엄청난 양의 데이터를 사용하더라도 표준 방식(Direct SFT)은 여전히 혼합물 속에 "쓸모없는" 전문가들을 남겨둔다는 것을 보여주었습니다.
  • 한쪽 방향의 흔들림은 효과가 없습니다: 그들이 새로운 복제본들만 "흔들고" 기존 전문가들은 건드리지 않았을 때, 성능은 오히려 표준 방식보다 떨어졌습니다. 논문은 균형을 맞추기 위해 원본과 복제본 모두를 흔들어야 한다고 제唆합니다.
  • 단순한 계산은 최선이 아닙니다: 그들은 누가 쫓겨날지 결정하는 다양한 방법을 테스트했습니다. 전문가가 얼마나 자주 사용되는지(빈도)를 단순히 세는 것도 괜찮았지만, 전문가의 답변이 얼마나 강력한지와 얼마나 자주 사용되는지를 모두 고려하는 REAP라는 더 복잡한 점수가 가장 좋았습니다.

왜 작동하는가 (아하! 모먼트)
논문은 왜 이것이 작동하는지 깊이 파고들었습니다. 그들은 표준 방식에서 로봇이 해당 작업에 거의 쓸모없는 전문가들에게 컴퓨팅 파워의 약 **42%**를 낭비한다는 것을 발견했습니다. 만약 표준 방식으로 훈련된 모델을 가져와서 훈련 후에 수동으로 하위 절반의 전문가를 제거한다면, 점수는 거의 떨어지지 않을 것입니다(단 0.12점). 이는 표준 방식이 무거운 짐을 지고 있었다는 것을 증명합니다.

하지만 UMoE는 어떨까요? 만약 훈련된 팀의 하위 절반을 잘라낸다면, 점수는 5.0점이나 폭락할 것입니다. 이는 UMoE가 그 "죽은 무게(dead weight)"를 유용한 수학 해결 능력으로 성공적으로 전환했음을 시사합니다.

작은 예시
논문은 차이점을 보여주기 위해 특정 수학 문제(AIME 2026, Problem 25)를 제시합니다.

  • 표준 모델: 분수(200/225)를 단순화하려고 시도했으나 틀렸고(4/5라고 답함), 이로 인해 잘못된 최종 답인 405를 냈습니다.
  • UMoE: 분수를 올바르게 단순화하여(8/9로) 정답인 850을 맞혔습니다.

결론
이 논문은 본격적인 훈련이 시작되기 전에 팀을 재편함으로써(잘못된 전문가를 내보내고 맞는 전문가를 복제함으로써), 더 많은 돈이나 시간을 들이지 않고도 모델을 더 똑똑하게 만들 수 있음을 시사합니다. 이는 마치 축구 팀 전체에게 체스를 가르칠 필요가 없다는 것을 깨닫는 것과 같습니다. 대신 체스 선수를 데려와 함께 연습하게 하는 것입니다. 저자들은 이를 12가지 벤치마크에 걸쳐 측정했으며, 이것이 일관되게 도움이 된다는 것을 발견하여, UMoE가 AI 전문가들을 그들의 특정 직무에 더욱 뛰어나게 만드는 견고한 방법임을 입증했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →