← 최신 논문
🤖 machine learning

ProbMoE: Differentiable Probabilistic Routing for Mixture-of-Experts

이 논문은 top-kk 선택의 미분 불가능성을 극복하기 위해 전문가 라우팅을 카디널리티 제약이 있는 부분 집합에 대한 확률적 추론으로 정식화함으로써, 정확한 kk 및 동적 kk 라우팅을 모두 가능하게 하여 전문가 활용도와 성능을 향상시킨 Mixture-of-Experts 모델을 위한 미분 가능한 확률적 라우팅 프레임워크인 ProbMoE를 소개한다.

원저자: Heng Zhao, Zilei Shao, Guy Van den Broeck, Zhe Zeng

게시일 2026-06-02
📖 3 분 읽기☕ 가벼운 읽기

원저자: Heng Zhao, Zilei Shao, Guy Van den Broeck, Zhe Zeng

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신은 수백 명의 전문 셰프(전문가들)를 보유한 거대하고 첨단 기술이 집약된 주방을 운영하고 있다고 상상해 보세요. 어떤 이들은 베이킹에 뛰어나고, 어떤 이들은 그릴 요리에 능하며, 또 어떤 이들은 채소를 써는 데 마법 같은 실력을 갖추고 있습니다. 고객이 요리(텍스트 토큰)를 주문했을 때, 모든 셰프를 깨워 요리를 시킬 수는 없습니다. 그것은 너무 느리고 비용이 많이 들기 때문입니다.

대신, 헤드 셰프(라우터)가 주문을 보고 상위 3명의 셰프를 선정합니다. 이것이 현재 Mixture-of-Experts (MoE)라고 불리는 AI 모델들이 작동하는 방식입니다. 이들은 각 작업에 아주 작은 팀만을 사용하기 때문에 매우 효율적입니다.

문제점: "딱딱한" 선택

현재 헤드 셰프의 문제는 그가 경직된 이진 결정을 내린다는 점입니다. 그는 점수를 확인하고, 상위 3명을 뽑고, 그것으로 끝냅니다. 나머지 셰프들은 설령 간발의 차이로 탈락했을지라도 아무런 공로를 인정받지 못합니다.

이 결정이 너무 "딱딱하고" 갑작스럽기 때문에, 헤드 셰프는 제대로 학습할 수 없습니다. 만약 실수를 하더라도, 왜 그런 실수를 했는지 혹은 어떻게 조정해야 하는지 쉽게 파악할 수 없습니다. 왜냐하면 "상위 3명을 뽑는" 과정 뒤에 숨겨진 수학적 구조가 학습에 부적합하기 때문입니다. 이는 마치 자동차 핸들을 중간 단계 없이 왼쪽이나 오른쪽으로 끝까지 돌려야만 조향할 수 있는 것과 같습니다. 이로 인해 특정 몇몇 셰프에게만 일이 몰리고 다른 이들은 놀게 되며, 주방 전체가 불안정해집니다.

해결책: ProbMoE (확률적 주방)

저자들은 헤드 셰프가 결정을 내리는 새로운 방식인 ProbMoE를 소개합니다. 기존 방식이 "나는 반드시 셰프 A, B, C를 뽑겠다"라고 말한다면, ProbMoE는 "내가 셰프 A, B, C를 뽑을 확률이 있지만, 셰프 D가 선택될 가능성도 있다"라고 말합니다.

이를 다음과 같이 생각할 수 있습니다:

  • 기존 방식 (Top-k): 동전을 던집니다. 앞면이 나오면 셰프 A를 뽑고, 뒷면이 나오면 셰프 B를 뽑습니다. 중간 단계에서 마음을 바꿀 수 없습니다.
  • ProbMoE: 날씨, 시간대, 그리고 고객의 기분을 살핍니다. 셰프 A를 뽑을 확률 70%, 셰프 B 20%, 셰프 C 10%라는 것을 계산합니다.

결과적으로 여전히 정확히 3명의 셰프를 화구로 보내긴 하지만(속도를 유지하기 위해), 그 과정은 이제 유동적이고 수학적으로 변했습니다. 이를 통해 헤드 셰프는 선택받은 셰프뿐만 아니라, '거의 선택될 뻔했던' 셰프들로부터도 배울 수 있습니다.

작동 원리 (마법의 기술)

이 논문은 이를 가능하게 하는 영리한 수학적 트릭(SIMPLE)을 사용합니다:

  1. 순전파 (요리하기): 시스템은 저 확률들에 기반하여 3명의 셰프 팀을 무작위로 선택합니다. 이는 마치 주사위를 굴려 팀을 결정하는 것과 같지만, 가장 적합한 셰프가 더 잘 나오도록 무게가 실린 주사위를 사용하는 것과 같습니다.
  2. 역전파 (학습하기): 요리가 서빙된 후, 시스템은 헤드 셰프를 더 잘 가르치기 위해 노력해야 합니다. 주사위 굴리기가 무작위였음에도 불구하고, 수학적 구조 덕분에 시스템은 "헤이, 셰프 D가 거의 뽑힐 뻔했어. 만약 그를 뽑았다면 요리가 더 맛있었을지도 몰라. 다음번에는 셰프 D에게 조금 더 높은 확률을 주도록 헤드 셰프의 뇌를 조정하자"라고 말할 수 있습니다.

이 방식은 헤드 셰프에게 훨씬 더 명확한 개선 지도를 제공하여, 더 많은 셰프가 업무에 참여하고 팀이 더 잘 협력하는 주방을 만들어 줍니다.

"다이내믹" 업그레이드

논문은 또한 Dynamic-k 버전도 소개합니다.

  • 표준 ProbMoE: 항상 정확히 3명의 셰프를 뽑습니다.
  • Dynamic ProbMoE: 때로는 "소금"처럼 간단한 주문에는 1명의 셰프만 뽑습니다. 반대로 "7층 레이어 케이크"처럼 복잡한 주문에는 5명의 셰프를 투입합니다.

시스템은 "이 특정 주문에 얼마나 많은 노력이 필요한가?"를 스스로 묻고, 그에 따라 팀 규모를 조정하는 법을 배웁니다. 이는 간단한 작업에는 에너지를 아끼고, 어려운 작업에는 추가적인 도움을 주는 방식입니다.

결과가 보여주는 것

저자들은 다양한 AI 모델에 대해 테스트를 진행했으며 다음과 같은 결과를 얻었습니다:

  • 더 나은 팀워크: 셰프(전문가)들이 더 고르게 사용됩니다. 특정 셰프에게 일이 과중되지 않으며, 아무도 벤치에 앉아 놀지 않습니다.
  • 더 똑똑한 결정: 헤드 셰프는 어떤 팀이 작업에 가장 적합한지 더 잘 알게 됩니다.
  • 효율성: 다이내믹 버전은 고정된 버전과 동일한 훌륭한 결과를 내면서도, 평균적으로 더 적은 수의 셰프를 사용하여 컴퓨팅 자원을 절약할 수 있습니다.

요약하자면, ProbMoE는 경직된 "전부 아니면 전무(all-or-nothing)" 식의 선택 과정을 유연하고 학습 친화적인 확률 게임으로 전환하여, 거대 AI 모델을 더 똑똑하고, 안정적이며, 효율적으로 만듭니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →