← 최신 논문
💬 NLP

The Evolution of Mixture-of-Experts Architectures in Large Language Models: Routing, Topology, Load Balancing, and Expert Parallelism

이 기술적 조사(technical survey)는 거대 언어 모델 내 혼합 전문가(Mixture-of-Experts) 아키텍처의 진화를 의존성 그래프로 구성하고 이를 네 가지 제어 평면(전문가 토폴로지, 라우팅, 밸런싱, 전문가 병렬성)을 통해 분석함으로써, 단순히 희소 매개변수를 활성화하는 단계를 넘어 의미론적 라우팅, 계산 예산, 그리고 물리적 실행을 분리하는 방향으로 나아가는 이 분야의 변화를 설명한다.

원저자: Jiguo Li

게시일 2026-08-11
📖 7 분 읽기🧠 심층 분석

원저자: Jiguo Li

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

초지능 컴퓨터의 두뇌를 거대하고 북적이는 도서관이라고 상상해 보세요. 과거에는 단 하나의 질문에 답하기 위해, 컴퓨터는 단 하나의 질문이라도 안전하게 처리하려고 모든 책을 하나씩 읽으라고 사서에게 보냈습니다. 이는 느리고 많은 에너지를 낭비했습니다. 그러던 중 엔지니어들은 더 똑똑한 방법을 발명했습니다: 바로 "전문가 혼합(Mixture of Experts)"입니다. 한 명의 사서가 모든 것을 읽는 대신, 수천 명의 전문가를 고용한 것입니다. 요리에 관한 질문이 들어오면 "요리사" 사서가 책을 펼치고, 우주에 관한 질문이 들어오면 "천문학자"가 깨어납니다. 이것이 거대 언어 모델(LLM)에서 **전문가 혼합(Mixture-of-Experts, MoE)**의 핵심 아이디어입니다. 즉, AI 모델이 모든 단어를 처리할 때마다 모든 계산을 수행하지 않고도 믿기 힘들 정도로 거대하고 똑똑하게 성장할 수 있게 해줍니다.

하지만 여기에 까다로운 문제가 있습니다. 만약 백만 명의 전문가가 있다면, 누가 일을 맡을지 어떻게 결정할까요? 만약 모든 "우주" 관련 질문을 천문학자에게 보낸다면, 천문학자는 과부하가 걸려 속도가 느려지는 반면, "요리사"는 아무 일도 하지 않고 놀게 됩니다. 이것이 바로 "라우팅(routing)" 문제입니다. 이는 마치 거대한 콘서트장에서 어떤 음악가가 어떤 음을 연주할지 즉각적으로 결정하여, 아무도 과부하에 걸리지 않고, 아무도 지루해하지 않으며, 음악이 완벽하게 흐르도록 관리하는 것과 같습니다. 라우팅을 잘못하면 전체 시스템이 멈춰버립니다.

2026년 8월 Jiguo Li가 작성한 이 논문은 이러한 "전문가" 시스템이 시간이 흐름에 따라 어떻게 진화해 왔는지에 대해 깊이 있게 다룹니다. 저자는 MoE의 역사가 단순히 매년 출시되는 더 새롭고 더 큰 모델들의 목록이 아니라고 주장합니다. 대신, 이는 하나의 특정 교통 체증을 해결해 나가는 과정의 이야기입니다. 저자는 이 분야가 단순한 통계적 기교에서부터, 컴퓨터가 단순히 누가 도와야 하는지뿐만 아니라 얼마나 많이 도움이 필요한지, 심지어 그 도움이 컴퓨터 하드웨어의 물리적 어디에 존재하는지까지 결정할 수 있는 복잡하고 동적인 시스템으로 이동해 왔다고 제안합니다. 이 논문은 미래가 단순히 더 많은 전문가를 추가하는 것이 아니라, "AI가 무엇을 생각하는가"라는 논리와 "컴퓨터가 어떻게 실행되는가"라는 물리적 실체를 분리하여, 교통 체증에 갇히지 않는 더 똑똑하고 빠르며 효율적인 AI를 만드는 데 있다고 결론짓습니다.

8가지 이정표 이야기

MoE의 진화를 도시의 대중교통 시스템의 역사처럼 생각해 보세요. 처음에는 모든 곳에 정차하는 단 한 대의 버스로 시작했다가, 택시를 부를 수 있는 시스템으로 발전했고, 결국 드론과 지하철이 스스로 조직화된 초효율적인 네트워크가 되었습니다. 이 논문은 이 여정을 각 단계가 주요 병목 현상을 해결했지만 동시에 새로운 과제를 만들어냈던 8가지 뚜렷한 단계, 즉 "이정표"로 나눕니다.

1. 통계적 분업 (오래된 버스)
초창기에는 개념이 간단했습니다. 어떤 "전문가"(두뇌의 작은 부분)가 작업을 처리할지 결정하는 "게이트"를 두는 것이었습니다. 하지만 초기에는 모두가 조금씩은 도움을 주었습니다. 이는 모든 승객가 내리지 않더라도 운전사에게 서서 손을 흔들어야 하는 버스와 같았습니다. 통계적인 분업이었지만 에너지를 절약하지는 못했습니다. 컴퓨터는 여전히 모든 일을 수행했으며, 단지 약간 더 똑똑한 방식으로 할 뿐이었습니다.

2. "Top-K" 스위치 (택시 서비스)
그 후 큰 돌파구가 마련되었습니다: 희소 조건부 계산(Sparse Conditional Computation). "상위 2명의 전문가만 일하고 나머지 98명은 집에 가라"고 말하는 스위치를 상상해 보세요. 이것이 Top-K 라우팅입니다. 갑자기 컴퓨터는 방대한 지식(수백만 개의 파라미터)을 가질 수 있지만, 각 단어에 대해서는 그중 아주 작은 조각만을 사용하게 되었습니다. 이것은 "용량 레버"였습니다. 즉, 모델을 느리게 만들지 않고도 더 똑똑하게 만들 수 있었습니다. 하지만 새로운 문제가 생겼습니다: 만약 "요리사"에게는 1,000개의 주문이 들어오고 "천문학자"에게는 하나도 들어오지 않는다면 어떻게 될까요? 시스템은 불균형해지기 시작했습니다.

3. 클러스터 규모 확장 (지하철 네트워크)
모델이 수천 개의 컴퓨터 칩(GPU)에 적합하도록 커지면서, 문제는 데이터를 이동시키는 것이 되었습니다. 만약 "요리사"는 칩 A에 있고 "천문학자"는 칩 B에 있다면, 재료를 어떻게 그곳으로 가져갈까요? 이 시대는 **전문가 병렬성(Expert Parallelism)**과 All-to-All 통신을 도입했습니다. 이는 토큰(단어)이 승객이고, 그들이 올바른 전문가에게 가기 위해 기차로 갈아타야 하는 거대한 지하철 네트워크를 구축하는 것과 같습니다. 과제는 "누가 수학적 계산을 하는가"에서 "데이터를 옮기는 동안 기차가 멈추지 않고 얼마나 빨리 옮길 수 있는가"로 바뀌었습니다.

4. 오픈 웨이트 시대 (대중교통 앱)
그 후, Mixtral과 같은 모델들은 이 복잡한 시스템이 거대 연구소뿐만 아니라 일반 사람들에게도 실제로 작동할 수 있음을 보여주었습니다. 그들은 거칠게 구성된 MoE(큰 전문가들)가 모두가 사용할 수 있도록 개방될 수 있음을 증명했습니다. 하지만 "전문가"들은 여전히 너무 크고 둔했습니다. 그들은 기본적인 것들(예: "안녕"이라고 말하는 법)을 똑같이 다시 배우는 경향이 있었는데, 이는 공간 낭비였습니다.

5. 미세 조정 및 공유 전문가 (특화 키오스크)
이러한 둔함을 해결하기 위해 엔지니어들은 큰 전문가들을 여러 개의 작고 미세한 전문가들로 나누기 시작했습니다. 이는 하나의 거대한 "종합 상점"을 대신하여 "매운 음식", "디저트", "비건 옵션"을 위한 수백 개의 작은 키오스크를 배치하는 것과 같습니다. 이를 통해 훨씬 더 정밀한 라우팅이 가능해졌습니다. 또한 그들은 모두가 필요로 하는 것들(기본 문법 등)을 위한 영구적인 경로인 **공유 전문가(Shared Experts)**를 추가하여, 라우팅 시스템이 기초적인 것에 시간을 낭비하지 않도록 했습니다. 이는 시스템을 더 빠르고 똑똑하게 만들었지만, 새로운 교통 체증을 만들었습니다: 너무 많은 작은 키오스크는 지하철을 타기 위한 너무 많은 작은 이동을 의미하며, 이는 속도를 늦췄습니다.

6. 초희소 스케일링 (백만 명의 전문가 도서관)
다음으로 연구자들은 "만약 우리가 훨씬 더 많은 전문가를 가지되, 훨씬 더 작은 전문가들을 가진다면 어떨까?"라고 질문했습니다. Kimi K2PEER 같은 모델들은 수백 개의 작은 전문가(때로는 백만 개 이상!)를 사용하기 시작했습니다. 아이디어는 AI가 매 단어에 대해 완벽한 전문가를 찾을 수 있도록 후보 풀을 매우 크게 만드는 것이었습니다. 하지만 논문은 주의점을 언급합니다: 전문가가 너무 많으면 컴퓨터는 실제로 작업을 수행하는 것보다 누가 호출될지 찾는 데(검색) 그리고 데이터를 이동시키는 데 더 많은 시간을 소비하게 됩니다. 즉, "가중치 I/O"(전문가의 뇌를 로딩하는 것)가 새로운 병목 현상이 되었습니다.

7. 동적 컴퓨팅 (유연한 예산)
지금까지는 모든 단어가 동일한 양의 도움(예: "Top-2" 전문가)을 받았습니다. 하지만 어떤 단어는 어렵고(예: "양자 물리학"), 어떤 단어는 쉽습니다(예: "the"). **동적 컴퓨팅(Dynamic Compute)**은 규칙을 바꿉니다: AI는 쉬운 단어에는 1명의 전문가를, 어려운 단어에는 4명의 전문가를 사용하도록 결정할 수 있습니다. 일부 모델은 AI가 그냥 "나는 이것을 알고 있으니 아무도 부를 필요 없다"라고 말하는 "제로 컴퓨팅(zero-compute)" 슬롯을 사용하기도 합니다. 이는 에너지를 절약하지만, 새로운 위험을 초래합니다: 어려운 단어들이 동시에 많이 나타나면 시스템이 과부하되어 지연(테일 레이턴시)이 발생할 수 있습니다.

8. 논리와 물리적 실행의 분리 (텔레포테이션 네트워크)
마지막 프런티어는 **의미론적 라우팅과 물리적 실행의 분리(Semantic Routing Decoupled from Physical Execution)**입니다. 현재는 AI가 "천문학자"를 호출하기로 결정하면, 데이터는 즉시 천문학자의 칩으로 물리적으로 이동해야 합니다. ScMoE나 **이종 전문가(Heterogeneous Experts)**와 같은 새로운 아이디어들은 결정이동을 분리할 수 있음을 시사합니다. 예를 들어, AI는 천문학자를 사용하기로 결정하지만 데이터는 버퍼에서 대기하거나, 작업에 따라 천문학자의 크기가 달라질 수 있습니다. 이는 목적지는 논리적으로 결정되지만, 물리적 운송은 교통 체증을 피하기 위해 별도로 최적화되는 텔레포테이션 네트워크와 같습니다.

4가지 제어 평면

논문은 이러한 모든 변화를 거대 기업의 다양한 관리 계층과 같은 네 가지 "제어 평면"으로 정리합니다:

  1. 객체 계층 (토폴로지): 이것은 "조직도"입니다. 전문가가 누구인지, 그들의 크기는 얼마인지, 그리고 책상을 공유하는지를 정의합니다. "8개의 큰 전문가가 있는가, 아니면 128개의 작은 전문가가 있는가?"를 묻습니다.
  2. 결정 계층 (라우팅): 이것은 "배차원"입니다. 모든 단어에 대해 "누구를 부를 것인가?"를 결정합니다. 최적의 전문가를 뽑기 위해 "Top-K" 규칙을 사용합니다.
  3. 제어 계층 (밸런싱): 이것은 "인사 관리자"입니다. 어떤 전문가가 24시간 내내 일하고 다른 전문가는 잠만 자고 있지 않은지 감시합니다. 만약 "요리사"가 과부하 상태라면, 시스템이 AI의 학습을 망치지 않으면서도 특수한 수학적 기법(예: 보조 손실 제거(Auxiliary-Loss-Free) 밸런싱)을 사용하여 주문을 "제빵사"에게 보내도록 부드럽게 유도할 수 있습니다.
  4. 실행 계층 (전문가 병렬성): 이것은 "물류 팀"입니다. 데이터를 물리적 칩 사이에서 실제로 어떻게 이동시키고, 교통량을 처리하며, 수학적 계산이 빠르게 완료되도록 할지 결정합니다.

논문이 배제하는 것과 제안하는 것

저자는 무엇이 마법의 해결책이 될 수 없는지에 대해 매우 명확하게 밝히고 있습니다. 그들은 모든 MoE 모델에 적용되는 단 하나의 "완벽한" 구조가 있다는 생각에 반대합니다. 단순히 전문가를 더 많이 추가하는 것은 시스템이 데이터를 충분히 빠르게 이동시킬 수 없다면 정답이 아니라고 주장합니다. 또한, Soft MoE(전문가를 하나씩 선택하는 대신 연속적으로 혼합하는 방식)는 이론적으로는 좋아 보이지만, 오늘날 우리가 사용하는 거대한 실제 시스템에서 잘 작동한다는 것이 입증되지 않았다고 지적합니다.

논문은 미래가 **분리(decoupling)**에 있다고 제안합니다. 우리는 "똑똑한 결정"(어떤 전문가를 사용할 것인가)을 "물리적 현실"(그것이 어느 칩에 있는가)과 결합하는 것을 멈춰야 합니다. 저자들은 최고의 시스템이 동적 예산(난이도에 따라 수행되는 작업량 변경)과 런타임 배치(교통 체증을 피하기 위해 실행 중에 전문가를 이동시키는 것)를 사용할 것이라고 제안합니다.

하지만 논문은 이러한 것들이 "해결된" 문제라고 주장하는 데 신중합니다. 예를 들어, 이종 전문가(Heterogeneous Experts)(크기가 서로 다른 전문가들)는 훌륭하게 들리지만, 논문은 이것이 여전히 "연구 프런티어" 단계에 있으며 조 단위 파라미터 모델의 거대한 규모에서 완전히 테스트되지 않았다고 언급합니다. 마찬가지로, 교차 계층 공유(레이어 1의 전문가가 레이어 100을 돕는 것)는 멋진 아이디어이지만, 저자는 이것이 혼란을 일으키지 않고 실제로 작동하는지에 대한 더 많은 증거가 필요하다고 말합니다.

결론

간단히 말해, 이 논문은 AI를 더 똑똑하게 만드는 여정이 단순히 더 큰 두뇌를 만드는 것이 아님을 알려줍니다. 그것은 더 나은 교통 시스템을 만드는 것에 관한 것입니다. 우리는 단 한 대의 버스에서 택시, 지하철, 드론이 얽힌 복잡한 네트워크로 이동해 왔습니다. 다음 단계는 단순히 더 많은 차량을 추가하는 것이 아니라, 교통 신호를 더 똑똑하게 만들고, 도로를 더 유연하게 만들며, 배차원이 출퇴근 시간의 정체를 처리할 수 있도록 만드는 것입니다. 저자는 "차세대" AI가 단일한 새로운 모델이 아니라, 스마트한 라우팅 기법, 동적 예산, 그리고 물리적 최적화가 함께 작동하는 조합이 될 것이라고 결론짓습니다. 이는 초지능 컴퓨터의 세계에서, 때로는 가장 어려운 부분이 '생각하는 것'이 아니라 '도착하는 것'임을 상기시켜 줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →