← 최신 논문
🤖 machine learning

EasyBalance: Cross-Layer Load Balancing in Distributed MoE Inference

EasyBalance는 전문가 복제, 마이그레이션 또는 전문가-장치 매핑의 수정 없이 레이어 간에 워크로드를 탐욕적으로 스케줄링하고 지연시킴으로써, 불균형한 라우팅 분포로 인해 발생하는 GPU 유휴 상태를 완화하는 분산 혼합 전문가(Mixture-of-Experts, MoE) 추론을 위한 교차 레이어 부하 분산 전략입니다.

원저자: Yize Wu, Ke Gao, Ling Li, Yanjun Wu

게시일 2026-08-11
📖 5 분 읽기🧠 심층 분석

원저자: Yize Wu, Ke Gao, Ling Li, Yanjun Wu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 수천 명의 학생(토큰)들이 거대한 백과사전에서 답을 찾아야 하는 거대하고 고속인 도서관을 운영하고 있다고 상상해 보십시오. 이 백과사전은 한 사람이 쓴 것이 아닙니다. 이것은 "전문가 혼합(Mixture of Experts, MoE)" 모델로, 내부에는 수백 명의 서로 다른 전문 분야를 가진 작가(전문가)들이 있습니다. 학생이 질문을 던지면, 똑똑한 사서(라우터)는 어떤 몇 명의 작가가 답변에 가장 적합한지 빠르게 결정합니다. 이 과정을 매우 빠르게 만들기 위해, 도서관은 이 작가들을 여러 대의 컴퓨터(장치)에 나누어 병렬로 배치합니다.

하지만 문제가 하나 있습니다. 모든 질문이 다 같은 것은 아닙니다. 때때로 엄청난 인파의 학생들이 특정 작가 한 명만이 답을 알고 있는 질문을 쏟아낼 때가 있습니다. 그러면 그 작가가 있는 컴퓨터는 과부하가 걸려 느려지는 반 반면, 다른 컴퓨터들은 할 일이 적은 작가들을 데리고 있어 손을 놀리며 기다리기만 합니다. 이 "기다림의 게임"은 엄청난 에너지와 시간을 낭비합니다. 수년 동안 해결책은 더 많은 작가를 고용하거나 그들을 이동시키는 것이었지만, 이는 메모리를 너무 많이 차지하며 실시간으로 수행하기에는 어렵습니다.

여기에 EasyBalance라는 영리한 새로운 전략이 등장하여, 새로운 사람을 고용하거나 가구를 옮기지 않고도 이 기다림의 문제를 해결합니다. EasyBalance는 작가들을 수정하는 대신, 학생들이 질문을 던지는 시기를 바꿉니다. 이 방식은 도서관이 보통 레이어(층) 단위로 질문을 처리하지만, 실제로는 서로 다른 레이어에서 온 학생들을 동시에 작업할 수 있다는 점을 깨달았습니다. 이 그룹들을 혼합하고 조합함으로써, 한 그룹의 "무거운" 질문이 다른 그룹의 "가벼운" 질문에 의해 균형을 맞추게 되어, 바쁜 작가들에게 휴식을 줄 수 있습니다. 결과적으로 컴퓨터는 계속 바쁘게 돌아가고, 기다리는 시간은 사라지며, 전체 도서관은 훨씬 더 빠르게 운영됩니다.

문제점: "가장 느린 자를 기다려라"라는 규칙

AI 세계, 특히 이러한 "전문가 혼합(MoE)" 모델에서 시스템은 매우 효율적으로 설계되어 있습니다. 데이터마다 아주 적은 수의 "전문가"만을 활성화하기 때문입니다. 하지만 여러 개의 그래픽 카드(GPU)에 전문가들이 분산되어 있는 분산 환경에서는 상황이 엉망이 됩니다.

모두가 자신의 단계를 마칠 때까지 다음 주자에게 바톤을 넘겨주는 계주 경기를 상상해 보십시오. 만약 한 주자가 무거운 배낭(토큰이 너무 많은 "핫" 전문가)을 메고 있다면, 그는 팀 전체를 느리게 만듭니다. 가벼운 짐을 운반한 다른 주자들은 일을 끝냈음에도 불구하고 가만히 서서 기다려야 합니다. 논문에서는 이를 **부하 불균형(load imbalance)**이라고 부릅니다. 시스템은 단 하나의 가장 느린 장치에 의해 병목 현상이 발생하며, 이로 인해 다른 장치들은 유휴 상태(idle)로 남게 됩니다.

이를 해결하기 위한 이전의 시도들은 전문가 복제(바쁜 작가의 복사본을 추가로 고용하는 것)나 전문가 이동(작가를 다른 컴퓨터로 옮기는 것)을 포함했습니다. 이러한 방법들은 효과적이지만, 메모리를 많이 소모하고 통신에 추가 시간이 걸리며 구조가 경직되어 있다는 큰 단점이 있습니다. 만약 도서관에 들어오는 질문의 유형(태스크)이 바뀌면, 기존의 계획은 완전히 실패할 수도 있습니다.

해결책: EasyBalance

이 논문의 저자인 Yize Wu와 동료들은 EasyBalance라고 불리는 신선한 접근 방식을 제안합니다. 그들의 핵심 아이디어는 작가를 컴퓨터에 매핑하는 방식을 고치는 것이 아니라, 작업의 *스케줄(일정)*을 고치는 것입니다.

그들은 두 가지 핵심 통찰에 의존합니다:

  1. 교차 레이어 중복성(Cross-Layer Redundancy): 모델의 특정 레이어가 특정 전문가 세트를 가지고 있더라도, 다른 레이어의 전문가들도 이미 컴퓨터 메모리에 준비된 상태로 들어 있습니다. 그들은 현재 태스크를 위해 "자연스럽게 중복된" 존재들입니다. 새로운 복사본을 고용할 필요 없이, 이미 가지고 있는 것을 사용하기만 하면 됩니다.
  2. 워크로드 조합(Workload Combination): 논문은 모델의 서로 다른 레이어에서 온 마이크로 배치(작은 질문 그룹)를 동시에 실행할 수 있다고 제안합니다. 모델이 보통 한 번에 하나의 레이어를 처리함에도 불구하고, 이 그룹들을 결합하는 것은 수학적으로 안전하며 오히려 더 나은 경우가 많습니다. 예를 들어, 그룹 A가 컴퓨터 1에서 무거운 부하를 가지고 있지만, 그룹 B가 컴퓨터 2에서 무거운 부하를 가지고 있다면, 이들을 함께 실행함으로써 전체 무게를 균형 있게 맞출 수 있습니다. 두 그룹이 모두 동일한 컴퓨터에 몰리는 "최악의 시나리오"는 컴퓨터 수가 늘어날수록 통계적으로 매우 드뭅니다.

작동 방식: "스마트 스케줄러"

EasyBalance는 스마트한 교통 관제사 역할을 합니다. 레이어 1의 모든 학생을 먼저 보내고 그다음 레이어 2를 보내는 대신, 현재의 인파를 살펴봅니다. 그리고 여러 레이어에서 온 학생들을 섞어서 함께 실행합니다.

  • 이 방식은 즉시 실행할 마이크로 배치의 하위 집합을 선택합니다.
  • 병목 현상을 일으킬 것 같은 그룹은 뒤로 미룹니다(대기시킵니다).
  • 이 과정에서 어떤 전문가가 어느 컴퓨터에 살고 있는지 변경하지 않습니다.

이는 시스템이 새로운 유형의 태스크에 직면하더라도 하드웨어나 메모리를 재구성할 필요 없이 즉각적으로 적응할 수 있음을 의미합니다. 마치 식당 주방에서 그릴이 바쁘면 그릴의 요리가 다 끝날 때까지 샐러드를 기다리는 것이 아니라, 그릴은 바쁘지만 샐러드 스테이션은 여유가 있으므로 버거와 샐러드를 동시에 조리하기로 결정하는 것과 같습니다.

결과: 더 빠르고 낭비가 적음

연구진은 Qwen3-30BMoonlight-16B를 포함한 여러 대형 모델을 8개의 GPU에서 테스트했습니다. 이들은 독해 이해와 코드 생성 등 다양한 유형의 작업을 다루는 LongBench 벤치마크를 사용했습니다.

결과는 일관되고 인상적이었습니다:

  • 유휴 시간 감소: EasyBalance는 GPU "저활용(under-utilization)"(컴퓨터가 아무것도 하지 않고 보내는 시간)을 대부분 40% 이상 줄였습니다. 많은 경우, 유휴 시간은 약 0.35(35% 낭비)에서 약 0.2(20% 낭비)로 떨어졌습니다.
  • 빠른 추론: 컴퓨터들이 서로를 기다리지 않았기 때문에, 답변을 얻기까지의 총 시간(end-to-end latency)이 크게 단축되었습니다.
  • 유연성: 전문가를 미리 설정하기 위해 특정 태스크를 미리 알아야 했던 이전 방식들과 달리, EasyBalance는 상식적인 퀴즈부터 코드 생성까지 테스트된 13가지 모든 태스크에서 동일하게 잘 작동했습니다.

또한 연구진은 다양한 "스케줄링" 전략(시스템이 그룹을 어떻게 섞을지 결정하는 방법)을 탐구했습니다. 그들은 모든 GPU의 사용량을 최대화하려는 MaxUtil 전략이 가장 효과적이라는 것을 발견했지만, 심지 even 더 단순하고 빠른 전략인 CumUtil(배치가 도움이 되는 경우 하나씩 추가하는 방식)조차 아무것도 하지 않는 것보다는 훨씬 나은 성능을 보였습니다.

왜 중요한가

EasyBalance의 가장 흥ente한 점은 추가적인 메모리나 복잡한 재설정을 요구하지 않는다는 것입니다. 이는 기존 설정을 그대로 활용합니다. AI 모델이 커지고 복잡해질수록, 일부 컴퓨터가 다른 컴퓨터를 기다리는 문제는 더욱 악화될 것입니다. 이 논문은 우리가 전문가를 어디에 둘 것인가가 아니라, 작업을 언제 실행할 것인가에 대해 더 똑똑하게 생각함으로써, 이러한 거대 AI 시스템을 훨씬 더 효율적으로 만들 수 있다는 것을 보여줍니다.

저자들은 이 방법이 매우 효과적이지만, 무거운 부하가 항상 동시에 같은 컴퓨터에 몰리지 않을 것이라는 통계적 가능성에 기반하고 있다고 언급했습니다. 다양한 모델과 태스크에 대한 테스트에서, 이 전략은 추론 속도를 지속적으로 가속화했으며, 이는 때때로 병목 현상을 해결하는 최선의 방법은 작업자를 옮기는 것이 아니라, 작업자들이 결승선을 향해 서로를 돕도록 만드는 것임을 증명했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →