← 최신 논문
🤖 machine learning

Fast MoE Inference via Predictive Prefetching and Expert Replication

본 논문은 과부하된 전문가를 예측하고 복제하여 동시 처리를 가능하게 함으로써 거의 완전한 GPU 활용을 달성하고, MoE(Mixture of Experts) 추론 속도를 최대 3 배까지 향상시키면서 베이스라인 모델의 성능 대부분을 유지하는 동적 전문가 복제 전략을 제안한다.

원저자: Ankit Jyothish, Ali Jannesari, Aishwarya Sarkar, Joseph Zuber

게시일 2026-05-13
📖 3 분 읽기☕ 가벼운 읽기

원저자: Ankit Jyothish, Ali Jannesari, Aishwarya Sarkar, Joseph Zuber

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

"전문가 혼합 (MoE)"이라는 거대하고 고속의 레스토랑을 운영한다고 상상해 보세요. 이 레스토랑에는 수백 명의 전문 요리사 (이를 전문가라고 합니다) 가 있는 방대한 메뉴가 있습니다. 각 요리사는 매우 구체적인 요리에 능통한 대가입니다.

고객이 주문하면, 수석 웨이터 (이 라우터) 가 주문을 보고 어떤 특정 요리사가 그 요리를 만들어야 할지 결정합니다. 문제는 대부분의 주문이 인기 있는 몇몇 요리사에게만 몰리는 반면, 나머지 90% 의 요리사들은 빈 조리대를 바라보며 아무것도 하지 않고 앉아 있다는 점입니다.

이로 인해 두 가지 큰 문제가 발생합니다:

  1. 바쁜 요리사들은 압도당합니다: 50 명의 고객이 같은 요리를 주문하면, 그 한 명의 요리사를 기다리기 위해 긴 줄을 서야 합니다.
  2. 휴식 중인 요리사들은 낭비됩니다: 주방은 거대하지만 대부분의 공간과 장비가 비어 있어 돈과 에너지가 낭비됩니다.

구식 방식 vs 새로운 아이디어

구식 방식 (표준 MoE):
주방은 모든 요리사를 동시에 준비시키려 합니다. 하지만 요리사들이 너무 전문화되어 있어, 주방은 빈 조리대로 혼잡해지고 소수의 바쁜 요리사들은 교통 체증에 걸려 버립니다. 레스토랑은 느리게 운영됩니다.

이전의 해결책 (SiDA-MoE):
과학자들은 더 지능적인 방법을 시도했습니다: 고객이 도착하기 전에 어떤 요리사들이 바쁠지 예측하여 오직 그 특정 요리사들만 전선으로 데려오는 방식입니다. 이는 도움이 되었지만, 50 명이 같은 요리를 주문하면 그 소수의 요리사들은 여전히 줄에 갇히게 됩니다.

새로운 해결책 (MoE-MPMC):
이 논문의 저자들은 "예측적 프리페칭 및 전문가 복제" 전략을 제안합니다. 이를 초 조직적인 주방 관리자가 두 가지 일을 수행한다고 생각하세요:

  1. 수정구 (예측적 프리페칭):
    주문이 들어오기를 기다리는 대신, 관리자는 매우 빠르고 간단한 수정구 (이를 SRU, 일종의 AI 모델이라고 합니다) 를 사용하여 다음 고객 배치의 주문을 정확히 예측합니다.
  • 유사점: 매주 화요일 오후 6 시마다 모든 사람이 피자를 주문한다는 것을 아는 요리사처럼, 첫 번째 고객이 들어오기 전인 오후 5 시 55 분에 이미 피자 반죽을 준비하기 시작하는 것과 같습니다.
  1. 클론 군대 (전문가 복제):
    이것이 게임 체인저입니다. 관리자가 50 명이 "매운 타코"를 주문할 것이라고 예측하면, 타코 요리사 한 명만 데려오는 것이 아니라 32 명의 타코 요리사 클론을 즉시 전선으로 데려옵니다.
  • 유사점: 100 개의 상자를 옮겨야 할 때, 한 사람이 하나씩 옮기는 대신 마법처럼 자신을 32 번 복제했다고 상상해 보세요. 이제 32 명의 당신이 동시에 상자를 옮깁니다. 줄은 사라지고 작업은 즉시 완료됩니다.

주방에서의 작동 방식

이 시스템은 두 팀이 동시에 작동합니다:

  • 팀 A (요리사들): 그들은 복제된 요리사들을 사용하여 현재 고객 배치를 서빙하는 데 바쁩니다.
  • 팀 B (예측자들): 팀 A 가 일하는 동안, 팀 B 는 다음 고객 배치를 살펴보고 수정구를 통해 누가 필요할지 예측하며 다음 라운드를 위한 클론들을 준비시킵니다.

클론들이 고객 도착 전에 준비되어 있기 때문에, 고객들은 줄을 서서 기다릴 필요가 없습니다. 주방 (컴퓨터 칩, 즉 GPU) 은 항상 처리할 수 있는 충분한 요리사가 있기 때문에 100% 바쁘게 유지됩니다.

결과

이 논문은 128 개와 256 개의 서로 다른 "요리사"를 가진 거대한 언어 모델 (고급 AI 챗봇의 두뇌와 같은) 에서 이를 테스트했습니다.

  • 속도: 레스토랑은 3 배 더 빨라졌습니다.
  • 효율성: 주방은 1~10% 만 바빴던 것에서 거의 100% 바쁜 상태로 변했습니다. 더 이상 낭비되는 공간이나 휴식 중인 요리사가 없습니다.
  • 품질: 음식 (AI 의 답변) 은 이전과 마찬가지로 훌륭하게 유지되었으며, 정확도는 약 5~10% 만 약간 감소했습니다. 이는 훨씬 빨라지기 위해 치르는 작은 대가입니다.

요약

간단히 말해, 이 논문은 다음과 같습니다: "어떤 전문가가 필요한지 단순히 추측하지 말고, 일찍 추측하고, 많은 사람들이 그 전문가를 필요로 한다고 생각되면 그 전문가를 복제하여 모든 사람이 동시에 서비스를 받도록 하라." 이는 느리고 거친 과정을 매끄럽고 고속의 고속도로로 바꿉니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →