← 최신 논문
🤖 machine learning

DisagMoE: Computation-Communication overlapped MoE Training via Disaggregated AF-Pipe Parallelism

DisagMoE 는 멀티 스테이지 파이프라인을 통해 어텐션 및 피드포워드 레이어를 별도의 GPU 그룹으로 분리하여 대규모 클러스터에서의 효율성을 향상시키는 새로운 전문가 혼합 (Mixture-of-Experts) 학습 시스템으로, 통신과 계산을 효과적으로 중첩시켜 올-투-올 통신 병목 현상을 극복하고 최대 1.8 배의 학습 속도 향상을 달성합니다.

원저자: Zhichen Zeng, Chi-Chih Chang, Jiayi Wang, Zezhou Wang, Ningxin Zheng, Zheng Zhong, Cesar A. Stuardo, Dongyang Wang, Mohamed S. Abdelfattah, Haibin Lin, Banghua Zhu, Ang Li, Ziheng Jiang

게시일 2026-05-13
📖 3 분 읽기☕ 가벼운 읽기

원저자: Zhichen Zeng, Chi-Chih Chang, Jiayi Wang, Zezhou Wang, Ningxin Zheng, Zheng Zhong, Cesar A. Stuardo, Dongyang Wang, Mohamed S. Abdelfattah, Haibin Lin, Banghua Zhu, Ang Li, Ziheng Jiang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대한 "생각하는 기계"(AI 모델) 를 건설하는 거대하고 고속의 공장을 운영한다고 상상해 보세요. 이 공장에는 두 가지 주요 유형의 근로자가 있습니다:

  1. "컨텍스트" 팀 (Attention): 이 근로자들은 탐정처럼 행동합니다. 그들은 현재까지의 전체 이야기를 살펴보고 무슨 일이 일어나고 있는지 이해합니다. 그들은 생각하는 데 매우 능숙하지만, 많이 이동할 필요는 없습니다.
  2. "전문가" 팀 (Experts/FFN): 이들은 실제 건설자들입니다. 수천 명에 달하지만, 단일 작업에는 소수만 필요합니다. 그들은 무거운 일을 처리하는 데 뛰어나지만 공장 바닥 전체에 흩어져 있습니다.

문제: 교통 체증

이 공장을 운영하던 기존 방식 (Expert Parallelism) 에서는 컨텍스트 팀과 전문가 팀이 같은 방에 갇혀 있었습니다.

다음과 같은 일이 발생했습니다:

  1. 컨텍스트 팀이 생각을 마칩니다.
  2. 그들은 방 건너편의 전문가들에게 외쳐야 했습니다: "저기, 너, 너, 그리고 너! 여기 와서 이 일을 해!"
  3. 전문가들이 작업을 수행합니다.
  4. 그들은 다시 외쳐야 했습니다: "결과가 여기 있습니다!"

문제점은 무엇일까요? "외치는 것"(컴퓨터 간 데이터 전송) 이 느렸습니다. 특히 공장이 거대해지고 근로자들이 다른 층 (서로 다른 서버 노드) 에 있을 때 그랬습니다. 전문가들은 종종 컨텍스트 팀이 외치는 것을 마칠 때까지 기다리며 유휴 상태로 있었고, 그 반대도 마찬가지였습니다. 공장은 교통 체증에 빠져서 일하는 것보다 대화하는 데 더 많은 시간을 보냈습니다.

이 문제를 해결하려는 이전 시도들은 근로자들에게 "일하면서 대화하라"고 말하려는 것과 같았습니다. 하지만 컨텍스트 팀은 (특히 긴 이야기가 있을 때) 생각하는 데 시간이 오래 걸리고, 전문가들은 빠르게 건설하므로 타이밍이 결코 완벽하게 맞지 않았습니다. 항상 숨길 수 없는 여분의 대화 시간이 존재했습니다.

해결책: DisagMoE (분리된 공장)

이 논문의 저자인 DisagMoE는 두 팀이 같은 방에서 일하도록 하려는 시도를 멈추기로 결정했습니다. 대신 그들은 2 단계 조립 라인을 구축했습니다.

1. 팀 분리 (Disaggregation)
그들은 컨텍스트 팀을 한 세트의 기계로, 전문가 팀을 완전히 다른 세트의 기계로 이동시켰습니다.

  • 팀 A (컨텍스트): 모든 "탐정" 레이어가 한 그룹의 컴퓨터에 있습니다.
  • 팀 B (전문가): 모든 "건설자" 레이어가 다른 그룹에 있습니다.

2. 새로운 조립 라인 (AF-Pipe)
혼란스러운 외침 대신, 그들은 매끄러운 일방향 컨베이어 벨트 시스템을 만들었습니다:

  • 컨텍스트 팀은 생각의 한 배치를 마치고 작업을 컨베이어 벨트를 따라 전문가들에게 미끄러뜨립니다.
  • 전문가들이 배치 #1 을 작업하는 동안, 컨텍스트 팀은 이미 배치 #2 를 시작합니다.
  • 전문가들이 배치 #1 을 완료하고 결과를 되돌려 보내는 동안, 컨텍스트 팀은 이미 배치 #3 을 작업하고 있습니다.

이를 파이프라이닝이라고 합니다. 이는 계주 경기와 같아서, 계란봉투가 너무 매끄럽게 전달되어 달리는 선수가 결코 멈추지 않는 것과 같습니다.

3. 스마트 관리자 (Adaptive Allocation)
여기가 교묘한 부분입니다. 이 논문은 컨텍스트 팀과 전문가 팀이 서로 다른 필요를 가진다는 것을 깨달았습니다.

  • 컨텍스트 팀은 무거운 사고를 하는 사람과 같습니다; 그들은 강력한 두뇌 (연산 능력) 가 필요하지만 인터넷 연결 속도는 그렇게 많이 필요하지 않습니다.
  • 전문가 팀은 달리는 사람과 같습니다; 그들은 데이터를 올바른 사람에게 빠르게 전달하기 위해 초고속 고속도로 (네트워크 대역폭) 가 필요합니다.

기존 공장에서는 모두에게 동일한 양의 인터넷과 연산 능력이 주어졌습니다. DisagMoE에서는 관리자가 똑똑합니다. 이야기가 매우 길다면, 그들은 전문가들에게 더 많은 "인터넷 차선"을 제공하고 컨텍스트 팀에게 더 많은 "두뇌 능력"을 할당합니다. 그들은 어느 팀도 다른 팀을 기다리지 않도록 자원을 지속적으로 조정합니다.

결과

팀을 분리하고 관리자가 자원을 조정하게 함으로써, 공장은 메시지 대기 시간을 낭비하지 않게 되었습니다.

  • 속도: 그들은 이 새로운 시스템이 기존 표준 방법보다 훈련 속도를 1.8 배 빠르게 만들었음을 발견했습니다.
  • 효율성: 그들은 컴퓨터가 단순히 "대화"(데이터 대기) 하는 데 보낸 시간을 최대 88% 줄였습니다.

핵심 교훈

이 논문은 문제를 더 빠르게 만들기 위해 단순히 더 많은 인터넷 대역폭을 투입해서는 안 된다고 주장합니다. AI 의 각 부분이 수행하는 특정 작업을 살펴봐야 합니다. "생각"과 "건설"을 분리하고 각 팀에 필요한 정확한 양의 자원을 제공함으로써, 이러한 거대한 AI 모델을 훨씬 더 빠르게 구축할 수 있습니다.

간단히 말해: 그들은 근로자를 분리하고, 더 나은 컨베이어 벨트를 구축하며, 작업량을 정확히 균형 있게 조절하는 방법을 아는 관리자를 고용함으로써, 네모난 못을 둥근 구멍에 억지로 넣으려 하던 시도를 멈췄습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →