← 최신 논문
🤖 AI

X-Stage: An Overlooked Pipeline Stage for Communication-Computation Overlap in DiT Inference

이 논문은 디바이스 주도의 원격 스토어(remote store)가 완료되기 전에 진행되는, DiT 추론에서 간과되었던 "X-Stage" 파이프라인 단계를 식별하고, 이러한 통찰을 Burst-Gap 모델을 통해 활용함으로써 데이터 이동과 연산을 효과적으로 중첩시키고 백프레셔(backpressure)를 방지하여 분산 추론을 크게 가속화하는 융합 통신-연산 커널을 재설계한다.

원저자: Jianwen Xian, Zhiyuan Xu, Yuchen Li, Ziliang Lai, Kang He, Zhen Huang, Aichen Feng, Jinyan Chen, Yilin Zhang, Qinqin Chen, Chengru Song

게시일 2026-07-28
📖 4 분 읽기☕ 가벼운 읽기

원저자: Jianwen Xian, Zhiyuan Xu, Yuchen Li, Ziliang Lai, Kang He, Zhen Huang, Aichen Feng, Jinyan Chen, Yilin Zhang, Qinqin Chen, Chengru Song

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 수천 대의 로봇이 복잡한 구조물을 만들고 있는 거대하고 고속인 공장을 운영하고 있다고 상상해 보십시오. 이 공장에서 로봇들은 두 가지 주요 업무를 수행합니다: 생각하기(계산 수행)와 말하기(다른 로봇들에게 설계도를 전송). 오랫동안 공장 관리자들은 이 두 업무가 엄격한 순서대로 이루어져야 한다고 생각했습니다. 즉, 로봇이 생각을 마치면 멈추고, 다른 로봇들이 메시지를 받을 때까지 기다린 다음, 그제야 다시 생각을 시작해야 한다는 것이었습니다. 이 대기 시간은 엄청난 낭비였으며, 공장 전체의 속도를 늦추는 원인이 되었습니다.

최근 엔지니어들은 로봇이 생각하는 동안에도 말할 수 있는 방법을 발견했습니다. 로봇이 공장의 고속 네트워크로 메시지를 외치기만 하면, 메시지가 반대편 끝에 도착할 때까지 기다릴 필요 없이 즉시 다음 설계도 작업을 시작할 수 있다는 것을 발견한 것입니다. 하지만 여기에는 함정이 있습니다. 공장의 네트워크는 한 번에 처리할 수 있는 "비행 중인(in-flight)" 메시지의 수가 제한되어 있습니다. 만약 로봇이 멈추지 않고 너무 빠르게 많은 메시지를 외치면, 네트워크가 막히고, 외치는 로봇이 갇히게 되어 공장 전체가 멈춰버립니다. 과학자들의 큰 고민은 이것이었습니다: 공장이 막히지 않고 최고 속도로 계속 돌아가게 하려면 정확히 언제 외치고 언제 멈춰야 하는가?

"X-Stage: DiT 추론에서 통신-연산 중첩을 위해 간과되었던 파이프라인 단계"라는 제목의 이 논문은 바로 그 문제를 깊이 파고듭니다. 연구진은 Diffusion Transformer(DiT)라고 불리는 고급 AI 모델을 연구하던 중, 통신 시스템에서 아무도 주목하지 않았던 숨겨진 "대기실"을 발견했습니다. 그들은 이를 X-Stage라고 부릅니다.

X-Stage를 로봇의 입과 수신자의 귀 사이를 잇는 마법 같은 컨베이어 벨트라고 생각해 보십시오. 로봇이 "원격 저장(remote store)"(다른 로봇에게 데이터를 보내는 세련된 방식)을 실행하면, 메시지는 이 X-Stage에 진입합니다. 논문에 따르면, 일단 메시지가 이 벨트에 올라타면 로봇은 즉시 새로운 계산 작업을 수행할 수 있는 자유를 얻습니다. 메시지는 로봇이 새로운 수학 계산을 하는 동안에도 스스로 벨트를 따라 계속 이동합니다. 연구진은 만약 메시지가 비워지는 속도보다 더 빠르게 메시지를 계속 외친다면 벨트가 가득 차게 되고, 결국 로봇은 멈춰야 한다는 사실을 깨달았습니다. 하지만 외치는 타이밍을 완벽하게 맞춘다면, 즉 한 번의 메시지 묶음을 외친 뒤, 이전 메시지들이 벨트에서 빠져나가는 동안 잠시 생각을 하는 시간을 갖는다면, 공장을 최대 속도로 계속 가동할 수 있습니다.

완벽한 타이밍을 찾아내기 위해 연구팀은 버스트-갭(Burst–Gap) 모델이라는 간단한 수학적 모델을 구축했습니다. 당신이 움직이는 트럭 안으로 공을 던지고 있다고 상상해 보십시오.

  • 버스트(The Burst): 당신은 한 움큼의 공(데이터)을 매우 빠르게 던집니다.
  • 갭(The Gap): 당신은 트럭이 공들을 실어 나르는 동안 던지는 것을 멈추고 다른 일(예: 생각하기)을 합니다.
  • 배출율(The Drain Rate): 트럭이 공들을 얼마나 빨리 실어 나를 수 있는지의 속도입니다.
  • 용량(The Capacity): 트ら이 움직임을 멈추기 전까지 담을 수 있는 공의 개수입니다.

연구진은 특정 유형의 강력한 컴퓨터 칩에서 "트럭"(네트워크)이 얼마나 빨리 움직이고 "공"(데이터)을 얼마나 많이 담을 수 있는지 정확히 측정했습니다. 그들은 만약 공을 너무 빠르게 많이 던지면 트럭이 막히고 기다려야 한다는 것을 발견했습니다. 하지만 한 번의 버스트를 던진 후, 트럭이 공간을 확보할 만큼 충분히 기다렸다가 다음 버스트를 던진다면, 작업 중에 한 번도 멈추지 않고 다음 버스트를 즉시 던질 수 있습니다.

이 모델을 사용하여, 팀은 두 가지 특정 AI 공정 부분을 매우 효율적으로 재설계했습니다.

첫째, 그들은 MegaMoE라고 불리는 시스템을 살펴보았습니다. 이는 서로 다른 종류의 업무를 처리하는 전문가 팀과 같습니다. 이전에는 로봇들이 한 가지 업무를 마치고 모든 메시지를 한꺼번에 외친 다음 기다렸습니다. 이는 교통 체증을 유발했습니다. 연구진은 스케줄을 변경하여, 한 그룹의 로봇이 업무를 마치고 메시지를 외치는 동안, 다른 그룹이 다른 업무를 시작하도록 했습니다. 이 "인터리빙(interleaving, 교차 실행)" 방식은 외치는 행위가 작고 관리 가능한 버스트 형태로 일어나게 하여, 네트워크가 비워질 수 있는 충분한 생각 시간을 확보해 주었습니다. 이 간단한 변화로 인해 시스템은 평균 1.18배 빨라졌으며, 최선의 경우 최대 1.62배까지 빨라졌습니다.

둘째, 그들은 긴 시퀀스의 데이터(예: 긴 이야기)를 처리하는 방법인 FlashAttention을 다루었습니다. 그들은 "생각하기" 부분과 "보내기" 부분을 결합하여, 메시지를 보내는 로봇이 멈추지 않도록 했습니다. 메시지가 비워지기를 기다리기만 하는 전담 로봇을 두는 대신, 이미 수학 계산을 하고 있는 로봇이 메시지를 보내고 즉시 다시 수학 계산으로 돌아가게 했습니다. "X-Stage" 컨베이어 벨트가 백그라운드에서 메시지 전달을 처리하게 된 것입니다. 이 접근 방식은 기존의 순차적 방식에 비해 한 버전에서는 1.43배, 다른 버전에서는 1.42배 더 빠른 속도를 보여주었습니다.

이 논문은 이것이 단순한 마법이 아니라 정밀한 측정임을 매우 신중하게 밝히고 있습니다. 만약 X-Stage를 무시하고 로봇이 메시지가 도착할 때까지 기다려야 한다고 가정한다면, 시스템이 얼마나 빨라질 수 있는지 과소평가하게 될 것입니다. 반대로 로봇이 멈추지 않고 영원히 달릴 수 있다고 가정한다면, 결국 네트워크를 충돌시키게 될 것입니다. "버스트-갭" 모델은 그 중간의 최적의 지점입니다.

요약하자면, 연구진은 컴퓨터들이 서로 소통하는 방식에서 숨겨진 "사이 단계"를 찾아냈습니다. 메시지가 얼마나 빨리 이동하고 얼마나 많은 공간을 차지하는지 정확히 측정함으로써, 그들은 컴퓨터가 업무와 대화를 완벽하게 조절하며 수행하도록 가르쳤습니다. 멈춰서 기다리는 대신, 컴퓨터는 메시지를 보내고, 메시지가 이동하는 동안 일부 작업을 수행한 다음, 첫 번째 메시지가 길을 비켜주는 즉시 다음 메시지를 보낼 수 있게 되었습니다. 이 작은 타이밍의 조정은 새로운 하드웨어 없이도 AI 모델을 더 빠르고 효율적으로 실행하게 만드는 엄청난 속도 향상을 가져옵니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →