← 최신 논문
🤖 machine learning

GF-DiT: Scheduling Parallelism for Diffusion Transformer Serving

GF-DiT는 GPU 병렬성을 동적으로 스케줄링 가능한 자원으로 취급하여 비동기 실행과 그룹 프리 컬렉티브(group-free collectives)를 활용함으로써 워크로드 이질성에 적응하고, 정적 병렬성 방식에 비해 처리량, 지연 시간 및 서비스 품질을 크게 향상시키는 정책 프로그래밍 가능 런타임입니다.

원저자: Xinwei Qiang, Yifan Hu, Shixuan Sun, Jing Yang, Han Zhao, Chen Chen, Yu Feng, Jingwen Leng, Minyi Guo

게시일 2026-07-03
📖 4 분 읽기☕ 가벼운 읽기

원저자: Xinwei Qiang, Yifan Hu, Shixuan Sun, Jing Yang, Han Zhao, Chen Chen, Yu Feng, Jingwen Leng, Minyi Guo

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

바쁜 레스토랑 주방을 상상해 보세요. 요리사들은 복잡한 다코스 요리(Diffusion Transformer가 이미지나 비디오를 생성하는 것과 같은)를 만들려고 노력 중입니다. 기존의 방식에서는 고객이 주문을 하면, 매니저는 그 주문이 완료될 때까지 해당 주문에 전담할 고정된 요리사 팀을 배정합니다.

만약 고객이 거대한 10코스 연회를 주문하면, 매니저는 그 주문에 8명의 요리사를 배정할 수도 있습니다. 반면 다른 고객이 간단한 샐러드를 주문하면 그들에게도 8명의 요리사가 배정될 수 있으며, 혹은 8명의 요리사가 연회가 끝날 때까지 기다리느라 다른 사람을 도울 수 없는 상태가 될 수도 있습니다. 이것이 현재 시스템에서 사용되는 "정적(static)" 방식입니다: 하나의 팀, 하나의 크기, 영원히.

이 논문은 이 주방을 운영하는 새로운 방법인 GF-DiT를 소개합니다. 이는 요리에 배정되는 요리사의 수를 실시간으로 변경할 수 있는 방식으로 취급합니다.

다음은 이 기술을 쉬운 개념들로 나누어 설명한 것입니다.

1. 문제점: "멈춰버린" 주방

기존 시스템에서는 길고 복잡한 비디오 생성 요청(거대한 연회)이 시작되면, 그 과정 내내 큰 규모의 GPU 팀(요리사)을 붙잡고 있게 됩니다.

  • 병목 현상: 이 큰 팀이 긴 작업을 수행하는 동안, 짧고 간단한 요청들(예: 빠른 텍-투-이미지 프롬프트)이 몰려오면 이들은 줄을 서서 기다려야 합니다. 큰 팀이 무거운 작업을 하지 않는 순간에도 말이죠.
  • 낭비: 때로는 작은 작업에 너무 큰 요리사 팀이 주어지기도 합니다. 요리사들은 서로 재료를 전달하기 위해 기다리며 에너지를 낭비하고 속도를 늦추게 됩니다.

2. 해결책: 탄력적 병렬성 (The "Dynamic Staffing" System)

GF-DiT는 규칙을 바꿉니다. 고정된 팀을 배정하는 대신, 요리사(GPU)의 수를 유연한 자원으로 취급하여 즉각적으로 재배치할 수 있게 합니다.

  • 비유: 스마트한 주방 매니저가 요리 진행 상황을 지켜보고 있다고 상상해 보세요. 연회가 채소를 다듬는 단계에 이르러 요리사가 한 명만 필요해지면, 매니저는 즉시 7명의 요리사를 빼서 "샐러드" 고객들을 돕게 합니다. 그러다 연회가 스테이크를 굽는 단계(무거운 단계)가 되면, 다시 그 요리사들을 불러들입니다.
  • 결과: 짧은 요청들은 긴 요청에 의해 가로막히지 않고 즉시 처리됩니다. 긴 요청들 또한 필요한 순간에 필요한 도움을 받으면서도, 필요하지 않을 때는 자원을 독점하지 않습니다.

3. 어떻게 가능하게 했나: "마법의 클립보드"

"정말로 요리사들을 떨어뜨리거나 혼란을 주지 않고 그렇게 빠르게 옮길 수 있나요?"라고 물을 수 있습니다.
이 논문은 Group-Free Collectives라는 영리한 트릭을 소개합니다.

  • 기존 방식 (The "Process Group"): 전통적으로 요리사 그룹이 서로 쟁반을 주고받게 하려면, 수백 밀리초 동안 정식으로 서로를 소개하고, 이름표를 나눠주고, 통신 라인을 설정하는 등의 긴 시간이 필요했습니다. 만약 매번 요리사를 옮길 때마다 이 과정을 거친다면, 주방은 인사를 나누기 위해 몇 시간씩 멈춰 서 있어야 할 것입니다.
  • GF-DiT 방식 (The "Logical Descriptor"): GF-DiT는 이러한 정식 절차를 건너뜁니다. 대신 가벼운 "논리적 디스크립터(logical descriptor)"(마치 빠른 메모나 디지털 클립보드와 같은 것)를 사용하여 "요리사 0과 요리사 1이 이제 함께 일한다"라고 지정합니다.
    • 마법 같은 점: 이 설정은 수백 밀리초가 아닌 마이크로초(0.06 밀리초) 만에 이루어집니다. 이 설정은 너무 빨라서 주방이 팀을 소개하기 위해 멈출 필요 없이, 즉시 함께 일을 시작할 수 있습니다.

4. "궤적(Trajectory)" 개념

이 시스템이 작동하는 이유는 Diffusion Transformer(AI 모델)가 예측 가능한 구조를 가지고 있기 때문입니다. 이들은 단순히 "요리"하는 것이 아니라 특정 경로(궤적)를 따릅니다:

  1. 준비: 프롬프트를 읽음 (Encoder).
  2. 요리: 단계별로 이미지를 정교화하는 핵심 작업 (Denoising).
  3. 플레이팅: 최종 결과를 볼 수 있는 이미지로 변환 (Decoder).

GF-DiT는 이 요리 과정을 작고 독립적인 단계들로 나눕니다. 매 단계가 끝날 때마다 시스템은 아주 잠깐 멈추어 질문합니다: "다음 단계를 위해 여전히 8명의 요리사가 필요한가, 아니면 2명으로 줄여도 되는가?" 이를 통해 시스템은 현재 수요에 완벽하게 적응할 수 있습니다.

5. 결과: 훨씬 더 빠른 주방

저자들은 실제 이미지 및 비디오 생성 작업에서 이 시스템을 테스트했습니다. 기존의 "고정 팀" 방식과 비교했을 때, GF-DiT는 다음과 같은 성과를 거두었습니다:

  • 6배 더 높은 처리량(Throughput): 주방은 동일한 시간 동안 6배 더 많은 고객에게 음식을 제공할 수 있습니다.
  • 평균 대기 시간 95% 단축: 고객들은 훨씬 더 빨리 음식을 받게 됩니다.
  • 마감 미준수 사례 90% 감소: 거의 모든 주문이 늦지 않게 도착합니다.
  • 즉각적인 설정: 팀을 재편성하는 데 걸리는 시간이 거의 1초(778 ms)에서 아주 작은 밀리초 단위(60 µs)로 줄어들었습니다.

요약

GF-DiT는 AI 이미지 및 비디오 생성기를 위한 스마트한 운영 체제입니다. 이는 컴퓨팅 파워를 고정된 할당량으로 취급하는 대신, 유연한 노동력으로 취급합니다. "소개가 필요 없는" 초고속 통신 방식을 사용하여, 자원을 가장 필요한 곳에 즉시 재배정함으로써 짧은 작업이 긴 작업 뒤에 갇히지 않도록 하고, 큰 작업은 낭비 없이 필요한 힘을 얻을 수 있도록 보장합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →