← 最新论文
🤖 machine learning

GF-DiT: Scheduling Parallelism for Diffusion Transformer Serving

GF-DiT 是一种策略可编程的运行时,它通过将 GPU 并行性视为一种动态可调度的资源,利用异步执行和无组集体通信(group-free collectives)来适应工作负载的异构性,从而增强 Diffusion Transformer 的推理效率,并与静态并行方法相比,显著提升吞吐量、延迟和服务质量。

原作者: Xinwei Qiang, Yifan Hu, Shixuan Sun, Jing Yang, Han Zhao, Chen Chen, Yu Feng, Jingwen Leng, Minyi Guo

发布于 2026-07-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Xinwei Qiang, Yifan Hu, Shixuan Sun, Jing Yang, Han Zhao, Chen Chen, Yu Feng, Jingwen Leng, Minyi Guo

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个繁忙的餐厅厨房,厨师们正试图烹饪复杂的、多道菜式的餐点(就像 Diffusion Transformers 生成图像或视频一样)。在旧有的厨房运行方式中,一旦顾客下单,经理就会为该订单分配一个固定的团队,并在整个烹饪过程中一直使用这支队伍。

如果一位顾客订购了一份极其庞大的十道菜宴席,经理可能会分配 8 名厨师去处理。如果另一位顾客只点了一份简单的沙拉,他们也可能得到 8 名厨师,或者这 8 名厨师可能会被困在那里,必须等待宴席完成后才能去帮忙。这就是目前系统所使用的“静态”方法:一个团队,一种规模,始终如一。

这篇论文介绍了 GF-DiT,这是一种全新的厨房运行方式,它将分配给某道菜的厨师数量视为可以随时变化的资源。

以下是其工作原理的拆解,通过简单的概念进行说明:

1. 问题所在:“卡顿”的厨房

在旧系统中,如果一个长期的、复杂的视频生成请求(即“宴席”)开始烹饪,它会全程占用一大支 GPU 团队(厨师)。

  • 瓶颈: 当这支庞大的团队正在忙于一项长任务时,突然涌入了一波短小、简单的请求(比如快速的文本生成图像提示词)。这些请求必须排队等待,即使那支庞大的团队在某些时刻其实并没有进行重度作业。
  • 浪费: 有时,一个小任务会被分配给一个庞大的厨师团队。厨师们最终会因为互相等待传递食材而闲置,从而浪费能源并降低效率。

2. 解决方案:弹性并行(“动态用工”系统)

GF-DiT 改变了规则。它不再分配固定团队,而是将厨师(GPU)的数量视为一种灵活的资源,可以瞬间进行重新分配。

  • 类比: 想象一位聪明的厨房经理,他会观察烹饪进度。当“宴席”进入到只需要一名厨师切菜的阶段时,经理会立即抽调 7 名厨师去帮助“沙拉”客户。一旦宴席需要煎牛排(重度步骤)时,那些厨师又会被立刻召回。
  • 结果: 短请求能够立即得到响应,因为它们不会被长请求阻塞。长请求在需要时仍能获得帮助,但不会在不需要时霸占资源。

3. 他们是如何实现的:“神奇的剪贴板”

你可能会问:“如果不重新介绍,真的能这么快地移动厨师而不掉落食物或造成混乱吗?”
论文引入了一个巧妙的技巧,叫做 无组集通信 (Group-Free Collectives)

  • 旧方法(“进程组”): 传统上,为了让一组厨师互相传递托盘,你必须花费很长时间(数百毫秒)进行正式的介绍、发放名牌并建立通信线路。如果你每次移动一名厨师都要这样做,厨房就会为了说声“你好”而停工数小时。
  • GF-DiT 的方法(“逻辑描述符”): GF-DiT 跳过了正式的介绍环节。它使用一种轻量级的“逻辑描述符”(就像一个快速的心理笔记或数字剪贴板),上面写着:“厨师 0 和 厨师 1 现在正在一起工作。”
    • 神奇之处: 这种设置仅需微秒级(0.06 毫秒),而不是数百毫秒。它速度极快,以至于厨房无需停下来进行团队介绍;他们只需直接开始协作即可。

4. “轨迹”概念

该系统之所以有效,是因为 Diffusion Transformers(AI 模型)具有可预测的结构。它们不仅仅是在“烹饪”,而是遵循特定的路径(轨迹)进行步骤:

  1. 准备: 读取提示词(编码器 Encoder)。
  2. 烹饪: 通过逐步细化图像来进行繁重的核心工作(去噪 Denoising)。
  3. 摆盘: 将最终结果转化为可观看的图像(解码器 Decoder)。

GF-DiT 将烹饪过程分解为这些小的、独立的步骤。在每个步骤结束时,系统会暂停极短的一瞬间并询问:“接下来的步骤我们还需要 8 名厨师吗?还是可以减到 2 名?” 这使得系统能够完美地适应当前的需求。

5. 结果:一个更快的厨房

作者在真实的图像和视频生成任务上测试了该系统。与传统的“固定团队”方法相比,GF-DiT 实现了:

  • 6 倍的吞吐量: 厨房在相同时间内可以服务 6 倍数量的顾客。
  • 平均等待时间缩短 95%: 顾客能更快拿到他们的“食物”。
  • 减少了 90% 的错过截止时间情况: 几乎没有订单会延迟交付。
  • 近乎瞬时的设置: 重新组织团队所需的时间从接近一秒(778 毫秒)降至极小的微秒级(60 微秒)。

总结

GF-DiT 是一个智能的 AI 图像和视频生成操作系统。它不再将计算能力视为固定的分配,而是将其视为一种灵活的劳动力。通过使用这种超快速的“无需介绍即可通信”的方法,它可以立即将资源重新分配到最需要的地方,确保短任务不会被长任务阻塞,同时确保大型任务在需要时获得动力,而不会造成浪费。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →