← 最新论文
🤖 AI

SAGA: Workflow-Atomic Scheduling for AI Agent Inference on GPU Clusters

SAGA 是一种分布式调度器,它通过将调度粒度从请求级提升至程序级,在 GPU 集群上优化复合 AI 智能体工作流的效率,尽管峰值吞吐量有所折损,但通过保留中间 KV 缓存状态,将任务完成时间缩短了 1.64 倍。

原作者: Dongxin Guo, Jikun Wu, Siu Ming Yiu

发布于 2026-05-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Dongxin Guo, Jikun Wu, Siu Ming Yiu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你正在运营一个繁忙的厨房(即GPU 集群),其中的厨师(AI 智能体)正试图烹饪复杂的多道菜宴席(AI 任务)。

目前,大多数厨房经理(现有的调度器,如 vLLM)将每一道订单都视为完全独立的一次性事件。如果一位厨师需要切菜,然后等待烤箱预热,接着再切更多蔬菜,经理会强制该厨师:

  1. 烹饪第一批次。
  2. 扔掉所有切好的蔬菜和脏刀具(即KV 缓存),因为厨师正在“等待”烤箱。
  3. 当烤箱准备好时,厨师必须从头开始完全重新切同样的蔬菜。

这种“从头再来”的循环每顿饭会发生数十次。它浪费了海量的时间和空间,使得厨房的运行速度比必要速度慢 3 到 8 倍。

SAGA 是一位改变规则的新厨房经理。它不再关注单个订单,而是将整份食谱视为一个单一单元。以下是它的工作原理,使用简单的类比:

1. “食谱书”(智能体执行图)

SAGA 不再猜测厨师下一步要做什么,而是阅读食谱书(即智能体执行图)。

  • 问题所在:厨师停下来等待烤箱(即“工具调用”)。旧有的经理假设厨师已完成工作,并清空了操作台。
  • SAGA 的解决方案:SAGA 知道食谱上写着:“烤箱完成后,我们需要再次切洋葱。”因此,它告诉厨师:“把切好的洋葱和刀留在操作台上,先别洗。”
  • 结果:当烤箱完成时,厨师直接从刚才停下的地方继续。无需重新切菜。SAGA 的预测如此精准,其表现几乎与一位能预见未来的经理(理论上的“最优”经理)一样完美。

2. “VIP 桌”策略(会话亲和性批处理)

想象一位厨师正在制作一道复杂的 10 道菜宴席。

  • 问题所在:在旧系统中,如果厨师变得忙碌,经理可能会将宴席的下一步指派给不同工位另一位厨师。新厨师必须重新阅读整份食谱并重新切菜,因为他们没有第一位厨师的笔记。
  • SAGA 的解决方案:SAGA 表示:“这整道 10 道菜宴席属于1 号工位的 A 厨师。”即使 A 厨师正在等待烤箱,下一步也为其预留。如果 1 号工位过于拥挤,SAGA 可能会将整个宴席移至新工位,但会带上“笔记”(缓存),这样新厨师就不必从头开始。
  • 结果:厨房保持井然有序,厨师们无需浪费时间重复工作。

3. “公平”规则(智能体公平份额)

想象一家餐厅有两种顾客:

  • 顾客 A:点了一份简单的汉堡(短任务)。
  • 顾客 B:点了一场盛大的 50 道菜宴会(长而复杂的智能体任务)。
  • 问题所在:旧经理通常优先处理汉堡,因为它能快速完成。宴会顾客则无限期等待,感到沮丧。
  • SAGA 的解决方案:SAGA 审视整场宴会。它意识到:“如果我们继续优先供应汉堡,宴会将永远无法完成。”它确保宴会有足够的关注度以按时结束,即使这意味着汉堡需要多等一会儿。它保证每个人都能获得完整的餐食,而不仅仅是快速的小吃。

权衡(“速度 vs. 质量”的平衡)

SAGA 在完成单个复杂宴席方面极其迅速(将任务完成时间缩短了 1.64 倍)。然而,由于它花费时间组织并为下一步做好准备,它无法像那种将一切扔进搅拌机并忽略食谱的经理那样,每小时产出更多总数的宴席。

  • 论文主张:与“快速周转”风格相比,SAGA 在最大原始吞吐量方面大约慢 30%
  • 为何重要:论文认为这是一个良好的权衡。大多数 AI 智能体是交互式的(如编程助手或浏览器机器人),用户关心的是任务完成得有多快,而不是服务器理论上能塞进多少任务。

结果总结

在真实的 64 台 GPU 超级计算机上进行测试时:

  • 速度:任务完成速度比当前最佳标准(带前缀缓存的 vLLM)快 1.64 倍
  • 内存:厨房对其操作台空间(GPU 显存)的利用率提高了 22%,这意味着它能在不耗尽空间的情况下处理更复杂的食谱。
  • 可靠性:即使厨房混乱拥挤,99.2% 的任务也能在承诺的时间限制内完成。

简而言之,SAGA 阻止 AI 智能体在每次暂停时丢弃他们的工作,确保它们能直接从刚才停下的地方继续,从而使复杂的 AI 任务感觉更加敏捷和可靠。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →