← 最新论文
🤖 AI

Towards Multi-Model LLM Schedulers: Empirical Insights into Offloading and Preemption

本文提出了一项实证研究,揭示在异构硬件上调度多模型大语言模型时,CPU-GPU 卸载会导致显著的、依赖于模型的性能下降,而由状态重载引发的抢占开销亦十分巨大,从而为设计高效下一代调度器确定了关键因素。

原作者: Mert Yildiz, Pietro Spadaccino, Alexey Rolich, Francesca Cuomo, Andrea Baiocchi

发布于 2026-05-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Mert Yildiz, Pietro Spadaccino, Alexey Rolich, Francesca Cuomo, Andrea Baiocchi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你经营着一间繁忙的厨房(一台计算机服务器),里面有几位超级快的厨师(GPU)和一位速度较慢但空间非常宽敞的 pantry 助手(CPU)。你的目标是同时烹制许多不同类型的复杂菜肴(大型语言模型或 LLM)。有时,厨房会变得如此拥挤,以至于快厨师们连操作台都不够用了,这时你就得请 pantry 助手帮忙拿一些食材,甚至帮忙切菜。

这篇论文就像是对以下两种情况的详细研究:当你尝试在快厨师和慢助手之间分配烹饪工作时,或者当你不得不突然停止一道菜去烹制一道更紧急的菜时会发生什么。

以下是这项研究的主要发现,用简单的方式解释如下:

1. “半职厨师”问题(卸载)

当一道菜太大,厨师的操作台放不下时,你会把食谱中的某些步骤移到 pantry 助手那里去。

  • 发现: 这并非平滑的权衡。如果你只把一点点工作移交给慢助手,烹饪速度并不会只是略微下降,而是会急剧暴跌。
  • 类比: 这就像一场接力赛。如果快跑者(GPU)即使只有一小段路也要把接力棒交给慢走者(CPU),整个团队的速度都会急剧下降。
  • 意外之处: 小份菜肴(较小的 AI 模型)受影响最大。如果你尝试卸载一个小模型的一小部分,它的速度会变得非常慢。而大份菜肴(更大的模型)则能更好地应对这种分割,速度下降得更为平缓。
  • 教训: 你不能随意猜测该给 CPU 分配多少工作。你必须确切知道你在烹制哪道“菜”,因为有些模型比其他模型更讨厌被分割。

2. “切换成本”(抢占)

有时,一位 VIP 顾客点了一道新菜,你不得不让当前的厨师停下来,清理他们的工作台,然后开始新菜。这被称为“抢占”。

  • 发现: 无论你在烹制 1 分钟后停止当前菜肴,还是在 1 小时后停止,切换菜肴所花费的时间几乎是一样的。
  • 类比: 想象你在绘制一幅巨大的壁画。如果你必须停下来让别人接着画,那么清理你的画笔并准备好新画家的画笔所需的时间是固定的,无论你之前已经画了 10 英尺还是 1000 英尺。你绘画所花的时间并不重要;重要的是切换本身所花的时间是固定的。
  • 重大揭示: 大多数人认为移动“笔记”(即记录已绘制内容的记忆,称为 KV 缓存)所花的时间是瓶颈。但研究发现,移动“笔记”实际上是瞬间完成的(不到总时间的 1%)。真正浪费时间的是卸下旧厨师的工具并装上新的厨师的工具(从硬盘加载模型权重)。
  • 教训: 切换任务代价高昂,但成本是可预测的。它完全取决于“工具箱”(模型大小)有多重,而与任务已经运行了多久无关。

3. “交通堵塞”(数据移动)

当在快厨师和慢助手之间移动物品时,他们必须穿过一条走廊(数据线)。

  • 发现: 即使因为菜肴非常长而导致“笔记”(内存)变得巨大,与卸载工具相比,移动它们的速度仍然超级快。
  • 类比: 这就像移动一张纸与移动整个书架。移动那张纸(“笔记”)快得几乎可以忽略不计。而移动书架(模型工具)则需要耗费永恒的时间。
  • 教训: 在决定是否切换任务时,不必太担心“笔记”的大小。要担心的是“书架”的大小。

4. “硬件个性”

这项研究测试了两种不同类型的厨房(两种不同的 GPU)。

  • 发现: 其中一个厨房在烹饪方面更快,但在切换任务方面比另一个更慢。
  • 类比: 一个厨房有一位超级快的厨师,但走廊很窄,导致快速交换工具很困难。另一个厨房的厨师速度稍慢,但走廊很宽,使得交换工具更容易。
  • 教训: 你不能使用“一刀切”的规则。调度任务的最佳方式完全取决于你拥有哪种硬件。

面向未来的总结

作者得出结论,下一代“厨房经理”(调度器)需要更加智能。它们不应只关注队列中有多少订单。它们需要知道:

  1. 这是哪种模型?(有些模型讨厌被分割)。
  2. 工具箱有多大?(这决定了切换需要多长时间)。
  3. 这是什么样的厨房?(不同的硬件会改变规则)。

通过了解这些具体的特性,管理者可以停止试图将方钉强行塞入圆孔,转而创建一个能够高效运行多种不同 AI 模型而不会导致厨房崩溃的系统。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →