Geometry-Aware Online Scheduling for LLM Serving: From Theoretical Bound to System Practice
本文提出了一种具有几何感知能力的在线调度框架,其包含最小体积优先(Smallest Volume First, SVF)和 1-bit SVF 算法,这些算法通过比传统的以时间为中心的启发式算法更有效地解决键值(Key-Value)缓存的动态二维内存占用问题,在理论上提升了竞争比,并在实践中增强了大语言模型(LLM)的推理性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正在经营一家繁忙的咖啡店。这不仅仅是任何一家普通的咖啡店;这是一个高科技咖啡店,你制作的每一杯饮品都需要消耗特定的柜台空间(内存),而且随着制作时间的延长,所需的空间也会不断增加。
在大型语言模型(LLM)的世界里,这种“柜台空间”被称为 KV Cache。每当 AI 生成一个词(token)时,它都需要额外的内存来记住刚刚说过的话,以便让对话持续进行。如果你用完了柜台空间,整个店铺就必须停工。
问题所在:“最短作业优先”的错误
长期以来,计算机系统一直使用一种叫做 最短作业优先(Shortest Job First, SJF) 的规则来管理这些请求。其逻辑很简单:“如果有人点了一杯快速制作的浓缩咖啡,就让他们先走,因为很快。如果有人点了一杯复杂的、需要 20 分钟才能做好的拿铁,就让他们等着。”
该论文指出,在 AI 世界里,这个规则其实是失效的。原因如下:
- 陷阱: 在普通的商店里,一个短订单只会占用很短时间的空间。但在 AI 咖啡店里,即使是一个“短”请求,如果顾客要求讲一个长篇故事,也可能需要巨大的柜台空间。
- 二维现实: 论文指出,我们需要从两个维度来看待问题:时间(需要多久)和 空间(随着增长会消耗多少内存)。旧规则只考虑了时间。
- 结果: 通过仅优先处理“快”的任务,系统经常会被那些起步很快但会吃掉所有内存的请求所堵塞,从而阻塞了其他所有人。这就像是让一位顾客点了一杯极小的浓缩咖啡,但随后这位顾客决定在柜台旁坐上一小时,挡住了咖啡师为其他人制作饮品。
解决方案:“最小总体积优先”(SVF)
作者提出了一种新的规则,叫做 最小总体积优先(Smallest Volume First, SVF)。他们不再问:“这个任务有多快?”而是问:“这个请求在其整个生命周期内总共会占用多少柜台空间?”
把这想象成在装载一辆搬家卡车:
- 旧方法 (SJF): 你先装载最小的箱子,希望它们能塞进去。
- 新方法 (SVF): 你计算每一个物品的总“体积”(高 × 宽 × 深),然后优先装载那些总空间占用最小的物品。
通过这样做,系统可以快速清理掉那些“体积小”的请求。这为更大的请求腾出了空间,让它们能更早地开始运行,防止整个系统陷入停滞。
“一位元”技巧 (1-bit SVF)
准确预测一段对话会持续多久是非常困难的。这就像试图猜测一位顾客在停止说话之前到底会说多少个字。论文引入了一个聪明的捷径,叫做 1-bit SVF。
系统并不试图预测精确的单词数量,而只是问一个简单的问题:“这是一个短请求还是一个长请求?”(是/否)。
- 它使用极少量的信息(仅仅一个“位元/bit”)来对请求进行分类。
- 出人意料的是,论文表明这种简单的猜测几乎与复杂的预测一样有效。这就像咖啡师只需问一句:“您是要喝快餐咖啡还是长饮?”并根据这个简单的答案做出决策。这节省了大量的脑力(计算能力),同时仍能保持排队的顺畅流动。
这篇论文证明了什么
作者不仅是凭直觉猜测这行得通,他们还通过数学进行了证明:
- 数学证明: 他们展示了在最坏情况下(例如突发的人流高峰),他们的新方法保证比旧有的“最短作业优先”方法表现更好。他们将数学保证从可能比完美情况差 48 倍,收窄到了仅差 5 倍。
- 测试: 他们在真实的 AI 模型(Llama-3.1)上使用了一个流行的系统 called vLLM 进行了测试。
- 结果: 新方法让所有人的 AI 响应都变快了,尤其是减少了“尾部延迟”(即最慢请求的等待时间)。
- 效率: “1-bit”版本非常轻量化,在保持出色表现的同时,几乎没有给系统带来额外的延迟。
总结
简单来说,这篇论文告诉我们:不要仅仅根据 AI 请求完成的速度来评判它们。要根据它们在运行时占用了多少“内存空间”来评判。 通过转向“最小总体积优先”策略,甚至使用一种超级简单的“长短”判断,我们可以让 AI 聊天机器人变得更快、更流畅,并且不易在重载下崩溃。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。