Cascade: Exploiting SLO-Aware latency budget for fair and high goodput LLM inference serving
Cascade 是一个利用动态的、基于每个请求的延迟预算来联合优化调度与 KV 缓存管理的 LLM 服务系统,从而在与传统的先来先服务方法相比时,显著提高了满足 SLO 的吞吐量和公平性,并减少了违规情况。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个繁忙的高速火车站,成千上万的乘客正试图同时登上不同的列车。有些乘客只背着一个单肩背包(一个简短、快速的问题),而另一些人则拖着装满多年回忆的巨大沉重行李箱(一个漫长、复杂的故事或深度推理任务)。在人工智能的世界里,这些“列车”就是大语言模型(LLMs)——即驱动聊天机器人、编程助手和推理智能体的超智能计算机。而“乘客”则是我们发送给它们的请求。
为了让这些系统显得既快速又高效,它们必须承诺在特定的时间限制内交付答案,这被称为服务水平目标(SLO)。你可以把它想象成一张票,上面写着:“你必须在 5 秒内上车并开始移动。”问题在于,车站管理员一直使用一条非常陈旧的规则:“先到先得”。这意味着如果一个带着巨大行李箱的乘客先到,所有人即使只有一个小背包、本可以在瞬间被服务,也必须排在后面等待。这导致了严重的交通拥堵。此外,车站拥有的高速存储空间(就像一个 VIP 等候室)是有限的。如果行李被存放在遥远且缓慢的仓库里,取回它就需要时间。如果车站管理员不知道每个乘客在火车出发前还剩多少时间,他们可能会浪费宝贵的秒数去为已经迟到的乘客取行李,而另一些准时的乘客却因此被落下。
这正是名为 CASCADE 的新系统所解决的挑战,该系统由不列颠哥伦比亚大学、微软 Azure 研究院和 NVIDIA 的研究人员在最近的一篇论文中描述。研究人员意识到,每个请求都有一个隐藏的“时间预算”——即完成任务所需的时间与允许花费的总时间之间的差值。有些请求拥有巨大的预算(有很多额外时间),而有些请求几乎没有。论文指出,与其仅仅关注谁先到达或请求的大小,系统应该通过观察剩余的时间预算来决定下一个处理谁以及如何处理他们的数据。
CASCADE 的核心思想是将这种时间预算视为两种不同工作的共享货币:决定请求的顺序以及管理数据存储的位置。在论文的模拟实验中,研究人员使用了来自生产服务器的真实世界流量数据,并在三种不同的巨型 AI 模型(Qwen-2.5-72B、Llama-3-70B 和 Llama-3-405B)上进行了测试。结果显示,CASCADE 通过不断计算每个请求还剩多少“时间余量”(time headroom),能够优先处理那些即将耗尽时间的请求,同时让那些时间充裕的请求稍作等待,或者从更慢、更便宜的存储器中获取数据。
研究结果表明,这种方法是提高效率的“游戏规则改变者”。在测试中,与 vLLM 等流行系统所使用的标准“先到先得”方法相比,CASCADE 将系统能够处理的成功请求数量(称为“有效吞吐量”或 goodput)提升了高达 2.4 倍。更重要的是,它将错过时间限制(SLO 违规)的请求数量减少了 40%。或许最具有创意的是,它在实现这一目标时并没有让漫长复杂的请求受到损害。与其他可能会催促短请求而导致长请求“饥饿”的方法不同,CASCADE 保持了对所有人的公平性,确保了“背包”乘客和“巨大行李箱”乘客都能按时得到服务。该系统通过动态决定是向快速内存获取数据、向较慢的存储器获取数据,还是直接重新计算,从而实现了这一点,而决策完全基于该特定请求是否拥有足够的预算来吸收延迟。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。