← 最新论文
💻 computer science

How Portable Are LLM-Serving Scheduler Rankings Across Workloads, Operating Regions, and Metrics?

本文引入了 LLM 服务调度器可移植性基准测试(LSSP),旨在证明虽然调度策略的排名在某些工作负载来源之间表现出强一致性,但在不同的运行区域和评估指标上却表现出显著的变异性和有限的可移植性,因此必须将调度器的比较解释为取决于其特定的实验上下文。

原作者: Soroush Vahidi

发布于 2026-09-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Soroush Vahidi

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在现代数字领域,大语言模型已成为各种智能应用背后的引擎,从写作助手到复杂的编程工具。为了让这些系统为数百万用户流畅运行,它们依赖于精密的服务器集群,其中强大的图形处理器充当着“大脑”。然而,这些处理器既昂贵又资源有限。当成千上万的人同时发送请求时,服务器必须决定先处理哪个请求、如何将它们分组在一起,以及如何管理内存,以确保不会有单个用户阻塞系统而导致其他人等待。这个决策过程由一个“调度器”(scheduler)负责,它就像是一个交通控制器,不断重新排列数据流,以保持一切高效运行。

多年来,研究人员一直提出新的调度器改进方法,声称其方法比现有方法更快或更公平。但这些说法几乎总是在非常特定的条件下进行测试:使用单一类型的用户流量、在特定的服务器负载水平下,并仅用一个指标来衡量成功。这造成了一个盲点。一个在安静、可预测的请求流中表现完美的调度器,在面对突然且混乱的爆发式活动时可能会表现得一团糟。一个基本问题始终悬而未决:如果一个调度器在一组数据上被宣布为最优,那么当流量发生变化、负载发生转移或成功的定义发生改变时,这种排名是否依然成立?

为了回答这个问题,新泽西理工大学的一位研究人员设计了一个严谨的测试,称为“LLM 服务调度器可移植性基准测试”(LLM-Serving Scheduler Portability Benchmark)。该研究并非询问哪一个调度器是绝对最好的,而是提出了一个更微妙的问题:这些调度器的排名具有多高的可移植性?换句话说,如果你改变用户流量的来源、负载的强度或衡量性能的方式,这些最好与最差调度器的排名顺序会保持不变,还是会发生翻转?该研究人员构建了一个模拟系统,运行了 13 种不同的调度策略,涵盖了来自三个独立来源的 120 个截然不同的真实世界数据窗口。这些窗口分别提取自微软的 Azure 云流量、阿里巴巴的 Bailian/Qwen 平台,以及一个名为 BurstGPT 的大型微软 Azure 追踪数据集。系统在从轻量级流量到严重过载的六个不同运营区域进行了测试,并使用多种性能指标进行了评估。

结果显示,答案并非简单的“是”或“否”。排名并非普遍稳定,也非完全混乱;它们在很大程度上取决于你观察的具体因素组合。在比较不同数据源的排名时,研究发现来自微软 Azure 和阿里巴巴 Bailian/Qwen 的流量几乎完全一致。如果一个调度器在 Azure 上表现最佳,那么它在 Bailian/Qwen 上几乎肯定也是表现最佳的。然而,第三个来源 BurstGPT 则呈现了不同的情况。当引入 BurstGPT 进行比较时,一致性显著下降,相关系数降至 0.55。这表明,仅在类 Azure 流量上经过验证的调度器,在面对类 BurstGPT 流量时可能无法达到预期表现,反之亦然。

研究还观察了排名实际发生“反转”的情况,即一个在某种场景下表现较好的调度器在另一种场景下变得较差。在近千次比较中,只有约 3.6% 的情况显示出在实践中具有统计学意义且足够显著的反转。这些反转并非均匀分布在所有条件下,而是集中在特定领域,特别是在系统处于重负载时。此外,每一个显著的反转都涉及相同的两组调度策略,并且始终包含 BurstGPT 数据。这表明这种不稳定性并非系统的普遍缺陷,而是特定调度机制与该特定流量源独特特征之间的特定交互作用。

关于衡量性能的指标,研究人员也有了或许是最令人惊讶的发现。他们测试了在某一指标(如完成请求的数量)上排名最高的调度器,是否也会在其他指标(如速度或公平性)上排名最高。他们发现,当指标改变时,排名表现得异常脆弱。平均而言,不同指标之间的协议程度仅为中等水平,并且在 68.1% 的测试条件下,取决于所使用的指标,表现最好的单一调度器会发生变化。这意味着,“最佳调度器”的说法往往对其追求的具体目标保持沉默;一个针对速度优化的调度器可能是公平性方面的最差选择,而排名完全取决于运营商最看重什么。

为了确保这些模拟结果不仅仅是计算机模型的产物,研究人员选择了模拟中最剧烈的一次排名反转,并在使用标准图形处理器的真实物理硬件上进行了测试。模拟预测其中一个调度器在一种流量下获胜,而在另一种流量下失败(即排名的翻转)。在真实硬件上,这种特定的翻转并未发生,其中一个调度器在两次测试中均获胜。然而,另一个模拟预测没有变化的稳定排名测试,在真实硬件上也得到了证实。这表明,虽然模拟系统擅长识别稳定的趋势,但它可能无法完美预测现实世界中的每一次特定反转,从而揭示了模型保真度的边界。

最终,该研究得出结论:不存在适用于所有情况的单一、通用的“最佳”调度器。调度策略的表现是具有条件的。它取决于用户流量的具体来源、系统的当前负载、衡量成功的指标,以及对服务目标的具体定义。不能假设在一个数据集上看起来稳固的排名在另一个数据集上同样成立。对于工程师和研究人员而言,这意味着比较调度器需要一种更广泛、更谨慎的方法,而不仅仅是测试单一数据集。这些发现并非要宣布一个赢家,而是提供了一张地图,标明了排名何时可靠、何时可能发生变化,从而确保未来的评估能够结合必要的背景和谨慎态度来进行解读。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →