← 最新论文
🤖 machine learning

Beyond Binary Priorities: Multi-Tier SLA Scheduling for Large Language Model Serving

本文通过高保真模拟,将 Llumnix LLM 调度器从其原始的二元模型扩展到支持多级服务水平协议(SLA),证明了四级配置能够在保持强 SLO 差异化的同时,优化多种工作负载下的成本效益与延迟性能。

原作者: Anders Vestrum, Arya Raeesi, Hanna Roed

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Anders Vestrum, Arya Raeesi, Hanna Roed

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在现代人工智能的世界里,大型语言模型扮演着强大的引擎角色,生成文本、代码和创意。然而,运行这些引擎并非简单的开关控制。当用户发送请求时,系统必须首先处理输入,然后逐字逐句地生成响应。这个过程是不可预测的:一个短问题可能只需不到一秒的时间,而复杂的分析则可能持续数分钟,并在此过程中消耗大量的计算机内存。由于这些请求往往以突发的形式到来且长度差异巨大,支撑它们的底层架构经常难以应对。如果系统对每项请求都一视同仁,那么一个庞大且缓慢的任务就会阻塞队列,导致紧急且简单的提问等待过长时间。这就是提供人工智能服务的核心挑战:如何管理混乱的工作流,使关键任务能够立即得到处理,同时又不浪费运行它们所需的昂贵计算资源。

加州大学伯克利分校的研究人员通过重新构想人工智能系统如何划分工作优先级,解决了这一问题。他们基于之前的系统 Llumnix 进行了开发,该系统旨在通过在不同的计算机服务器之间移动任务来平衡负载并防止瓶颈。原版系统的效果虽然显著,但存在局限性,它仅提供两个层级的重要性:针对紧急事项的高优先级和针对其他所有事项的普通优先级。这种二元选择对于现实中的商业环境来说过于粗糙,因为企业通常需要区分五个或更多个服务等级,例如白金、黄金、白银和免费用户,每个等级都有不同的速度保证。研究人员提出了一个根本性的问题:要创建一个既对所有用户公平又对机器高效的系统,合适的优先级层级数量应该是多少?

为了找到答案,团队创建了一个大规模人工智能数据中心的复杂模拟系统。他们并没有在物理硬件上运行,因为测试物理硬件成本极高且速度缓慢,而是使用了一个能够模拟真实计算机芯片行为的高保真数字模型。在这个虚拟环境中,他们将优先级系统扩展到支持一到十个不同的重要性等级。他们还引入了一种新的内存管理方式,即为每个优先级等级分配特定的“呼吸空间”,以确保其能够完成工作而不被挤出。这种呼吸空间并非平均分配;相反,随着优先级的降低,它会呈指数级缩小,从而确保最关键的任务始终拥有所需的空间,而不太紧急的任务则填补剩余的空隙。

团队将这个新系统与几种现有方法进行了对比测试,在不同条件下运行了数千次模拟请求。他们改变了用户的构成,创造了高优先级请求稀少、常见或均匀分布的各种场景,并调整了总工作量,以观察系统在轻载与接近满载情况下的表现。结果揭示了一个明确的“甜点区”(sweet spot)。虽然系统在技术上可以处理多达十个优先级等级而不崩溃,但增加超过四个层级并不会提升性能。事实上,一旦超过四个等级,系统的效率就开始下降。管理如此多不同类别的额外复杂度所消耗的资源,超过了它所节省的资源,分类任务带来的收益也随之消退。

最优配置被确定为四个优先级层级。在模拟实验中,这种设置使系统整体性能实现了显著的速度提升。系统的端到端 P99 延迟(P99 latency)相比标准方法提升了高达 3.13 倍,且整体的单位延迟成本(cost-per-latency)降低了多达 68%。该系统通过为重要用户提供专用车道来保持其满意度,同时仍允许不太紧急的后台工作在剩余空间内高效运行。这种平衡防止了“护送效应”(convoy effect),即单个缓慢任务拖累整条快速队列的情况,并通过在服务器之间动态移动任务来保持整体流动。

研究人员还发现,这种细粒度的优先级划分带来的益处在很大程度上取决于系统的繁忙程度。当数据中心处于中度负载时,将任务划分为不同车道的能力发挥得非常出色,让高优先级请求疾速通过,而低优先级请求则稍作等待。然而,当系统完全饱和、每台服务器都处于最大负荷运行时,拥有多个优先级等级的优势就会减弱。在这些极端条件下,系统已经完全填满,没有额外的空间来移动任务,因此层级之间的区别变得不再那么有效。这表明,虽然四层模型是大多数情况下的理想设计,但它最好能与一种能在负载过重之前自动增加更多服务器的系统配合使用。

最终,这项工作为人工智能基础设施的未来提供了一份实用的蓝图。它证明了简单的四级层级结构足以涵盖全方位的用户需求,从关键的实时交互到后台的批处理任务。通过摒弃僵化的两级系统,并避免陷入设计过于复杂的陷阱,工程师们可以构建出既更快又更具成本效益的人工智能服务。这项研究证实,应对人工智能不可预测特性的关键不在于让系统变得更加复杂,而在于找到那个能让系统顺畅“呼吸”的精确组织水平。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →