← 最新论文
🤖 machine learning

Strait: Perceiving Priority and Interference in ML Inference Serving

Strait 是一个机器学习推理服务系统,它通过采用自适应预测模型来考量数据传输争用和内核干扰,从而在高 GPU 利用率下提升高优先级任务的截止时间满足率,进而实现有效的优先级感知调度。

原作者: Haidong Zhao, Nikolaos Georgantas

发布于 2026-05-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Haidong Zhao, Nikolaos Georgantas

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下高档餐厅里繁忙的厨房。厨师就是计算机内部强大的GPU(图形处理器),而源源不断的订单则是AI 请求(例如要求计算机识别汽车零件的缺陷或识别人脸)。

通常,这些厨房会尝试通过同时烹饪多份订单(批处理)或依次烹饪来提高效率。但存在一个问题:有时厨房会变得过于拥挤,导致“VIP 订单”(如停止危险机器等紧急任务)被延误,因为它们被困在较慢、较不重要的订单(如调节室温)之后。

这篇论文介绍了一个名为Strait的新系统(将其想象为一位超级聪明的行政主厨),旨在解决这种混乱。以下是其工作原理的简化说明:

1. 问题:厨房里的“交通堵塞”

在普通厨房中,如果有一份 VIP 订单进来,厨师可能会尝试将其插队。然而,论文发现,仅仅喊出"VIP 优先”并不总是奏效,因为存在干扰

  • 类比:想象两位厨师试图同时使用同一个烤箱和同一块砧板。即使 VIP 厨师速度更快,他们也可能因为等待另一位厨师切完菜而被迫停滞。
  • 现实情况:当计算机尝试在同一芯片上同时运行两个 AI 任务时,它们会争夺资源(如内存和处理能力)。这会导致 VIP 任务意外变慢,有时甚至错过其必须完成的截止时间。

2. Strait 的解决方案:“水晶球”与严格的时间表

Strait 通过做两件主要事情来解决这个问题:

A. 水晶球(干扰预测)

在行政主厨(Strait)决定将新订单放入烤箱之前,它会使用“水晶球”来预测新订单将确切地使正在烹饪的订单减慢多少。

  • 工作原理:它会查看新订单所需的“空间”和“工具”与当前已使用的资源相比有多少。
  • 转折:这个水晶球不是静态的;它会学习。如果厨房开始变得异常繁忙,或者订单类型发生变化,水晶球会实时更新其预测,以免被误导。

B. 严格的时间表(感知优先级的调度)

一旦行政主厨知道新订单会造成多少流量,他们就会做出明智的决定:

  • 如果 VIP 订单可以在不破坏当前 VIP 订单的前提下按时完成:他们允许其进入。
  • 如果 VIP 订单会导致正在烹饪的 VIP 订单错过截止时间:他们会扣留新订单或完全丢弃它。
  • 对于“低优先级”订单:它们被视为“尽力而为”。如果厨房过于拥挤,这些订单可能会被延迟或跳过,以保护 VIP 订单。然而,Strait 力求公平,以便这些低优先级订单在情况平静时仍有机会被烹饪。

3. 测试时发生了什么?

研究人员在模拟的高压环境(如非常繁忙的工厂车间)中测试了 Strait。

  • 结果:Strait 成功挽救了 VIP 订单。它将高优先级任务错过截止时间的数量显著减少(比其他系统多出 1% 到 11%)。
  • 权衡:低优先级订单确实变得稍慢,或者更频繁地错过截止时间,但论文认为,为了确保关键任务(如安全检查)始终按时完成,这是可以接受的代价。
  • 对比:与其他试图通过“抢占”(强制停止)任务来腾出空间的系统相比,Strait 更加公平和稳定,因为它在交通堵塞发生之前就预测到了它,而不是在混乱开始后才试图修复它。

总结

Strait是 AI 计算机的智能管理者。它不再只是大喊"VIP 优先!”并寄希望于最好的结果,而是精确计算新任务会造成多少流量。然后,它决定是允许任务进入、延迟它还是丢弃它,从而确保即使在计算机满负荷(100% 容量)工作时,最关键的任务也能按时完成。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →