← 最新论文
🤖 machine learning

Cost-aware Duration Prediction for Software Upgrades in Datacenters

本文介绍了 Acela,这是一个成本感知的持续时间预测框架,通过解决非对称预测错误成本和拖尾效应来优化数据中心的软件升级调度,从而在 Meta 的生产系统中显著提升了效率、吞吐量并降低了取消率。

原作者: Yi Ding, Aijia Gao, Thibaud Ryden, Michal Sedlak, Essam Ewaisha, Igor Marnat, Henry Hoffmann

发布于 2026-05-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Yi Ding, Aijia Gao, Thibaud Ryden, Michal Sedlak, Essam Ewaisha, Igor Marnat, Henry Hoffmann

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个庞大的数据中心,它就像一座拥有数百万台服务器的巨型繁忙城市。这些服务器是驱动你喜爱的应用、视频和搜索的“主力军”。但就像任何机器一样,它们需要定期维护和软件更新,以保持安全与快速。

问题在于,更新这些服务器颇具挑战性。如果你试图一次性更新所有服务器,整个城市就会陷入停滞;如果更新得太慢,则耗时无穷无尽。Meta(Facebook、Instagram 等背后的公司)的数据中心运营者一直采取非常保守的策略:他们假设每一次更新都将耗费绝对最长的可能时间。

问题:“最坏情况”的交通堵塞
这就像一位公交车司机,假设每一位乘客都需要 10 分钟才能上车,尽管大多数人实际上只需 30 秒。由于司机过于谨慎,公交车会闲置数小时,浪费时间和燃油。

在数据中心,这种“最坏情况”思维意味着他们的“升级窗口”(专门预留用于更新的时间段)仅被利用了 20%–40%。他们放弃了许多潜在的工作机会,导致完成所有服务器更新需要更多的周期。

解决方案:Acela,智能交通控制器
论文介绍了一个名为 Acela 的新系统。将 Acela 想象为一位超级聪明的交通控制器,它不只是猜测,而是能精确预测每台特定服务器进行特定更新所需的确切时间。

但关键在于:Acela 追求的并非数学课意义上的“准确”,而是成本意识

  • 低估(预测更新需 10 分钟,实际却需 20 分钟)是危险的。服务器会错过截止时间,更新失败,整个计划被打乱。
  • 高估(预测需 20 分钟,实际只需 10 分钟)是安全的。服务器提前完成,但窗口会短暂闲置。

Acela 明白,略微“保守”(高估)比“冒险”(低估)更好。它采用一种称为分位数回归的特殊数学技巧,有意预测比平均值稍长的时间,从而确保任务按时完成,同时避免系统崩溃。

Acela 如何运作(核心秘诀)

  1. 从历史中学习:Acela 分析数百万次过往更新,寻找规律。
  2. 忽略“异常者”:有时,某台服务器因硬件故障而更新耗时极长(即“拖后腿者”)。如果 Acela 从这些故障中学习,它就会开始认为每一次更新都需要极长时间。因此,Acela 在学习前会智能地过滤掉这些极端异常值,避免被吓到而变得过于保守。
  3. 选择最佳预测:它尝试不同的预测策略,并选出能在保持低失败率的同时完成最多更新的那一种。

结果:更快、更顺畅的城市
当研究人员在 Meta 的真实数据中心测试 Acela 时,结果令人印象深刻:

  • 时间利用率提升:在相同时间内,他们完成了1.25 倍的工作量。升级窗口终于被高效利用。
  • 更多更新:他们能够安排33% 更多的更新,并成功完成41% 更多的更新。
  • 更少失败:尽管工作量增加,失败或取消的更新数量却减少了2.4 倍。他们更可靠地达成了安全目标(95% 的更新按时完成)。

一句话总结
在 Acela 出现之前,数据中心就像一位因害怕延误而困在交通中、缓慢前行的谨慎司机。Acela 则像一套 GPS,能精确知道每段旅程所需的时间,使司机能在一天内完成更多行程,而永远不会超时。它在速度与安全性之间取得平衡,让整个系统运行得更加顺畅。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →