想象一下,互联网就像一座繁忙、喧闹的大都市,数以百万计微小且隐形的工人——被称为“函数”——在您点击按钮的那一刻便会奔向岗位完成任务。在过去,这些工人居住在大型的永久性办公室(服务器)中,无论是在忙碌还是在睡觉,这些办公室都必须 24/7 全天候有人值守。但一种更先进、更智能的构建互联网的方式,被称为“无服务器计算”(serverless computing),它让这些工人仅在需要时才出现,并在完成工作后消失,从而节省了巨额的租金。然而,这个系统有一个棘手的问题:有时城市会遭遇突如其来的、混乱的请求潮,就像一场闪现的快闪活动。如果系统等待看到人群聚集后再去雇佣更多工人,前几位用户就会陷入排队等待的困境(即“冷启动”)。如果雇佣得太快、太多,又会浪费资金。真正的难题在于,这些工人通常相互依赖;如果其中一个卡住了,整个工作链条就会停滞。研究人员正试图找出如何预测这些高峰期,并在正确的时间雇佣正确数量的工人,既不浪费钱,也不让人们等待。
这篇论文介绍了一个聪明的全新“交通控制器”,专门用于管理这些无服务器城市。作者建议,与其观察每一个单独的工人,不如通过观察城市的地图来寻找最重要的交叉路口。他们将应用程序视为一个连接网络,利用一种被称为“度中心性”(degree centrality)的数学技巧,来识别那些与系统中其他部分连接最多的少数函数。这些就是“瓶颈”——即最容易发生交通拥堵的繁忙路口。一旦确定了这些关键点,系统就不会仅仅靠猜测下一步会发生什么,而是会请出三位不同的“专家”(名为 MLP、LSTM 和 CNN 的计算机模型)来预测交通情况。每位专家观察数据的方式各不相同:一位关注模式,另一位关注时间序列,第三位则关注局部细节。系统并不会只信任其中之一,而是使用一种类似于“陪审团”的“共识”方法,根据这些专家过去表现出的优劣来进行投票。这创造了一种稳定且可靠的预测。最后,在采取行动之前,系统会检查价格标签,确保雇佣更多工人不会花费过多,以及解雇工人不会导致昂贵的冷启动延迟。
研究人员使用真实世界的数据轨迹测试了这个想法,并发现他们的“多专家”方法明显优于旧方法。他们发现,仅仅依赖单一的预测模型是冒险的,就像只信任一位气象预报员一样。通过结合这三种不同的模型,他们实现了约 99.06% 的预测准确率(其中表现最好的是 LSTM 模型),这相比于仅能达到约 49.5% 准确率的旧有无监督方法有了巨大的提升。该研究明确排除了“简单的无监督聚类(即在没有老师指导的情况下对数据进行分组)足以做出良好的扩缩容决策”这一观点;数据显示,这些方法无法捕捉到判断何时扩大或缩小规模所需的方向。此外,该系统证明了通过仅关注关键的“瓶颈”函数而非每一个函数,它可以做出更明智的决策。
在资金方面,结果是非常切实的。当研究人员在不同的云平台上模拟他们的系统时,节省了真实的现金。例如,在 AWS Lambda 上,成本从 0.70 美元降至 0.47 美元;在 Google Cloud Run 上,则从 9.48 美元降至 6.36 美元。总的来说,与那种仅仅在问题发生后才做出反应的标准响应式系统相比,该系统节省了 5.55 美元。作者认为,这种方法是平衡速度与成本的一种切实可行的方式,但他们也谨慎地指出,这些结果来自于模拟和针对特定数据集的实验,而非针对所有可能场景的永久性解决方案。他们还指出,虽然他们的方法具有鲁身性,但仍然依赖于所输入数据的质量。论文总结道,虽然这种“感知依赖关系”的系统是向前迈出的坚实一步,但仍有成长空间,未来或许可以通过使用更先进的数学工具(如图神经网络)或在真实的实时平台上进行测试来进一步完善。
技术摘要:一种基于多专家共识机制的无服务器环境自动扩缩容方法
问题陈述
无服务器计算提供了自动资源管理和按需付费的计费模式,但由于突发性工作负载、冷启动延迟以及复杂的函数间依赖关系,实现有效的自动扩缩容仍然具有挑战性。现有的方法通常独立地扩展单个函数,或依赖于单一预测器,这可能导致鲁棒性降低、成本效率低下,并忽视了结构性的关键瓶颈。当依赖链中的单个函数发生拥塞时,这种压力会沿着执行路径传播,从而导致端到端延迟恶化并增加运营成本。此外,激进的缩容操作可能会触发冷启动,而单一模型的预测器在面对工作负载波动时可能缺乏稳定性。
方法论
作者提出了一种感知依赖关系的自动扩缩容框架,该框架将瓶颈识别、短周期需求预测和成本感知控制统一到一个端到端的流水线中。该系统通过以下组件运行:
1. 感知依赖关系的瓶颈识别
应用程序被建模为有向依赖图,其中节点代表函数(类/文件),边代表调用关系。
- 图构建: 利用入度(fan-in)和出度(fan-out)指标构建一个加权二分图,以量化依赖强度。
- 瓶颈排名: 框架计算每个节点的加权度中心性(weighted degree centrality)。具有高中心性的函数被识别为结构性影响较大的瓶чем,它们很可能放大工作负载压力。
- 监控集(Watch Set): 构建一个由前 k 个高影响函数组成的“监控集”。监控、预测和扩缩容决策被优先应用于该子集,而非对所有函数进行同等对待。
2. 多模型需求预测
针对识别出的瓶颈函数,系统使用轻量级多模型集成来预测近期的资源需求。
- 监督学习模型: 采用了三种互补的神经网络架构:
- MLP(多层感知器): 捕捉聚合特征中的非线性关系。
- LSTM(长短期记忆网络): 对序列工作负载数据中的时间依赖性进行建模。
- CNN(卷积神经网络): 从时间序列输入的滑动窗口中提取局部模式。
- 无监督基准: 为了进行对比评估,文中实现了无监督方法(K-Means, SOM, PCA),但结果表明,如果没有监督,这些方法不足以生成稳定的扩缩容决策。
3. 受贝叶斯启发的共识决策
为了减轻任何单一预测器的偏差并提高在工作负载漂移下的稳定性,该框架采用了受贝叶斯模型平均(BMA)启发的性能加权概率集成。
- 权重分配: 模型权重根据验证性能(准确率)得出,并通过 Softmax 变换进行归一化。
- 聚合: 最终的共识预测是各模型输出的加权平均值。这减少了对单一模型的依赖,并平滑了极端偏差。
4. 成本感知与冷启动感知的控制
控制器包含一个成本比较机制,用于在执行前过滤候选扩缩容动作。
- 成本建模: 运营成本被建模为基础资源成本、浪费成本(过度配置)和过载成本(配置不足/SLA 违规)的总和。
- 冷启动感知: 如果预测缩容动作会导致延迟超过 SLA 阈值(可能触发冷启动),则会产生更高的过载惩罚,从而抑制激进的资源释放。
- 决策逻辑: 只有当候选扩缩容动作(扩容、缩容或保持)的预期成本在当前成本的容差范围内时,才会被接受,从而确保在性能稳定性之外具备经济合理性。
核心贡献
本文概述了五项主要贡献:
- 感知依赖关系的流水线: 一个端到端的控制器,它将结构分析、预测和成本感知执行相结合,超越了独立的函数扩缩容。
- 基于图的瓶颈识别: 一种利用有向依赖图上的度中心性来构建高影响函数监控集的方法,用于实现针对性控制。
- 轻量级多模型预测: 使用互补的 MLP、LSTM 和 CNN 模型来捕捉多样化的工作负载模式,同时保持较低的推理开销。
- 受贝叶斯启发的共识机制: 一种基于性能加权的概率集成机制,通过融合基于验证性能的预测,来提高对特定模型偏差的鲁棒性。
- 成本与冷启动集成: 一种通过成本比较步骤过滤动作,从而在延迟保证与运营效率之间取得平衡的扩缩容策略。
实验结果
该框架使用真实的工作负载追踪和软件依赖数据集进行了评估,以模拟无服务器调用图。
- 监督学习 vs. 无监督学习: 监督学习模型显著优于无监督聚类。LSTM 模型达到了最高的准确率 (99.06%),其次是 MLP (98.75%) 和 CNN (98.50%)。相比之下,表现最好的无监督基准(结合 t-SNE 的 K-Means)准确率仅为 49.5%,这证明了仅靠模式发现无法可靠地恢复扩缩容决策逻辑。
- 集成性能: 所提出的性能加权集成方案达到了 0.9988 (99.88%) 的准确率,优于代表性的混合基准(例如 MLP-LSTM, CNN-LSTM)和传统的机器学习模型。与这些基准相比,它还展示了更低的平均绝对误差 (MAE) 和平均平方误差 (MSE)。
- 成本效率: 与基于阈值的反应式基准相比,该预测控制器降低了多个平台的总基础设施成本:
- AWS Lambda: \0.70 \rightarrow $0.47$
- Google Cloud Run: \9.48 \rightarrow $6.36$
- Azure Functions: \0.68 \rightarrow $0.45$
- 通用容器 (Generic Container): \6.01 \rightarrow $4.03$
- 总计聚合节省: 相对于基准实现了 $5.55 的节省。
意义与主张
本文声称其主要意义在于其实用的系统级设计,该设计将三个经常被分开处理的关键维度结合在一起:依赖分析、基于集成的预测以及成本感知的决策。
作者断言:
- 结构感知至关重要: 忽略函数间的依赖关系会导致次优的扩缩容;优先处理结构性关键瓶颈可以获得更稳定且高效的控制。
- 集成鲁棒性: 一种基于性能加权的多专家共识机制,相比单体混合架构或单一模型预测器,能提供更高的稳定性和准确性,尤其是在工作负载波动的情况下。
- 经济可行性: 通过将冷启动感知集成到成本模型中,该框架在不损害 SLA 目标的前提下实现了显著的成本降低,证明了主动的、感知依赖关系的扩缩容在经济上优于反应式方法。
研究结论认为,在生成扩缩容动作方面,监督预测显著优于无监督聚类,并且所提出的框架为实际的无服务器环境提供了一种鲁棒且经济高效的解决方案。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。