在现代数据中心那广阔且嗡鸣不断的厅堂里,数以千计强大的图形处理器正协同工作,训练着驱动从医学研究到创意工具等一切领域的人工智能系统。这些机器造价昂贵且需求量极大,因此运营商试图通过让多个任务共享单个处理器,来榨取每块芯片尽可能多的工作量。然而,这种共享产生了一个微妙但顽固的问题,即被称为“碎片化”的问题。想象一个停车场,每辆车的尺寸和形状都不同;即使总空间足够停下一辆新车,剩余的空间也可能分散成细小、无法使用的间隙,导致没有任何一辆车能停进去。在计算机集群中,这些分散的未使用内存和处理能力的间隙会导致新任务处于搁置状态,即使系统整体拥有充足的空闲容量,它们也无法开始运行。当任务需要多个处理器同时协作时,这种低效问题变得更加关键,因为它们需要一套完美的可用资源才能启动。
来自梨花女子大学的研究员崔素恩(Soeun Choi)和沈载亨(Jaehyeong Sim)开发了一种管理这些共享资源的新方法,它解决了碎片化问题,且不会降低系统速度或引发新的故障。他们的方法被称为“遗传碎片梯度下降法”(Genetic Fragmentation Gradient Descent,简称 GFGD),它就像一个智能交通控制器,在一天开始前学习如何以最佳方式“停放”任务,以便在有新任务到达时做出即时决策。团队意识到,仅仅尝试将任务紧密堆叠以节省空间往往会适得其反;这可能会产生“热点”,导致某些处理器过载,进而引发崩溃和停机。为了解决这个问题,他们创建了一个平衡三个竞争目标的系统:保持资源有序以防止碎片化、管理功耗以节省能源,以及避免导致处理器失效的特定条件。
其核心方法包含一个将“重度思考”与“快速行动”分离的两步走过程。首先,在离线阶段,研究人员在计算机上运行数千个模拟场景,以教导一套简单的规则如何表现。他们使用遗传算法,一种受自然进化启发的技术,来测试许多候选的优先级权重组合。系统会演化出一组微小的“权重”,告诉调度器应该在碎片化、能源消耗与崩溃风险之间给予多少关注。至关重要的是,这种学习发生在安全的模拟环境中,系统可以在这里从错误中学习,而不会真正导致真实机器崩溃。研究人员发现,单一的一套规则并不适用于所有情况;相反,系统会针对不同的活动水平学习不同的规则集,例如在集群负载较低、中等繁忙或高压状态下。
一旦这些规则被学习完成,系统便进入在线阶段,必须在任务到达时进行实时决策。该调度器不再为每一个新请求运行复杂的模拟(因为这会耗费太多时间并拖慢速度),而是简单地检查当前的活动水平,并选择最匹配的预学习规则集。随后,它查看一小组固定数量的可用处理器,并根据选定的规则进行评分。这种评分过程几乎是瞬间完成的,使得系统能够以比旧方法快得多的时间来放置任务。在测试中,根据集群规模的不同,该新系统在做出调度决策方面的速度比以往先进方法快了 5 到 137 倍。
他们的模拟结果表明,这种方法不仅提高了速度,还使系统更加可靠和高效。通过明确教导调度器避开导致运行时故障的条件,该系统在保持崩溃率处于安全预设限度内的同时,还能接纳更多的任务进入队列。在系统承受高压的场景下,新方法在保持新任务启动成功率的同时,减少了能源浪费并缩短了任务完成时间。研究人员证明,通过在离线状态下从模拟故障中学习,系统可以在在线状态下做出更明智的选择,从而防止导致容量闲置的资源碎片化,以及导致处理器失效的过载问题。这项工作表明,对于大规模计算集群而言,管理复杂共享资源的最佳方式不是在实时过程中计算每一种可能性,而是在事前学习好各项优先级的平衡点,并在关键时刻以速度和精准度将其应用。
技术摘要:遗传碎片化梯度下降 (GFGD)
1. 问题陈述
支持机器学习和生成式人工智能的现代 GPU 集群面临着资源利用率与可分配性之间的关键张力。虽然细粒度的 GPU 共享(允许多个作业占用子 GPU 切片)可以提高总体的利用率,但它也引入了资源碎片化。这种碎片化会在设备上产生异构且无法合并的残余间隙。因此,当一个到达的作业由于空闲容量在设备间分布过于碎片化或不平衡,导致无法形成适合该作业的分配方案时,即使集群拥有足够的总空闲容量,该作业也可能被拒绝(不可行)。
现有的解决方案如碎片化梯度下降 (FGD) 试图通过使用在线“假设如果”(what-if)模拟来估计决策的长期影响来缓解这一问题。然而,FGD 存在两个主要局限性:
- 高在线开销: 它需要昂贵的在线模拟和集群范围指标的重新计算,这在面对突发到达和大规模集群规模时会成为瓶颈。
- 可靠性建模不足: FGD 将碎片化作为可靠性的代理。然而,减少碎片化通常需要整合负载,这可能会产生利用率热点并增加压力驱动的运行时故障。相反,分散负载可以减少热点,但会增加碎片化。因此,在压力下,碎片化本身并不是可靠性的充分统计量。
核心挑战在于设计一种调度器,在改善可分配性和管理碎片化的同时,显式地约束运行时故障,并且所有这些操作都必须在适用于生产环境的严格决策时间预算内完成。
2. 方法论:GFGD 框架
作者提出了 遗传碎片化梯度下降 (GFGD),这是一个离线-在线调度框架。其核心设计原则是将昂贵的策略搜索和可靠性校准转移到离线模拟器中,在线阶段仅部署轻量级的常数时间操作。
A. 离线阶段:受故障约束的策略演化
在离线阶段,GFGD 使用遗传算法 (GA) 来演化紧凑且可解释的放置策略。
- 策略表示: 每个策略是一个三维权重向量 w=[wfrag,wpwr,wfail],用于平衡三个目标:
- 碎片化变化 (ΔFrag): 跨设备不平衡(每 GPU 内存利用率的标准差)的代理。
- 功率代理 (ΔPwr): 基于利用率的线性功率模型。
- 故障风险代理 (ΔFail): 一个对热点敏感的聚合器,随利用率单调增加,强调高压力 GPU。
- 优化目标: GA 在一个硬性运行时故障 (RF) 护栏的约束下,最小化标量化代价函数(完成率、尾部延迟、浪费能耗、停机时间和闲置容量的加权和)。
- 护栏机制: 为了应对模拟过程中的随机噪声,RF 约束是在多次模拟试验估算的运行时故障率的上置信界 (UCB) 上强制执行的。违反 RRF(w)≤RRFref+ϵ 的策略将被丢弃。
- 特定场景学习: 策略针对不同的运行场景(低、中、高利用率)分别进行演化,以适应变化的集群状态。
B. 在线阶段:场景感知的轻量级调度
在决策时,在线调度器执行两个轻量级操作:
- 场景选择: 它根据平均内存利用率对当前集群状态进行分类,并选择预演化的对应于该场景的策略权重向量。
- 有界候选评分: 为了避免评估所有 GPU 或模拟未来状态,调度器:
- 识别一组可行的 GPU。
- 使用“锚点 + 随机”策略(选择极值如最大空闲内存、最小风险以及随机样本)采样一小组固定大小的候选集(例如 kcand=8)。
- 根据选定的权重 w 和上述三个代理指标,使用常数时间评分规则对这些候选者进行排名。
- 将作业按顺序放置在得分最高的 GPU 上。
这种方法消除了在线“假设如果”模拟,将调度开销降低到接近启发式水平,同时保留了感知碎片化的行为。
3. 核心贡献
论文声称以下贡献:
- 受故障约束的离线策略学习: 将 GPU 调度建模为一个显式控制运行时故障的优化问题,通过护栏机制实现,而非仅仅依赖碎片化作为可靠性代理。
- GA 演化出可解释的策略: 演化出紧凑的、针对特定场景的三项权重向量,在优化碎片化和能量代理的同时,强制执行相对于基准 (FGD) 的运行时故障约束。
- 轻量级在线调度: 通过使用场景匹配的策略选择和常数预算的候选者排名,取代在线模拟,实现了近乎启发式的开销,同时保持了具有竞争力的可分配性和可靠性。
- 可选风险预测器: 提供了一个基于梯度提升决策树的状态级准入不可行性预测器,用于可选的多策略选择,尽管这对于核心在线路径并非必需。
4. 实验结果
作者使用经过生产轨迹(阿里巴巴 GPU 集群)和合成工作负载校准的离散事件模拟器对 GFGD 进行了评估。对比对象包括 FGD(有界候选)、Min-Power (PWR) 以及固定的权重失效感知 (FA) 启发式算法。
- 调度开销: 随着集群规模从 32 扩展到 1024 个 GPU,GFGD 比 FGD 减少了 5.1 倍到 136.9 倍的调度决策时间。由于采用了有界候选者评估,其开销保持低位且稳定,在 1024 个 GPU 时均值为 1.14 ms,P95 为 1.82 ms。
- 可靠性与效率:
- 运行时故障: 在各种压力水平(KU 扫描)下,GFGD 与 FGD 及固定权重 FA 基准相比,显著降低了运行时故障数 (NRF)。
- 完成率: GFGD 保持了近乎完美的完成率(通常为 1.000),同时与 FGD 相比减少了约 74% 至 82% 的浪费能耗。
- SLO 稳定性: 与 Min-Power 基准相比,GFGD 大幅减少了启动截止日期错过次数 (SD),后者在 SLO 压力下表现出不稳定性。
- 鲁棒性:
- 压力敏感性: 在标称压力水平下训练的 GFGF 策略,在测试不同故障敏感系数(KU∈{0,1,2,3})时表现出稳健性。
- 工作负载偏移: 该方法在作业数量、持续时间和到达突发性发生分布偏移时展现出了韧性。
- 类型不匹配: 当 GPU 类型与故障率之间的映射关系被随机化时,GFGD 仍能保持稳定性,优于依赖固定类型-可靠性映射的能耗优先策略。
5. 重要性与主张
论文将 GFGD 定位为解决共享 GPU 集群中碎片化这一“一阶瓶颈”问题的实用方案。其重要性在于:
- 解耦复杂度与性能: 它证明了通过离线学习和轻量级在线评分,可以获得复杂且具备碎片化感知能力的放置优势(此前需要昂贵的在线模拟)。
- 显式可靠性控制: 它挑战了“碎片化指标足以代表可靠性”的假设,引入了显式的故障风险项和一个硬性护栏,以防止为了可分配性而过度牺牲运行时可靠性。
- 生产可行性: 通过保持常数且低水平的在线决策时间,GFGD 解决了大规模、突发性生产集群所需的严格决策时间预算问题,为依赖模拟的调度器提供了一个可部署的替代方案。
作者得出结论,GFGD 成功地在不承担在线“假设如果”模拟计算负担的情况下,平衡了可分配性、能源效率和可靠性,使其成为现实世界 GPU 集群管理的有力候选方案。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。