想象一下,你经营着一家规模宏大、技术先进的烘焙坊。在这家烘焙坊里,你有两类主要工作:烘焙(需要一台巨大且昂贵的烤箱)和装饰(需要一个更小、更快的操作台)。
在人工智能领域,特别是训练“推理”模型(例如解决数学问题的模型)时,“烘焙”对应的是训练阶段,而“装饰”对应的是** rollout( rollout 阶段,即 AI 生成答案的阶段)**。
问题所在:“空烤箱”综合征
目前,大多数 AI 训练架构的运作方式就像这样一家烘焙坊:每一笔订单都配备专属的烤箱和装饰台,即便它们并非时刻都在使用。
- “分割式”烘焙坊:你有一支烘焙团队和一支装饰团队,但它们分班次工作。当烘焙师工作时,装饰师就闲置;当装饰师工作时,烘焙师就闲置。你支付了整整两支队伍的费用,但同一时间只有一支队伍在工作。
- “集中式”烘焙坊:你将烘焙师和装饰师安排在同一个房间以节省空间。但由于烤箱过于巨大(因为 AI 模型规模庞大),装饰团队必须等烘焙师完成工作后才能触碰操作台。对于小型的装饰任务而言,烤箱往往过大,造成能源浪费。
- “异步式”烘焙坊:你尝试让装饰师处理昨天的蛋糕,而烘焙师处理今天的蛋糕。这虽有一定帮助,但最终时间安排会变得混乱,导致蛋糕变 stale(不新鲜),或者你依然得等待。
这篇论文将这种现象称为**“作业局部低效”**。每一个 AI 训练任务都存在这些“空闲间隙”,昂贵的计算机芯片(GPU)就这样闲置着无所事事。
解决方案:PlexRL(“共享厨房”系统)
作者构建了一个名为PlexRL的系统。PlexRL 不再为每个 AI 任务提供独立的私人厨房,而是将整个数据中心变成一个巨大的共享厨房。
以下是其运作方式,沿用我们的烘焙坊类比:
- 中央管理器(调度器):想象一位主厨,他并不关心具体是哪一笔烘焙订单,他只关心任务。他看到任务 A 当前处于“装饰”状态(仅使用烤箱的一小部分),而任务 B 处于“烘焙”状态(使用烤箱的大部分)。
- 时间切片:管理者意识到,当任务 A 等待工具送达时,任务 B 可以在那几秒钟内使用同一台烤箱。PlexRL 快速地将“状态”(食谱和当前蛋糕)在烤箱中切换进出。
- 无需移动烤箱:通常,将一台巨型烤箱搬移到新厨房需要耗费漫长时间。PlexRL 很聪明:它将烤箱固定在原地,只是极快地将食材(AI 模型的内存)在烤箱中切换进出。它使用一个“状态管理器”来追踪每个食材的位置,无论是在操作台上(高速内存)还是在冷冻柜中(较慢的存储)。
魔法技巧:“负相关”间隙
其中的秘诀在于,不同 AI 任务的“空闲时间”很少同时发生。
- 任务 A 可能正在等待工具调用(长时间的停顿)。
- 任务 B 可能正处于激烈的数学计算中(无停顿)。
PlexRL 用任务 B 的工作填补任务 A 的停顿。这就像一位出租车司机,先载一位向北的乘客,然后立即载一位向南的乘客,而不是空车开回车库。
结果
该论文在由 2,048 块计算机芯片(GPU)组成的庞大集群上测试了此系统,用于训练不同规模(从小型到巨型)的 AI 模型。
- 成本节约:通过填补所有这些空闲间隙,他们将训练成本降低了高达37.58%。这就像仅仅因为更聪明地安排开灯时间,就获得了 37% 的电费折扣。
- 速度:他们并未减缓 AI 的学习速度。模型的训练效果与之前一样好;它们只是以更少的资源达到了同样的效果。
- 灵活性:研究人员仍然可以尝试新的、奇特的或复杂的 AI 训练方法,而无需重写整个系统。PlexRL 处理了数据移动这一繁琐的“管道”工作,让研究人员可以专注于数学本身。
nutshell(一句话总结)
PlexRL 是一个系统,它不再将 AI 训练任务视为孤立的岛屿,而是将它们视为繁忙的共享城市公交系统。它确保昂贵的“公交车”(计算机芯片)永远不会空载运行。通过智能地在同一硬件上切换不同的任务,它在不会让 AI 变笨的前提下,节省了巨额的资金和算力。
技术摘要:PlexRL
问题陈述
带有可验证奖励的强化学习(RLVR)已成为解锁大语言模型(LLM)推理能力的主导范式。然而,由于现代异构工作负载与现有训练框架之间的结构性不匹配,RLVR 训练的效率极低。
核心低效源于作业本地资源管理。当前系统将算法控制绑定到固定的私有模型部署上,导致三种主要失效模式:
- 拆分部署:虽然灵活,但它为不同阶段(推理与训练)预留了不相交的设备池。这导致显著的闲置时间,因为设备池在活跃与闲置状态之间交替。
- 共置部署:虽然共享状态,但它迫使推理阶段使用训练所需的相同大规模数据并行(DP)组。这导致推理期间的模型浮点运算利用率(MFU)低下,尤其是考虑到工具调用和解码的长尾特性,大多数 GPU 在等待少数活跃样本时处于闲置状态。
- 异步推理:虽然试图掩盖阶段不匹配,但它引入了算法陈旧性,且无法完全消除闲置时间,因为推理和训练的持续时间很少完美平衡。
这些低效是结构性的:在单个作业内,闲置间隙不可避免,但在不同作业之间,它们 largely 呈负相关。现有框架将细粒度的执行动态隐藏在粗糙的作业预留之后,阻止集群回收这些闲置时段。
方法论:PlexRL
作者提出了PlexRL,这是一个集群级运行时,可在多个 RLVR 作业之间复用统一的 LLM 服务。该系统将算法控制与特定于后端的执行解耦,将推理和训练视为共享的、可调度的集群资源,而非私有作业资产。
系统架构
PlexRL 由三个核心组件组成:
- 调度器:一个集中式控制器,执行集群范围的放置和运行时排序。它观察请求到达、模型驻留和亲和性约束,以便在共享的模型副本池上交错执行工作。它利用时空资源抽象(循环时间范围、分层资源视图和原子预留),将作业需求模式适配到可用的集群窗口中。
- 远程 LLM 执行服务:一个无状态的路由器(Router)和驻留于 GPU 的工作器(Workers)。路由器暴露一个狭窄的、面向函数的 API(前向、前向 - 后向、检查点、权重同步),并将逻辑部署映射到工作进程组(WPGs)。工作器代表远程客户端执行操作,将 RL 算法与底层分布式运行时(如 Megatron、FSDP)解耦。
- 状态管理器(StateManager):一个每节点守护进程,管理模型在三层层级(GPU HBM、主机 DRAM、NVMe)之间的驻留。它维护卸载状态的规范表示,以在副本间去重数据,并异步处理状态转换(加载、卸载、物化),保持 GPU 关键路径畅通。
关键机制
- 亲和性感知放置:调度器采用“双阶段”策略。对于新作业,它配置专用节点以提取干净的执行轨迹。对于已知轨迹的作业,它执行微移位(micro-shifting),将作业的周期性需求轨迹嵌入现有节点组的“空闲”窗口中,以最小化干扰。
- HRRS 调度(含设置时间的最高响应比):为了处理运行时调度,PlexRL 扩展了经典的 HRRN 算法。它根据等待时间和估计执行时间计算优先级,如果需要进行上下文切换(模型加载/卸载),则显式地放大成本分母。这鼓励将相似任务批处理以分摊设置成本,同时防止饥饿。
- 规范化状态管理:StateManager 不使用不透明的进程本地快照,而是通过逻辑键索引卸载的张量。这允许在副本间去重共享状态,并在权重同步期间实现零冗余重分片,避免完整的张量重建。
主要贡献
- 结构性低效的识别:本文证明,当前的 RLVR 框架由于作业本地执行设计而留下了显著的性能空间,这一局限性在拆分、共置和异步部署模式中普遍存在。
- PlexRL 系统:一个集群级复用系统,将算法控制与执行分离,实现了跨作业的推理和训练复用。
- 编排与状态管理:用于共享集群中大模型复用的新颖机制,包括时空调度、基于 HRRS 的运行时排序以及带有规范化卸载的集中式状态管理。
- 评估:实施与评估显示了有效集群容量的提升和成本的降低。
结果
作者在 2048 张 GPU 的集群上评估了 PlexRL,使用了涵盖 70 亿到 2350 亿参数(Qwen2.5/3 系列)模型的数学 RLVR 工作负载。
- 成本降低:与异步拆分部署相比,PlexRL 根据模型规模的不同,将用户 GPU 小时成本降低了31.36% 至 37.58%。
- 与共置部署的效率对比:PlexRL 显著优于共置基线。虽然共置设计因过大的推理 DP 组而遭受计算未饱和的困扰,但 PlexRL 实现了75.03%的实际吞吐量与峰值吞吐量之比,而共置部署仅为52.74%。
- 集群容量:使用真实世界作业统计数据的轨迹驱动模拟显示,PlexRL 的“分散 + 回填”策略将总工作负载完成时间缩短至隔离基线的56.0%,实际上使集群在相同容量预算下能够支撑1.8 倍更多的 RLVR 工作负载。
- 算法完整性:该系统保持了训练质量,奖励轨迹与基线匹配,证实复用不会改变算法语义。
意义与主张
本文认为,RLVR 集群中的主要低效并非原始加速器的短缺,而是由作业本地预留和阶段不对齐引起的碎片化。
PlexRL 声称通过以下方式提供大规模推理和智能体 LLM 训练的实用系统基础:
- 控制与执行解耦:允许研究人员针对稳定的执行接口进行编写,而非特定框架的内部细节,从而促进算法灵活性。
- 全局资源回收:将每个作业的闲置间隙转化为全局可调度机会,无需昂贵的模型迁移或侵入式框架手术。
- 成本效益:证明集群级复用可以显著降低训练高级推理模型的经济门槛,在保持算法灵活性的同时,将 GPU 小时成本降低高达 37.58%。
作者得出结论,未来的 RL 系统应将集群可见的执行和集中式状态管理视为首要的设计关注点,超越日益专业化的作业本地运行时的局限性。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。