← 最新论文
🤖 machine learning

PlexRL: Cluster-Level Orchestration of Serviceized LLM Execution for RLVR

PlexRL 是一种集群级运行时,它通过在作业间复用统一的 LLM 服务以填补结构性空闲间隙,从而提升可验证奖励强化学习(RLVR)训练的效率,在无需昂贵模型迁移的情况下将用户 GPU 成本降低高达 37.58%。

原作者: Yiqi Zhang, Fangzheng Jiao, Tian Tang, Boyu Tian, Hangyu Wang, Qiaoling Chen, Guoteng Wang, Zhen Jiang, Peng Sun, Ping Zhang, Xiaohe Hu, Ziming Liu, Menghao Zhang, Yanmin Jia, Yang You, Siyuan Feng

发布于 2026-05-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Yiqi Zhang, Fangzheng Jiao, Tian Tang, Boyu Tian, Hangyu Wang, Qiaoling Chen, Guoteng Wang, Zhen Jiang, Peng Sun, Ping Zhang, Xiaohe Hu, Ziming Liu, Menghao Zhang, Yanmin Jia, Yang You, Siyuan Feng

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你经营着一家规模宏大、技术先进的烘焙坊。在这家烘焙坊里,你有两类主要工作:烘焙(需要一台巨大且昂贵的烤箱)和装饰(需要一个更小、更快的操作台)。

在人工智能领域,特别是训练“推理”模型(例如解决数学问题的模型)时,“烘焙”对应的是训练阶段,而“装饰”对应的是** rollout( rollout 阶段,即 AI 生成答案的阶段)**。

问题所在:“空烤箱”综合征

目前,大多数 AI 训练架构的运作方式就像这样一家烘焙坊:每一笔订单都配备专属的烤箱和装饰台,即便它们并非时刻都在使用。

  1. “分割式”烘焙坊:你有一支烘焙团队和一支装饰团队,但它们分班次工作。当烘焙师工作时,装饰师就闲置;当装饰师工作时,烘焙师就闲置。你支付了整整两支队伍的费用,但同一时间只有一支队伍在工作。
  2. “集中式”烘焙坊:你将烘焙师和装饰师安排在同一个房间以节省空间。但由于烤箱过于巨大(因为 AI 模型规模庞大),装饰团队必须等烘焙师完成工作后才能触碰操作台。对于小型的装饰任务而言,烤箱往往过大,造成能源浪费。
  3. “异步式”烘焙坊:你尝试让装饰师处理昨天的蛋糕,而烘焙师处理今天的蛋糕。这虽有一定帮助,但最终时间安排会变得混乱,导致蛋糕变 stale(不新鲜),或者你依然得等待。

这篇论文将这种现象称为**“作业局部低效”**。每一个 AI 训练任务都存在这些“空闲间隙”,昂贵的计算机芯片(GPU)就这样闲置着无所事事。

解决方案:PlexRL(“共享厨房”系统)

作者构建了一个名为PlexRL的系统。PlexRL 不再为每个 AI 任务提供独立的私人厨房,而是将整个数据中心变成一个巨大的共享厨房。

以下是其运作方式,沿用我们的烘焙坊类比:

  • 中央管理器(调度器):想象一位主厨,他并不关心具体是哪一笔烘焙订单,他只关心任务。他看到任务 A 当前处于“装饰”状态(仅使用烤箱的一小部分),而任务 B 处于“烘焙”状态(使用烤箱的大部分)。
  • 时间切片:管理者意识到,当任务 A 等待工具送达时,任务 B 可以在那几秒钟内使用同一台烤箱。PlexRL 快速地将“状态”(食谱和当前蛋糕)在烤箱中切换进出。
  • 无需移动烤箱:通常,将一台巨型烤箱搬移到新厨房需要耗费漫长时间。PlexRL 很聪明:它将烤箱固定在原地,只是极快地将食材(AI 模型的内存)在烤箱中切换进出。它使用一个“状态管理器”来追踪每个食材的位置,无论是在操作台上(高速内存)还是在冷冻柜中(较慢的存储)。

魔法技巧:“负相关”间隙

其中的秘诀在于,不同 AI 任务的“空闲时间”很少同时发生。

  • 任务 A 可能正在等待工具调用(长时间的停顿)。
  • 任务 B 可能正处于激烈的数学计算中(无停顿)。

PlexRL 用任务 B 的工作填补任务 A 的停顿。这就像一位出租车司机,先载一位向北的乘客,然后立即载一位向南的乘客,而不是空车开回车库。

结果

该论文在由 2,048 块计算机芯片(GPU)组成的庞大集群上测试了此系统,用于训练不同规模(从小型到巨型)的 AI 模型。

  • 成本节约:通过填补所有这些空闲间隙,他们将训练成本降低了高达37.58%。这就像仅仅因为更聪明地安排开灯时间,就获得了 37% 的电费折扣。
  • 速度:他们并未减缓 AI 的学习速度。模型的训练效果与之前一样好;它们只是以更少的资源达到了同样的效果。
  • 灵活性:研究人员仍然可以尝试新的、奇特的或复杂的 AI 训练方法,而无需重写整个系统。PlexRL 处理了数据移动这一繁琐的“管道”工作,让研究人员可以专注于数学本身。

nutshell(一句话总结)

PlexRL 是一个系统,它不再将 AI 训练任务视为孤立的岛屿,而是将它们视为繁忙的共享城市公交系统。它确保昂贵的“公交车”(计算机芯片)永远不会空载运行。通过智能地在同一硬件上切换不同的任务,它在不会让 AI 变笨的前提下,节省了巨额的资金和算力。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →