← 最新论文
🤖 AI

RollArt: Disaggregated Multi-Task Agentic RL Training at Scale

RollArt 是一个解耦的多任务智能体强化学习系统,它通过将流水线阶段映射到专用硬件、解耦轨迹级交互以消除同步瓶颈,并将采样与训练通过异步权重更新进行重叠,从而优化了训练吞吐量和可扩展性,在大型集群上实现了高达 2.05 倍的训练加速。

原作者: Wei Gao, Yuheng Zhao, Tianyuan Wu, Shaopan Xiong, Weixun Wang, Dakai An, Lunxi Cao, Dilxat Muhtar, Zichen Liu, Haizhou Zhao, Ju Huang, Siran Yang, Yongbin Li, Wenbo Su, Jiamang Wang, Lin Qu, Bo Zheng
发布于 2026-06-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Wei Gao, Yuheng Zhao, Tianyuan Wu, Shaopan Xiong, Weixun Wang, Dakai An, Lunxi Cao, Dilxat Muhtar, Zichen Liu, Haizhou Zhao, Ju Huang, Siran Yang, Yongbin Li, Wenbo Su, Jiamang Wang, Lin Qu, Bo Zheng, Wei Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教一个聪明但非常特殊的机器人(一个人工智能)如何解决复杂的问题,比如编写软件代码或浏览网站。为了做到这一点,你不仅仅是给它一本教科书;而是让它在真实的模拟环境中进行练习。这个过程被称为智能体强化学习(Agentic Reinforcement Learning)

这篇论文介绍了一个名为 ROLLART 的新系统,它充当了这个训练过程中超级高效的“交通指挥官”。以下是它的工作原理,我们使用简单的类比来解释。

问题所在:“一刀切”导致的交通拥堵

想象一个工厂,一个团队的工人必须承担三项完全不同的工作:

  1. 思考: 解决难题(需要快速的大脑)。
  2. 阅读: 快速阅读长篇书籍(需要敏锐的双眼)。
  3. 建造: 组装物理零件(需要强壮的双手)。

在旧有的系统中,所有人都在使用同一种类型的工人。如果你把一个“快脑型”工人分配给“阅读”任务,他们会很慢;如果你把一个“强手型”工人分配给“数学”任务,他们也会很慢。此外,如果一名工人因为修理一个坏掉的玩具而卡住了(即“掉队者”),整个工厂都必须停下来等他,才能进入下一个步骤。这造成了巨大的延误。

解决方案:ROLLART 的专业化流水线

ROLLART 通过将工厂划分为专门的区域,并让不同的团队按自己的速度工作来解决这个问题。

1. 将工人与正确的工具相匹配(硬件亲和性)

该系统意识到,某些任务需要计算能力(如解决数学问题),而另一些任务则需要内存速度(如阅读长文本)。

  • 旧方式: 所有人都在使用同一种昂贵且重型的计算机。
  • ROLLART 的方式: 它将“数学”任务发送到超快速计算机,将“阅读”任务发送到拥有巨大、快速内存的计算机。这就像是将厨师送到配备了高性能炉灶的厨房,将图书管理员送到拥有庞大且快速索引卡的图书馆。他们能更快地完成工作,因为他们使用了最合适的工具。

2. 让工人按自己的节奏移动(轨迹级异步性)

在旧工厂里,如果一名工人完成任务用了 10 分钟,而其他工人只用了 1 分钟,那么整条生产线都会停顿 10 分钟。

  • ROLLART 的方式: 它将每一次练习过程(称为“轨迹”)视为一个独立的项目。如果一个机器人卡在一个难题上,其他机器人会继续处理自己的难题。系统不会等待那个慢下的机器人,而是让快速的机器人继续前进。一旦慢下的机器人终于完成任务,它会被评分,随后快速的机器人就会进入新的任务。

3. 为简单任务雇佣“零工”(无服务器卸载)

在机器人完成任务后,需要有人对其进行评分。有时这只是一个简单的检查(例如“门开了吗?”),有时则是另一台 AI 进行的复杂评审。

  • 旧方式: 你保留了一支昂贵的高性能计算机团队,让他们在等待为这些简单任务评分时处于闲置状态。即使在没有工作时,维持这些计算机“待命”也是非常昂贵的。
  • ROLLART 的方式: 它使用“零工”(无服务器云计算)。你只在实际发生评分时才付费。如果没有人在评分,你就无需支付费用。这释放了昂贵的计算机,让它们能够专注于更困难的工作。

4. 边学边教(有界滞后训练)

通常情况下,老师(训练计算机)和学生(练习中的机器人)是轮流进行的。学生进行练习,然后停止,等待老师更新其知识,然后再次开始。

  • ROLLART 的方式: 老师和学生同时工作。学生在利用“昨天版本的”老师知识进行练习的同时,老师正在忙于更新“今天的版本”。系统会确保学生不会落后得太远(使用“滞后界限”),但他们永远不需要停下来等待。这就像教练在运动员冲刺时向其喊出新的指令,而不是在教练每次有了新建议时都让运动员回到起跑线重新开始。

结果

该论文在大规模环境下测试了这个系统(使用了阿里巴巴的 3,000 多台计算机)。

  • 速度: 它使训练过程比以往的方法快了 1.3 到 2 倍
  • 效率: 它停止了在闲置任务上浪费昂贵的计算能力。
  • 稳定性: 它证明了即使出现意外情况(如计算机崩溃或任务耗时过长),系统仍能持续运行而不崩溃。

简而言之,ROLLART 是一个聪明的管理者,它终结了 AI 训练中的“等待游戏”。它将正确的任务分配给正确的计算机,让快速的工人即使在他人滞后时也能继续前进,并利用廉价的、按需提供的帮助来处理琐事,从而实现了一种更快、更便宜的先进 AI 训练方式。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →