RollArt: Disaggregated Multi-Task Agentic RL Training at Scale
RollArt 是一个解耦的多任务智能体强化学习系统,它通过将流水线阶段映射到专用硬件、解耦轨迹级交互以消除同步瓶颈,并将采样与训练通过异步权重更新进行重叠,从而优化了训练吞吐量和可扩展性,在大型集群上实现了高达 2.05 倍的训练加速。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在试图教一个聪明但非常特殊的机器人(一个人工智能)如何解决复杂的问题,比如编写软件代码或浏览网站。为了做到这一点,你不仅仅是给它一本教科书;而是让它在真实的模拟环境中进行练习。这个过程被称为智能体强化学习(Agentic Reinforcement Learning)。
这篇论文介绍了一个名为 ROLLART 的新系统,它充当了这个训练过程中超级高效的“交通指挥官”。以下是它的工作原理,我们使用简单的类比来解释。
问题所在:“一刀切”导致的交通拥堵
想象一个工厂,一个团队的工人必须承担三项完全不同的工作:
- 思考: 解决难题(需要快速的大脑)。
- 阅读: 快速阅读长篇书籍(需要敏锐的双眼)。
- 建造: 组装物理零件(需要强壮的双手)。
在旧有的系统中,所有人都在使用同一种类型的工人。如果你把一个“快脑型”工人分配给“阅读”任务,他们会很慢;如果你把一个“强手型”工人分配给“数学”任务,他们也会很慢。此外,如果一名工人因为修理一个坏掉的玩具而卡住了(即“掉队者”),整个工厂都必须停下来等他,才能进入下一个步骤。这造成了巨大的延误。
解决方案:ROLLART 的专业化流水线
ROLLART 通过将工厂划分为专门的区域,并让不同的团队按自己的速度工作来解决这个问题。
1. 将工人与正确的工具相匹配(硬件亲和性)
该系统意识到,某些任务需要计算能力(如解决数学问题),而另一些任务则需要内存速度(如阅读长文本)。
- 旧方式: 所有人都在使用同一种昂贵且重型的计算机。
- ROLLART 的方式: 它将“数学”任务发送到超快速计算机,将“阅读”任务发送到拥有巨大、快速内存的计算机。这就像是将厨师送到配备了高性能炉灶的厨房,将图书管理员送到拥有庞大且快速索引卡的图书馆。他们能更快地完成工作,因为他们使用了最合适的工具。
2. 让工人按自己的节奏移动(轨迹级异步性)
在旧工厂里,如果一名工人完成任务用了 10 分钟,而其他工人只用了 1 分钟,那么整条生产线都会停顿 10 分钟。
- ROLLART 的方式: 它将每一次练习过程(称为“轨迹”)视为一个独立的项目。如果一个机器人卡在一个难题上,其他机器人会继续处理自己的难题。系统不会等待那个慢下的机器人,而是让快速的机器人继续前进。一旦慢下的机器人终于完成任务,它会被评分,随后快速的机器人就会进入新的任务。
3. 为简单任务雇佣“零工”(无服务器卸载)
在机器人完成任务后,需要有人对其进行评分。有时这只是一个简单的检查(例如“门开了吗?”),有时则是另一台 AI 进行的复杂评审。
- 旧方式: 你保留了一支昂贵的高性能计算机团队,让他们在等待为这些简单任务评分时处于闲置状态。即使在没有工作时,维持这些计算机“待命”也是非常昂贵的。
- ROLLART 的方式: 它使用“零工”(无服务器云计算)。你只在实际发生评分时才付费。如果没有人在评分,你就无需支付费用。这释放了昂贵的计算机,让它们能够专注于更困难的工作。
4. 边学边教(有界滞后训练)
通常情况下,老师(训练计算机)和学生(练习中的机器人)是轮流进行的。学生进行练习,然后停止,等待老师更新其知识,然后再次开始。
- ROLLART 的方式: 老师和学生同时工作。学生在利用“昨天版本的”老师知识进行练习的同时,老师正在忙于更新“今天的版本”。系统会确保学生不会落后得太远(使用“滞后界限”),但他们永远不需要停下来等待。这就像教练在运动员冲刺时向其喊出新的指令,而不是在教练每次有了新建议时都让运动员回到起跑线重新开始。
结果
该论文在大规模环境下测试了这个系统(使用了阿里巴巴的 3,000 多台计算机)。
- 速度: 它使训练过程比以往的方法快了 1.3 到 2 倍。
- 效率: 它停止了在闲置任务上浪费昂贵的计算能力。
- 稳定性: 它证明了即使出现意外情况(如计算机崩溃或任务耗时过长),系统仍能持续运行而不崩溃。
简而言之,ROLLART 是一个聪明的管理者,它终结了 AI 训练中的“等待游戏”。它将正确的任务分配给正确的计算机,让快速的工人即使在他人滞后时也能继续前进,并利用廉价的、按需提供的帮助来处理琐事,从而实现了一种更快、更便宜的先进 AI 训练方式。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。