Group-Graph Policy Optimization for Long-Horizon Agentic Reinforcement Learning
本文提出了组图策略优化(Group-Graph Policy Optimization, G2PO),这是一种新颖的基于组的强化学习算法,它通过将线性交互轨迹转化为全局状态转移图来缓解奖励稀疏性并改善信用分配,从而显著提升大语言模型在长程智能体任务中的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一个非常聪明但缺乏经验的机器人去解决一个复杂的谜题,比如在巨大的、杂乱无章的仓库中寻找特定物品,或者在网站上购买完美的礼物。机器人必须完成许多步骤(转折)才能完成任务,而它在整个过程中只有在最后结束时才会得到“做得好!”或“再试一次”的反馈。
目前教学方法的问题在于,它们将机器人的旅程视为一条直线。如果机器人在很早的时候做了一个很棒的动作,但随后在过程中绊倒了自己的脚,整个旅程都会被标记为失败。机器人会误以为那个很棒的动作其实是糟糕的,这会让它感到困惑并减慢学习速度。
这篇论文介绍了一种新的教学方法,称为 G2PO(组图策略优化)。它是如何工作的,我们用简单的类比来说明:
1. 从直线到路径之网
目前的教学方法观察机器人走完从起点到终点的某一条特定的直线路径。如果机器人卡住了,这条路径就是一个死胡同。
G2PO 改变了视角。它不是看一条直线,而是构建了一个包含机器人尝试过的所有路径的巨大网络(或图)。
- 类比: 想象机器人正在探索一个洞穴。目前的教学方法只关注其中一条特定的隧道。G2PO 则观察整个洞穴地图。它注意到,尽管机器人采取了不同的路线,但它经常会多次进入同一个房间(状态)。
2. 对错误的“集体拥抱”(组聚合)
在旧的方法中,如果机器人进入某个特定的房间后失败了,那个房间就会被标记为“坏”。如果稍后机器人再次进入同一个房间并成功了,那个房间就会被标记为“好”。这会让人感到困惑,因为房间本身并没有改变,改变的是之后的路径。
G2PO 说:“让我们看看机器人所有进入那个特定房间的情况。”
- 类比: 想象一位老师在给学生的作业评分。老师不是通过批改单次考试并说“你不及格”来评分,而是查看学生针对同一主题参加的 10 次不同测试。如果学生答对了 7 次,答错了 3 次,老师就会意识到:“啊,这个学生其实对这个主题掌握得很好,那 3 次错误只是运气不好。”
- 结果: 这防止了机器人因为运气不好而受到惩罚,并奖励它做出正确的决策,即使最终结果因为后期的错误而失败。
3. 评判步伐,而非仅仅是目的地(以边为中心的优势)
目前的教学方法通常只将机器人的一个动作与在同一个房间内可以进行的其他动作进行比较。
G2PO 观察的是跳跃本身的价值。它会问:“与起始点相比,这个特定的动作让机器人离目标更近了多少?”
- 类比: 想象一名登山者正在攀登。
- 旧方法: “你向上迈了一步。很好。但你稍后又向上迈了一步。你的第一步比第二步更好吗?”(局部比较步伐)。
- G2PO: “你从山脚(低价值)出发。你迈出了一步,落在了半山腰(高价值)。这是一个巨大的飞跃!即使你后来从悬崖跌落,那个特定的步伐也是极其精彩的。”
- 结果: G2PO 识别出了那些真正推动任务前进的“关键跨越”,并给予它们额外的奖励,同时忽略那些无关紧要的小步。
4. 为什么这很重要
论文在三个困难任务上测试了该方法:
- WebShop: 在线购物。
- ALFWorld: 在模拟房屋中做家务。
- AppWorld: 编写代码来管理应用程序。
结果:
- 机器人的学习速度更快,犯错更少。
- 它的成功率显著高于以往的方法(在某些情况下高出 22%)。
- 最棒的部分是: 它完成这一切并不需要更多的计算能力。它只是以一种更聪明的方式组织了已有的数据(就像通过整理凌乱的桌面来更快找到东西,而不是买一张更大的桌子)。
总结:
G2PO 不再将机器人的学习旅程视为一条单一且脆弱的线。相反,它构建了一张包含所有可能性的地图,通过平均化运气来寻找真相,并奖励那些真正让它接近目标的特定步骤。这就像是从一个只显示一条路线的 GPS,升级到了一个了解整个城市并能准确告诉你哪个转弯最重要的智能导航系统。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。