← 最新论文
🤖 machine learning

GROW: Aligning GRPO with State-Action Modeling for Open-World VLM Agents

该论文介绍了 GROW,这是一个强化学习框架,通过将完整轨迹分解为状态 - 动作样本以克服上下文长度限制,从而将组相对策略优化(GRPO)适配于开放世界视觉 - 语言模型智能体,并在超过 800 个《我的世界》任务中实现了最先进的性能。

原作者: Xiongbin Wu, Zhihao Luo, Shanzhe Lei, Lechao Zhang, Xuhong Wang, Jie Yang, Zhonglong Zheng, Yuanjie Zheng, Xin Tan, Wei Liu

发布于 2026-05-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Xiongbin Wu, Zhihao Luo, Shanzhe Lei, Lechao Zhang, Xuhong Wang, Jie Yang, Zhonglong Zheng, Yuanjie Zheng, Xin Tan, Wei Liu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人玩像《我的世界》(Minecraft)这样复杂的电子游戏。这个机器人有一台摄像头(它的眼睛),可以敲击键盘并移动鼠标(它的手)。它的目标是完成诸如“建造一座房子”、“开采黄金”或“击败怪物”之类的任务。

很长一段时间以来,训练这些机器人的最佳方法是监督微调(SFT)。这就像向机器人展示一段人类专家完美游玩游戏的视频,并说:“完全照搬他们做的。”问题在于?寻找数小时完美的真人游戏录像成本高昂,而且如果机器人只是死记硬背这段视频,一旦游戏发生细微变化,它就会感到困惑。

随后,研究人员尝试了强化学习(RL),特别是称为GRPO的算法。这就像让机器人玩游戏,经历失败与成功,并从结果中学习。然而,标准的 GRPO 在应用于开放世界游戏时存在一个重大缺陷:它将整个游戏会话视为单一的一堂课。

问题:过于冗长的“课程”

想象一下,你正在学习如何烤蛋糕。

  • 标准 GRPO 就像递给你一本 500 页的书,书中混杂着你童年的故事、三天前的天气预报、食谱以及你邻居的狗的故事。它告诉你:“你最后烤出了好蛋糕,所以这本 500 页书里的所有内容都是好的。”
  • 在论文中,这被称为**“完整轨迹”**。随着机器人在《我的世界》中游玩,它所看到和所做内容的历史变得越来越长。最终,这本“书”变得如此巨大且充满了无关的噪音(比如在找到方块前漫无目的地走了 10 分钟),以至于机器人不堪重负,无法弄清楚究竟是哪个具体动作导致了成功。

解决方案:GROW(“食谱卡片”方法)

作者提出了一种名为GROW(将 GRPO 与状态 - 动作建模对齐)的新框架。

GROW 不是给机器人整本 500 页的书,而是将游戏会话切割成微小的、易于消化的**“食谱卡片”**。

  • 状态 - 动作分解:GROW 将漫长的游戏会话分解为独立的瞬间:“观察方块” + “点击鼠标” + “镐子击中”。
  • 智能反馈:如果机器人在最后成功了,GROW 不会说“整个游戏过程都很棒”。相反,它会审视那些导致胜利的具体卡片。它会说:“你在找到黄金前 5 秒做出的那个动作非常好。而你 20 分钟前漫无目的走动时做出的那个动作?那只是还行。”

工作原理(类比)

想象一位教练在训练一名足球运动员。

  • 旧方法(标准 GRPO):教练观看整场 90 分钟的比赛,看到球员进球后,大喊:“干得漂亮!从第一分钟到最后一分钟,你做的每件事都对!”球员会感到困惑,因为他们实际上在第 10 分钟犯了一个糟糕的传球,差点导致输掉比赛。
  • GROW 方法:教练将比赛分解。“第 10 分钟的那个传球很 sloppy(草率)。但第 80 分钟那次跑位?完美。第 89 分钟的那次射门?精彩。”球员能确切地知道应该重复哪些具体动作。

“魔法”数学

论文包含了一个数学证明(替代分析),以向我们保证这种“切割课程”的方法仍然是有效的。

  • 担忧:此类学习的标准数学方法通常要求比较在完全相同的起始点进行的多次尝试。而 GROW 比较的是不同时间点的时刻,这些时刻各不相同。
  • 结果:作者证明,即使起始点不同,机器人获得的“分数”仍然能准确反映其策略的优劣。这就像给学生数学考试打分:即使题目不同,最终成绩仍然能告诉你他们是否在数学上取得了进步。

结果:战胜游戏

该团队在超过800 个不同的《我的世界》任务上测试了 GROW,范围从探索洞穴到制作物品和对抗怪物。

  • 成功率:GROW 显著优于以往的方法。例如,在“图形用户界面(GUI)任务”(使用游戏菜单制作物品)中,成功率从约 39% 跃升至68%
  • 效率:机器人不仅赢得了更多,而且赢得更快。它完成任务所需的步数更少,因为它学会了忽略“噪音”,专注于真正重要的动作。
  • 泛化能力:机器人不仅仅是死记硬背它练习过的特定游戏。它学会了通用技能(如如何寻找目标或如何使用菜单),这使它能够成功完成从未见过的新任务

总结

GROW 是一种更聪明的方法,用于训练 AI 智能体玩开放世界游戏。它不会用整个游戏会话冗长且混乱的历史让 AI 不堪重负,而是将游戏分解为清晰的小步骤。这有助于 AI 确切地理解哪些动作能带来成功,使其能够学得更快、玩得更好,并在面对新挑战时不会感到困惑。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →