← 最新论文
💻 computer science

WAM-RL: World-Action Model Reinforcement Learning with Reconstruction Rewards and Online Video SFT

本文介绍了 WAM-RL,这是一种新型的强化学习框架,它通过重构奖励实现了世界模型与动作模型的联合在线优化,证明了协同演化这两个组件对于在超越仅专家训练限制的长时程操纵任务中取得强劲性能至关重要。

原作者: Zezhong Qian, Xiaowei Chi, Yu Qi, Haozhan Li, Zhi Yang Chen, Shanghang Zhang

发布于 2026-06-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Zezhong Qian, Xiaowei Chi, Yu Qi, Haozhan Li, Zhi Yang Chen, Shanghang Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在教一个机器人完成一项复杂的任务,比如给植物浇水或堆叠积木。传统上,我们通过向机器人展示专家完美完成工作的视频来教它。机器人记住了这些视频并试图模仿它们。这对于简单的任务效果很好,但如果机器人犯了一个微小的错误,它往往会陷入混乱并彻底失败,因为它从未学会如何从中恢复。

这篇论文介绍了一种名为 WAM-RL 的新系统。可以把它想象成在机器人实际执行任务的过程中,让它的“大脑”和“身体”协同学习,而不是仅仅通过观看视频。

以下是其工作原理的拆解,分为几个简单概念:

1. 两个部分:“想象者”与“执行者”

大多数先进的机器人模型都有两个主要部分:

  • 世界模型(想象者): 这部分就像是机器人脑海中的电影导演。在机器人移动之前,它会想象未来会是什么样子。“如果我这样移动手臂,积木会掉落。如果我那样移动,它会保持不动。”它在预测未来。
  • 动作模型(执行者): 这是机器人的身体。它接收“想象者”创造的“电影”,并将其转化为实际的肌肉运动。

问题所在: 在旧系统中,“想象者”是固定的。它是基于完美的视频进行训练的,并且从不改变。如果现实世界与完美的视频不符(例如机器人掉落了一个积木),“执行者”将不知道如何修复,因为它的“想象者”无法预测发生了错误。

2. 解决方案:共同成长的团队

作者创建了一个框架,让**“想象者”和“执行者”**在实时过程中相互学习。

  • “执行者”得到了一个新教练: “执行者”不再只是在任务结束时得到“做得好”或“做得不好”的评价,而是根据其实际动作与“想象者”预测的匹配程度获得持续的评分。如果机器人想象积木会保持不动,但实际上积木掉了,那么“执行者”就会受到“惩罚”。这教会了“执行者”按照计划进行运动。
  • “想象者”得到了现实检查: “想象者”使用机器人成功的真实视频进行更新。至关重要的是,作者添加了一个“安全网”(称为 KL 正则化)。想象一下,“想象者”是一个正在学习新事物的学生。“安全网”防止这个学生忘记已有的知识,或让其性格发生过于剧烈的变化。它确保“想象者”在改进其预测能力的同时,不会破坏与“执行者”的连接。

3. 重大发现:你不能只训练身体

论文通过实验发现了一个非常重要的现象:

  • 短期任务: 如果你只训练“执行者”(身体)而让“想象者”(大脑)保持不变,机器人会在快速、简单的任务中表现得更好。
  • 长期任务: 对于需要较长时间的复杂任务,仅训练身体会失败。为什么?因为身体受限于大脑预测未来的能力。如果大脑在预测中出现了一个微小的误差,身体无法修复它,误差会不断累积,直到机器人失败。

类比: 想象你在玩一款电子游戏,你是角色(执行者),但地图(想象者)有一点错误。如果游戏很短,你可以靠直觉闯关。但如果游戏很长,错误的地图最终会把你带下悬崖。你需要一边玩一边修复地图,而不仅仅是提高角色的奔跑速度。

4. 如何衡量成功

他们没有仅仅检查机器人是否完成了任务,而是使用了一个聪明的技巧。他们对比了**“想象的未来”(机器人认为会发生什么)与“真实的未来”**(实际发生了什么)。

  • 如果机器人想象积木会保持不动,且积木确实没动,那就是高分。
  • 如果机器人想象积木会保持不动,但积木却掉了,那就是低分。
    这有助于机器人学习更准确地预测现实,进而帮助它更好地行动。

5. 结果:学会从错误中恢复

最令人兴奋的结果是,这个系统教会了机器人如何从错误中恢复。

  • 没有这个系统: 如果机器人尝试抓取积木但失败了,它会继续以同样错误的方式尝试抓取,最终放弃。
  • 有了这个系统: “想象者”学会了预测可能会发生失误。然后它“想象”了一个恢复计划(比如把手退回并再次尝试)。“执行者”看到了这个计划并执行了它。机器人学会了说:“噢,我失手了,让我换个角度再试一次,”并最终成功。

总结

WAM-RL 是一种让机器人的“大脑”(预测)和“身体”(动作)在实时过程中共同学习的方法。通过让它们同时提升,机器人能够更好地处理长期、复杂的任务,最重要的是,它学会了在事情出错时如何修复自己的错误,而不是仅仅宣告失败。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →