← 最新论文
💻 computer science

Persistent Robot World Models: Stabilizing Multi-Step Rollouts via Reinforcement Learning

该论文提出了一种结合对比强化学习与多视角视觉保真度奖励的 RL 后训练方案,通过让机器人世界模型在自身自回归滚装上学习,有效解决了多步预测中的误差累积问题,并在 DROID 数据集上实现了当前最优的滚动保真度。

原作者: Jai Bardhan, Patrik Drozdik, Josef Sivic, Vladimir Petrik

发布于 2026-03-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Jai Bardhan, Patrik Drozdik, Josef Sivic, Vladimir Petrik

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文讲述了一个关于**让机器人“学会做梦”并且“不做噩梦”**的故事。

想象一下,你正在教一个机器人如何像人类一样思考未来。为了做到这一点,我们给机器人装了一个“世界模型”(World Model)。你可以把这个模型想象成机器人的**“想象力引擎”**。

1. 核心问题:为什么机器人的“想象力”会崩塌?

在传统的训练方法中,我们教机器人看视频。

  • 训练时(老师强迫): 老师给机器人看一段真实的视频,然后问:“接下来会发生什么?”机器人回答后,老师立刻把真实的答案(Ground Truth)塞给它,说:“看,这才是对的,继续猜下一段。”
  • 结果: 机器人很聪明,因为它总是看着“标准答案”来猜。

但是,当机器人真正去执行任务时(测试时):

  • 现实情况: 没有老师,没有标准答案。机器人必须根据自己刚才猜出来的画面,去猜再下一段画面。
  • 灾难发生: 就像“传话游戏”(Telephone Game)。
    • 机器人猜第一段画面时,稍微歪了一点点(比如把碗画得有点扁)。
    • 它把这段“有点扁的碗”当作真实画面,去猜第二段。
    • 因为输入已经是歪的,它猜出的第二段就更歪了(碗可能变成了方块)。
    • 猜第三段时,碗可能直接融化成一团浆糊,或者机器人手臂突然消失了。
    • 这就是论文里说的“误差累积”(Error Compounding)。 机器人的想象力在几秒钟内就会彻底崩溃,画面变得乱七八糟。

2. 解决方案:让机器人“自我反省”(强化学习)

作者们想出了一个绝妙的主意:别光听老师的话,让机器人在自己的“梦境”里练习。

他们给机器人装了一个**“强化学习”(RL)的模块,这就像是一个严厉的体育教练**。

  • 新的训练方式:
    1. 让机器人自己从头到尾生成一段很长的视频(就像它自己在做梦)。
    2. 在这个过程中,机器人可能会犯错(比如碗变扁了)。
    3. 教练(奖励机制)出场: 教练拿着真实的视频做对比,给机器人的“梦境”打分。
      • 如果机器人生成的画面清晰、物体没变形,给高分(奖励)
      • 如果画面开始崩坏,给低分(惩罚)
    4. 关键创新: 教练不是直接告诉机器人“正确答案是什么”,而是让机器人对比它生成的几个不同版本的“梦境”。
      • “嘿,你看,版本 A 里的碗还像个碗,但版本 B 里的碗已经化成水了。你要向版本 A 学习,远离版本 B。”

3. 具体是怎么做的?(三个聪明的技巧)

为了让这个“自我反省”的过程更有效,作者用了三个巧妙的比喻:

  • 技巧一:对比学习(Contrastive RL)

    • 比喻: 就像在选美比赛中,不是给每个模特打分,而是让模特两两 PK。
    • 机器人一次生成 16 个不同的未来视频片段。教练挑出最好的那个(比如物体最稳的)和最差的那个(物体最烂的)。
    • 告诉模型:“你要努力变成那个最好的,坚决不要变成那个最差的。”这种**“比烂”“比好”**的对比,比单纯告诉它“正确答案”更能让它学会如何保持长期稳定。
  • 技巧二:随机打断(Variable-length Prefix)

    • 比喻: 就像练长跑,不能只练起跑,也不能只练最后冲刺。
    • 训练时,有时候让机器人从第 1 秒开始猜,有时候让它从第 9 秒(已经有点累了、有点晕了)开始猜。
    • 这样机器人就学会了:无论我是刚醒来(状态好),还是已经晕头转向(状态差),我都要努力保持画面不崩塌。
  • 技巧三:多视角打分(Multi-view Rewards)

    • 比喻: 就像拍电影,不能只看一个机位。
    • 机器人有三个摄像头(两个看全景,一个看手腕)。教练会同时检查这三个角度的画面。
    • 如果机器人只把背景画得很清楚,但手里的杯子画崩了,教练会扣分。这迫使机器人必须关注真正重要的东西(比如被操作的物体和机械臂),而不是只画背景。

4. 结果如何?

经过这种“自我反省”的训练,机器人的“想象力”发生了质的飞跃:

  • 以前: 猜 3 秒钟,碗就融化成一团浆糊(如图 1 所示,Baseline 模型)。
  • 现在: 猜 10 秒钟,碗依然稳稳当当,形状完整,甚至能看清上面的纹理(如图 1 所示,Ours 模型)。
  • 人类评价: 让真人看视频,80% 的人觉得新模型生成的视频更真实、更连贯。

总结

这篇论文的核心思想就是:不要只教机器人“背诵标准答案”,要教它“在犯错中自我修正”。

通过让机器人自己在生成的视频里“试错”,并用强化学习告诉它“哪种未来是好的,哪种是坏的”,我们成功解决了机器人长期预测中画面崩塌的难题。这让机器人拥有了更持久、更可靠的“想象力”,未来可以用来在虚拟世界里更安全、更高效地练习各种复杂的任务(比如做饭、组装零件),而不用担心它在模拟中把自己“玩坏”了。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →