Sword: Style-Robust World Models as Simulators via Dynamic Latent Bootstrapping for VLA Policy Post-Training
本文提出了Sword,一个鲁棒的世界模型框架,该框架采用结构引导的风格增强与动态潜在自举技术,以缓解闭环滚动中的泛化失败与误差累积问题,从而显著提升基于LIBERO基准的视觉 - 语言 - 动作策略的保真度及强化学习后训练成功率。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一个机器人执行任务,比如拿起一个杯子。通常,你必须让机器人在现实世界中练习,这既缓慢又昂贵,而且如果它弄坏了什么东西,还存在风险。为了解决这个问题,科学家们使用“世界模型”。可以把世界模型想象成一个超级智能的视频游戏引擎,机器人可以在其“脑海”中利用它进行练习。机器人不再移动真实的机械臂,而是“想象”未来:“如果我这样移动手臂,杯子接下来看起来会像这样。”
然而,当前的机器人视频游戏引擎存在两个大问题:
- 它们对场景过于挑剔。 如果你改变现实世界中的光照或桌子的颜色,机器人的想象就会陷入混乱,并开始产生幻觉(看到不存在的东西)。
- 它们玩得越久,表现越差。 如果机器人试图想象一连串较长的事件,最初几秒钟的微小错误会不断累积,将后续的视频变成模糊且毫无意义的混乱画面。
这篇论文介绍了一个名为Sword的新系统来解决这些问题。以下是其工作原理,使用了简单的类比:
1. “风格变换”健身房(结构引导的风格增强)
问题所在: 想象一个只在蓝色墙壁和明亮灯光的房间里练习过的机器人。如果你把它放进一个黄色墙壁和昏暗灯光的房间,它会惊慌失措,因为它从未学会“墙壁”就是墙壁,无论其颜色如何。它记住的是油漆,而不是物理规律。
Sword 的解决方案: 作者将机器人置于一个“风格变换健身房”中。他们使用一种特殊工具,不断改变训练视频的视觉效果——将墙壁变成红色、灯光变暗、桌子呈现木纹,或者将机械臂变成不同的颜色。
- 关键点: 他们并非随机改变颜色;而是使用一张“安全网”(几何引导),确保机器人不会迷失物体的位置。桌子可以改变颜色,但不能突然变成漂浮的云朵。
- 结果: 机器人不再死记硬背特定的颜色,而是开始学习真实的物理规则。它学会了“如果我推杯子,它就会滑动”,无论杯子看起来是什么样。这使得机器人能够更好地应对新的、未见过的环境。
2. “自我修正排练”(动态潜在自举)
问题所在: 想象一个正在参加考试的学生。在课堂上(训练阶段),老师会提供前一道题的答案,让他们专注于下一题。这被称为“教师强制”。但在真正的考试(推理阶段)中,学生必须记住自己之前的答案来解决下一个问题。如果他们在早期犯了一个小错误,就会陷入错误的循环中。
Sword 的解决方案: 作者创建了一种名为动态潜在自举的“自我修正排练”方法。
- 在练习过程中,他们不再总是给机器人提供完美的“真实值”答案,而是逐渐让机器人使用自己的预测作为下一步的起点。
- “记忆技巧”: 为了避免机器人的记忆爆炸(这将需要巨大的计算机存储),他们将机器人的“思考”压缩成一个微小、高效的缓存(就像一本高速记事本),而不是保存完整的视频帧。
- 结果: 机器人学会了在自身学习过程中从错误中恢复。它练习的方式与其在现实世界中的执行方式完全一致,因此当它真正需要执行任务时,不会在几秒钟后就崩溃。
结果
团队在名为LIBERO的标准机器人基准测试中测试了 Sword。
- 视觉质量: 当被要求想象一连串较长的事件时,Sword 保持了视频的清晰锐利。而旧方法(WoVR)变得模糊,并开始看到不存在的东西(幻觉)。
- 鲁棒性: 当光照或背景发生变化时,Sword 保持完美运行。而旧方法则立即失效。
- 成功率: 当他们使用 Sword 通过强化学习训练机器人策略时,机器人的任务成功率远高于使用旧模拟器训练的情况。
简而言之: Sword 是机器人更好的“造梦机器”。它教导机器人忽略表面的干扰(如光照变化),并训练它们处理自身的错误,从而造就一个能够准确想象未来并在现实世界中安全行动的机器人。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。