← 最新论文
💻 computer science

SelfWAM: A Self-Grounded Unified World Action Model for Fast Robot Control

SelfWAM 是一个统一的世界动作模型,它通过结合机器人自身掩码(robot self-masks)来共同预测动作及以动作为条件的未来观测,从而在确保预测能够反映特定动作后果的同时,保持快速的推理速度,进而增强机器人策略学习。

原作者: Bikang Pan, Fan Liu, Haotao Lu, Jingya Wang, Ye Shi

发布于 2026-08-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Bikang Pan, Fan Liu, Haotao Lu, Jingya Wang, Ye Shi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在教一个机器人做三明治。你向它展示了一段人类切番茄的视频。一个简单的机器人可能只会记住番茄和刀的图像,然后尝试模仿手的动作。但问题的关键在于:如果机器人仅仅是观察图像,它并不能真正理解番茄为什么会移动。它不知道如果它用力推刀,番茄会切得更快;也不知道如果它推的方向不对,番茄会从桌子上滚落。

这就是机器人领域中“世界动作模型”(World Action Models)所面临的挑战。这些模型是特殊的 AI 大脑,试图根据机器人此时此刻正在做的动作来预测未来的样子。把它们想象成机器人的“想象力”。如果机器人能够想象未来,它就能更好地进行规划。但在很长一段时间里,它们的想象力都有些像是在白日梦:它们可以猜出场景在几秒钟后的样子,但并不擅长将这些猜测与机器人实际做出的具体动作联系起来。它们就像是在看电影并猜测结局,却不知道角色刚刚做了什么。科学家们面临的核心问题是:我们如何教会机器人,让它的想象力专门针对其自身的动作而产生,从而让它不仅学习发生了什么,还学习自己的身体是如何导致这些变化的?

于是有了 SelfWAM,一种全新的方法,它扮演着机器人“自我意识”想象教练的角色。这项研究背后的研究人员意识到,之前的方法缺失了一个至关重要的环节:机器人并没有被强制要求将其特定的动作与它所看到的视觉变化联系起来。为了解决这个问题,他们构建了一个系统,迫使机器人同时关注两件事:未来的场景视频,以及一个穿梭于该场景中的机器人自身身体的“幽灵”轮廓。

这里我用一个简单的类比来解释 SelfWAM 是如何工作的。想象你正在学习杂耍。标准的 AI 可能会观看一段别人杂耍的视频,并尝试预测球下一步会落在哪里。但它可能会被球的颜色或背景墙所分散注意力。SelfWAM 则不同。它会给机器人一个关于刚才动作的特殊“干净”副本——就像是一个完美的、无噪声的投掷蓝图——并利用这个蓝图来预测未来。至关重要的是,它还要求机器人预测一个“自我掩模”(self-mask),这只是一个黑白色的剪影,展示了机器人自己的手臂和手部在场景中的移动。

为什么这个剪影如此重要?把它想象成一束聚光灯。如果你试图预测一场杂耍表演的未来,背景墙和光影变化只是噪声;它们无法告诉你杂耍是否会成功。但机器人自己手臂的运动呢?那才是信号。通过训练机器人精确预测其自身身体在接下来的几秒钟内将如何移动(忽略混乱的背景细节),机器人学会了“我做了这个动作”与“接下来发生了什么”之间更紧密的联系。

论文描述了一个巧妙的技巧,可以在不降低机器人速度的情况下实现这一点。在训练阶段,机器人可以看到动作的“干净”蓝图,以帮助它学习动作与未来视觉效果之间的联系。但在实际工作中(推理阶段),它不需要生成那些未来的视频或剪影。它只需要使用其大脑中学习到的轻量化部分。这就像一名学生利用带有图表的详细学习指南来准备考试,但在考试当天,他们只需要快速回忆起知识点即可。沉重的预测工作只发生在练习阶段,而不是实际工作中。

研究人员通过两种主要方式测试了这个想法。首先,他们使用了一个复杂的计算机模拟系统 RoboTwin 2.0,该系统包含一个拥有双臂的机器人,并执行超过 50 种不同的任务。他们发现,SelfWAM 在处理这些任务时表现优于以往的方法,尤其是在背景发生改变或随机化(如移动家具或改变灯光)的情况下。它实现了约 92.6% 的平均成功率,击败了其他顶尖模型。其次,他们在实验室中将该技术应用于一个真实的物理机械臂。他们给了它四个特定任务,比如将杯子放在支架上或将笔放入杯中。SelfWAM 在 95% 的尝试中取得了成功,超越了其他方法。

或许最令人兴奋的发现是,这种“超级想象力”并没有让机器人变得迟钝。论文显示,机器人决定下一步动作所需的时间增加不到 1%(具体为 0.97%)。这意味着机器人变得更聪明了,却没有变得笨拙。此外,当研究人员测试机器人的“想象力”时,他们发现 SelfWAM 在预测未来方面表现得更好。如果告诉机器人将手臂稍微向上移动,Self-WAM 的想象会正确显示手臂向上移动。而旧的模型经常会感到困惑,即使动作发生了变化,它们的预测也不会有太大的改变。

简而言之,SelfWAM 表明,通过将机器人的想象力植根于其自身身体的运动——通过教它去可视化自己的“影子”如何在世界中移动——可以让它成为一个更好的学习者。它学会了区分什么是机器人“做”出来的,以及什么是偶然发生的。其结果是,机器人变得更快、更准确、更具鲁棒性,同时保持了几乎相同的决策速度。这是迈向这样一种目标的进步:机器人不再仅仅是对世界做出反应,而是真正理解自己的行为是如何塑造世界的。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →