← 最新论文
💻 computer science

JEPA-WAM: Learning Vision-Language-Action Policies with Joint-Embedding World Modeling

JEPA-WAM 引入了一种基于预训练 V-JEPA 空间的潜在世界动作模型,该模型通过一个共享预测器统一了空间结构的未来预测与连续动作生成,在无需大规模策略预训练的情况下,在机器人操控基准测试中实现了最先进的性能。

原作者: Yihan Lin, Jiawei He, Shifeng Bao, Chen Zhao, Yang Li, Xiaobo Wang, Yan Wang, Cheng Chi, Jing Zhang

发布于 2026-08-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Yihan Lin, Jiawei He, Shifeng Bao, Chen Zhao, Yang Li, Xiaobo Wang, Yan Wang, Cheng Chi, Jing Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在教一个机器人做饭。你可以直接给它看一段厨师切洋葱的视频,然后说:“照着做。”但如果机器人仅仅记住了那段特定视频的具体样子,那么如果厨师换了一顶不同的帽子,或者厨房的光线发生了变化,机器人可能会陷入恐慌。这就是**视觉-语言-动作(VLA)**模型的挑战:它们擅长在熟悉的场景中遵循指令,但当世界看起来与训练时的场景略有不同时,它们往往会表现不佳。

为了解决这个问题,科学家们尝试教机器人成为“预测者”。机器人不再只是做出反应,而是尝试想象接下来会发生什么。如果它能预测出“如果我推这个杯子,它会从桌子上滑落”,那么它就能更好地进行规划。然而,让机器人生成完整的、高分辨率的未来视频,就像是要求一个学生为了决定下一步该做什么而写出一整部小说——这太耗费时间和计算资源了。因此,研究人员寻找了一个捷径:“潜空间(latent)”模型,它只预测未来的“概念”,而不去绘制整个画面。但问题在于:许多这类捷径要么丢失了太多细节,要么将预测和动作视为两个分离且互不相连的任务。

这就引出了 JEPA-WAM,一种试图教机器人感知“时间流向”而不被绘制每一帧画面所困扰的新方法。它提出了一个简单的问题:我们能否教会机器人理解世界是如何变化的,并利用这种理解来更好地运动,且这一切都在一个流畅的动作中完成?


机器人的“时间感”捷径

认识一下 JEPA-WAM。把它想象成一个机器人,它不仅仅是看着现在的照片并猜测下一张照片,而是学习两者之间的关系。

想象你正在看一个魔术表演。魔术师把一个红球放进盒子里,然后掏出了一个蓝球。标准的机器人可能只会记住“红球 →\rightarrow 蓝球”。但 JEPA-WAM 就像一个侦探,它注意到了过渡过程:“红球消失了,盒子晃动了,然后出现了一个蓝球。”它学习的是变化的逻辑,而不只是前后状态。

研究人员在这个系统之上构建了一个预训练的“视觉大脑”,称为 V-JEPA。你可以把 V-JEPA 理解为一个已经看过数百万段视频,并学会了物体如何移动和交互的机器人大脑。JEPA-WAM 利用这个大脑,并添加了一个特殊的“时空旅行”模块。

这里的奥秘在于:JEPA-WAM 并不是要求机器人生成一段模糊的未来视频(这既慢又贵),而是要求机器人预测一个联合图谱(joint map)。想象一下,你拍了一张现在厨房的照片,又拍了一张五秒后厨房的照片,然后将它们叠在一起。JEPA-WALM 并不尝试从头绘制未来的照片,相反,它观察这两张叠加照片之间的差异,并学习精确预测像素是如何偏移的。它学习到“杯子向左移动了两英寸”以及“抽屉打开了”,从而保留了事物发生的精确位置细节。

共享大脑:一个预测器,两个任务

JEPA-WAM 最聪明的地方在于它如何使用大脑。在许多旧系统中,预测未来的部分和控制机器人手臂的部分就像是隔着墙对话的两个人:一个负责猜未来,另一个负责尝试倾听。

JEPA-WAM 使用了一个共享预测器(Shared Predictor)。想象一位正在参加考试的超级聪明的学生:

  1. 任务 A: 学生观察当前的场景,并预测世界将如何变化(即“时间感”)。
  2. 任务 B: 学生利用同一种理解力来决定如何移动机器人的手臂(即“动作”)。

因为这个学生同时在做这两项任务,学习预测未来会直接塑造学生决定如何移动的方式。论文指出,这种紧密的耦合使机器人变得更加聪明。这就像一位舞者,不仅记住了舞步,还理解了音乐的节奏;动作之所以流畅自然,是因为预测和动作都源于同一种理解。

它真的有效吗?

研究人员在三个不同的世界中测试了这个想法:一个标准的视频游戏模拟环境、一个带有随机物体的更混乱的模拟环境,以及实验室中的真实机器人手臂。

在模拟环境中:
在一个名为 LIBERO-Plus 的基准测试中(该测试评估机器人处理环境变化,如不同光照或物体位置的能力),JEPA-WAM 得分为 79.2%。这是在没有经过大规模机器人数据预训练的机器人中表现最好的结果。更令人印象深刻的是,当他们将这种“时间感”技巧应用于一个已经非常强大的机器人大脑 π\pi0.5 时,得分从 84.5% 提升到了 86.3%。这表明,即使是聪明的机器人,如果学会了预测时间的流向,也会变得更加聪明。

在现实世界中:
团队将他们的机器人带到了一个拥有双臂协作能力的真实实验室。他们让机器人执行诸如堆叠积木、将水果放在盘子里或打开抽屉等任务。

  • 当设置完全符合预期时(分布内/In-Distribution),JEPA-WAM 的得分约为 59.8%。
  • 当他们改变背景或移动物体位置时(分布外/Out-of-Distribution),JEPA-WAM 仍能保持 54.2% 的得分。
  • 相比之下,一个标准的机器人(π\pi0)在环境发生变化时,得分从 51.8% 骤降至摇摇欲坠的 22.5%。

这表明 JEPA-WAM 具有更强的鲁棒性。它不仅仅是死记硬背某个特定的场景,而是学习了物体移动的逻辑,因此能够应对突发状况。

它不是什么(以及它排除了什么)

论文谨慎地指出了 JEPA-WAM 不是什么。

  • 它不是一个视频生成器。它并不试图创造一段全新的、高清晰度的未来视频。作者认为,尝试生成每一个像素成本太高,且对于控制机器人来说通常是不必要的。
  • 它不仅仅是关于预测最终状态。研究人员测试了一个仅观察“未来”图像而没有“当前”图像的版本,结果发现其表现较差(77.3% 对比 79.2%)。这证明了理解“现在”与“稍后”之间的关系,比仅仅猜测最终结果更为重要。
  • 它不是解决所有问题的万灵药。作者指出,如果同一个视觉场景根据特定的指令会导致两种截然不同的结果(例如,“推杯子”与“拉杯子”),该模型可能会遇到困难,因为它侧重于视觉变化而非特定语言的目标。

总结

JEPA-WAM 表明,让机器人变得更具适应性的秘诀不仅仅是给它们更多的数据或更大的大脑,而是教它们以一种能直接指导其动作的方式去理解时间的“流向”。通过使用一个共享大脑来预测世界如何变化并决定如何移动,机器人变得更像是一个熟练的人类,能够适应混乱的厨房而不至于惊慌失措。

这些在模拟和现实试验中测得的结果表明,这种“联合预测”方法是构建能够应对现实世界不可预测性的机器人的强大途径。虽然它并非解决所有可能任务的终极方案,但它为打造不仅能服从指令、而且真正具备适应能力的机器人提供了一条充满希望的新路径。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →