← 最新论文
🤖 machine learning

XP-JEPA: Cross-Predictive Physics Grounding for Forecastable Latent Dynamics

该论文介绍了一种名为 XP-JEPA 的跨预测学习框架,该框架在训练期间通过特权物理轨迹来锚定视觉潜动力学,从而显著提高可预测性和控制性能,同时在仅使用视觉的部署阶段舍弃物理分支。

原作者: Kehan Wen, Ziming Li, Siyuan Luo, Fan Shi

发布于 2026-08-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Kehan Wen, Ziming Li, Siyuan Luo, Fan Shi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

能够进行预判的机器人通常依赖一种心理捷径:它们构建一个内部世界地图,一种可以在实际执行动作之前测试不同移动方式的模拟环境。为了实现这一点,机器人会对周围环境进行拍照,将图像转化为一组简化的数字,然后询问计算机程序,如果机器人推动、抬起或转动某个物体,这些数字在片刻之后会变成什么样。如果预测结果符合目标,机器人就会执行该动作。当机器人的内部地图能准确反映物理世界的变化时,这一过程运作良好。然而,当机器人仅通过图像来学习预测未来时,一个常见的问题便会出现。它可能会变得“过于聪明反被聪明误”,在视觉数据中发现一些易于预测但与真实物理学无关的模式。例如,机器人可能会学到某种灰色通常会跟随某种蓝色出现,即使实际物体根本没有移动。这产生了一种脆弱的理解,导致机器人的预测偏离现实,使其在尝试与世界互动时失败。

新加坡国立大学的一个研究小组开发了一种新方法来修复这一缺陷,确保机器人的内部预测始终符合物理定律。他们将这种方法称为 XP-JEPA。研究人员并没有让机器人仅仅通过观看视频来学习,而是在训练期间给了它第二路信息流:物体物理状态的直接读数,例如它们的精确位置、大小和空间方位。这些物理数据就像是一个机器人通过摄像头看不见、但在学习过程中可以获取的“隐藏真理层”。研究人员设计了一个系统,让机器人的“视觉大脑”和“物理大脑”协同工作。两部分都会接收相同的动作历史,并尝试预测未来。视觉侧预测下一帧图像看起来是什么样,而物理侧则预测下一组坐标。至关重要的是,该系统强制要求这两项预测保持一致。如果视觉侧预测方块会向上移动,而物理侧预测方块保持不动,系统就会判定视觉预测是错误的。这种交叉检查的过程教会了视觉系统去关注真正重要的物理变化,而不是仅仅基于肤浅的视觉模式进行猜测。

研究人员在多种机器人任务中测试了这种方法,包括推动方块、堆叠物体以及将物品投入容器等。他们将新系统与仅从图像中学习的标准模型进行了对比。结果令人瞩目。当研究人员让新系统运行任务模拟时,其预测误差随时间增长得非常缓慢。相比之下,标准模型的预测出现了显著漂移,在短短几步之后就变得不可靠。具体而言,新方法将预测误差从 0.361 降低到了 0.104。这种准确性的提升直接转化为了更好的表现。当机器人被要求实际执行任务时,新系统的成功率为 78.2%,相比于标准视觉模型的 53.6% 有了大幅跃升。这种改进在六种不同类型的交互中均保持有效,表明该方法适用于广泛的物理挑战。

该研究最重要的发现之一是,当机器人停止使用物理数据时会发生什么。物理信息仅在机器人的训练阶段可用;在执行任务期间,真实的机器人无法测量这些数据。研究人员发现,一旦机器人完成了借助物理数据的学习过程,他们就可以完全丢弃物理传感器。此时,机器人仅凭摄像头即可运行,就像标准模型一样。尽管失去了对物理数据的访问,机器人依然保留了改进后的未来预测能力。这表明机器人已成功将其内部的物理规则内化到了视觉理解中。它学会了以一种自然尊重物体运动和交互的方式来观察世界,而不是仅仅记忆视觉技巧。

研究还探讨了仅仅教机器人识别物体位置是否足以解决问题。他们尝试了另一种方法,即强迫机器人直接从单张图像快照中猜出物体的方位。虽然这种方法让机器人非常擅长识别特定时刻物体的所在位置,但它并未帮助机器人预测物体未来的运动。机器人仍能准确猜出位置,但其对物体未来路径的预测与标准模型一样不可靠。这种区别至关重要:知道某物现在在哪里并不等于理解它将如何变化。新方法的成功之处在于,它专注于“动作”与“未来状态”之间的关系,利用物理数据来引导对这种关系的学习,而不是仅仅教机器人如何标注当前的场景。

研究人员还测试了如果切断视觉与物理数据之间的联系会发生什么。在一次实验中,他们将一个任务的视觉视频与另一个完全无关的任务的物理数据配对。在这种情况下,机器人的预测变得混乱,其控制能力也崩溃了,成功率仅为 16.6%。这一结果证明,该系统依赖于视觉与物理信息的正确配对。仅仅拥有物理数据是不够的,机器人必须学习视觉内容与该场景物理演变之间的特定联系。研究证实,这种进步源于对世界动态规律的学习,而非仅仅是拥有更多的数据。

最后,这项工作展示了通往更可靠机器人规划的路径。通过使用一个临时性的、具有特权的物理世界视角来训练机器人的视觉系统,研究人员创造出了一个更擅长想象未来的模型。机器人能够更精确地预判其行为的后果,从而降低在操纵真实物体时失败的风险。虽然目前的实验是在模拟环境中进行的,但该方法提供了一个清晰的策略,用于教机器不仅将世界视为图像的集合,更是一个受一致规则支配的运动部件系统。机器人不需要在现实世界中携带沉重的物理传感器;它只需要学会正确的观察方式。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →