← 最新论文
💻 computer science

Depth-Regularized JEPA World Models Learn More Transferable Representations from Real Outdoor Robot Data

本文介绍了一种深度正则化的 JEPA 世界模型,该模型利用几何先验和潜变量正则化,从现实世界的户外机器人数据中学习更具可迁移性和鲁棒性的表示,在不增加推理开销的情况下,在视觉里程计、惊奇检测和多步预测方面显著优于基准模型。

原作者: Usman M. Khan

发布于 2026-07-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Usman M. Khan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人如何驾驶拖拉机穿过田野。这个机器人有一个摄像头,但它所看到的景象是混乱的:阳光刺眼,阴影拉长又缩短,叶子在风中沙沙作响,而且每当它转弯时,地面看起来都不一样。如果你要求机器人记住每一张图像的每一个像素,它会被搞得不知所措且陷入混乱。相反,科学家们正试图教会机器人“世界模型”(World Models)。把世界模型想象成机器人的“内在白日梦”。它不是试图重画整幅图画,而是学习以一种简化、抽象的方式来预测接下来会发生什么。这就像一位国际象棋选手,他不需要记住棋盘上每个方格的确切颜色,但他理解棋子是如何移动以及游戏如何演变的“规则”。

这篇论文所关注的这种特定类型的“白日梦”被称为 JEPA(联合嵌入预测架构)。想象一个学生正在参加考试,他必须根据前文来猜测故事的下一句话,但他不被允许写出完整的句子——他只需要猜出下一部分的情绪或“神韵”。这非常有效,因为它忽略了无聊的细节(比如字体颜色),而专注于重要的内容(比如情节)。然而,当这些机器人在尝试从真实的户外视频中学习时,它们的内在“神韵”猜测往往会变得混乱,或者坍塌成无意义的东西,因为现实世界是如此混沌。核心问题在于:我们如何教会这些机器人理解现实世界的“物理特性”——比如物体是如何在三维空间中排列组合的——而又不需要一个会让它们变慢的超级复杂的脑子?

这篇论文介绍了一个解决该问题的巧妙技巧。研究人员采用了一个紧凑的机器人大脑(一个拥有 1800 万参数的模型,名为 LeWorldModel),并给了它一个特殊的“仅限训练阶段”的导师:深度信息。想象一下你在学习画风景画。你有一张普通的照片(RGB),但你还有一个 3D 地图,它展示了每棵树和每块石头距离你到底有多远。研究人员让机器人在学习(训练)时同时观察照片和 3D 地图。他们告诉机器人:“你对下一幕场景的预测应该与你在地图中看到的 3D 结构相匹配。”但神奇之处在于:一旦机器人完成了作业,他们就把 3D 地图拿走了。当机器人外出工作时,它仍然像以前一样,只使用摄像头的照片。然而,因为它的学习过程伴随着 3D 地图,它的内在对世界的理解现在变得更加敏锐,并且更扎根于现实。

结果表明,这个简单的技巧效果显著。通过仅在训练期间使用深度信息,机器人的内在“白日梦”在理解世界运动方式方面变得更好了。当研究人员进行测试时,机器人的自我运动估计能力(视觉里程计)提升了 33%,变得更加准确。它在发现“异常”事物方面也变得出色得多。如果突然将机器人传送到另一个位置,或者将视频倒放,机器人的内在警报会比以前响得更响、更清晰。令人惊讶的是,这甚至帮助机器人理解了一些并非严格属于 3D 的事物,比如光照或阴影的突然变化,这表明理解世界的形状有助于机器人理解其他一切事物。

论文还发现,这个经过“深度训练”的机器人,在移动到完全不同的环境(换了一个机器人,换了一片田野)时,表现出了更强的灵活性。虽然标准的机器人会在新环境中难以长时间保持预测准确,但经过深度训练的机器人却能保持冷静,其预测能够长时间保持准确。研究人员认为,通过将机器人的学习扎根于世界的物理几何结构,我们创造了一个更鲁棒、更具迁移性的大脑。这有点像教一个孩子在有平衡木的平滑标记跑道上学骑自行车;一旦他们学会了平衡,他们就可以在没有平衡木的情况下在任何崎岖的路径上骑行,因为他们真正理解了如何保持直立。这种方法提供了一种实用的途径,可以在不需要昂贵传感器或超级计算机实际工作时,让小型、高效的机器人大脑变得更聪明、更具适应性。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →