← 最新论文
💬 NLP

Temporal-Distance JEPA: Plan-Aware Representation Learning for Latent World Model Predictive Control

本文提出了时间距离型联合嵌入预测架构(Temporal-Distance JEPA, TD-JEPA),这是一种通过从离线无奖励轨迹中挖掘定向时间代价,从而弥合表示学习与规划之间差距的世界模型方法,通过实现更有效的目标进度排序且不依赖像素重建或显式奖励,在多个环境中超越了现有的基于 JEPA 的规划器。

原作者: Jiaxin Bai, Jiaxuan Xiong

发布于 2026-07-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Jiaxin Bai, Jiaxuan Xiong

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在教一个机器人如何在新的世界中导航,但你不能给它地图,也不能给它规则列表。你拥有的全部只是一个人类完美完成该任务的视频。这就是机器人领域“离线学习”(offline learning)所面临的挑战:如何仅通过观察旧的影像来教 AI 规划未来的动作?科学家们使用一种被称为“世界模型”(world model)的东西来解决这个问题。把世界模型想象成机器人大脑中的一台“梦境机器”。机器人并不是试图重新绘制视频中的每一个像素(这就像试图凭记忆画出一幅杰作),而是学习预测接下来会发生的“本质”。它将世界压缩成一个简化的、抽象的“潜空间”(latent space)——一个相似情境在其中彼此靠近的精神地图。

核心问题是:一旦机器人拥有了这个精神地图,它该如何决定走哪条路?通常,机器人只是测量在精神地图上当前位置与目标位置之间的直线距离。但问题在于:在现实世界中,地图上的直线距离并不总是最快的路径。你可能可以在地图上画一条穿过墙壁的直线,但机器人无法穿墙而过。它需要理解“时间”和“序列”。如果机器人仅仅观察距离,它可能会感到困惑,不知道自己是在接近目标,还是仅仅在原地打转。这篇论文解决的正是一个这样的问题:如何教机器人理解其梦境中的“时间流”,从而让它能更好地进行规划,且无需任何额外的奖励或人类教师。

“直线思维”的问题

研究人员从一个强大的现有系统 LeWM(潜世界模型,Latent World Model)出发。这个系统非常擅长在其抽象的精神地图中预测下一步会发生什么。然而,当它尝试规划通往目标的路径时,它依赖于一个简单的规则:“未来的精神图像离目标越近,就越好。”这就像仅通过观察两点之间的直线距离来在城市中导航。这在开阔地带效果尚可,但如果你需要绕过一栋建筑或爬上一把梯子,那条直线距离就会欺骗你。

作者注意到,虽然机器人的精神地图擅长预测下一步,但它并不擅长根据实际取得的进展来对“未来的可能性”进行排序。在一段人类推动方块的视频中,机器人可以预测下一帧,但它本身并不知道第 10 帧之所以比第 5 帧更接近目标,是因为它们发生的先后顺序。它缺失了一种“定向时间感”(directed time)。

解决方案:从过去中挖掘时间

为了修复这个问题,团队创建了一个名为 TD-JEPA(时序距离联合嵌入预测架构,Temporal-Distance Joint-Embedding Predictive Architecture)的新系统。他们不再只是让机器人猜测距离,而是教会它直接从演示视频中“挖掘”时间的概念。

以下是他们的方法,使用一个简单的类比:想象你正在看一档烹饪节目。你不需要计时器就能知道打蛋发生在搅拌之前,而搅拌发生在烘焙之前。事件的顺序本身就是进度。TD-JEPA 通过观察机器人的训练视频并得出结论:“如果人类做了步骤 A,然后是步骤 B,最后是步骤 C,那么步骤 C 显然比步骤 A 更接近目标的路径。”

该系统学习了一种特殊的“定向代价”(directed cost)。不同于普通的距离(即往返是对称的,比如你家到公园的距离无论怎么走都是一样的),这种新的代价理解方向。它知道从“起点”到“终点”需要付出努力,但从“终点”回到“起点”则是另一种完全不同的旅程。通过从视频中学习这种定向流,机器人构建了一个精神地图,其中的“距离”实际上反映了到达目标所需的步骤数,而不仅仅是图像看起来有多相似。

使用这项新技能的两种不同方式

一个非常有趣的发现是,这种新的“时间感知”技能在机器人尝试执行不同任务时的表现各异。作者发现,如何使用这种新知识取决于具体的任务:

  1. 对于导航与触达任务(拓扑任务): 当机器人需要穿越空间时(例如在迷宫中导航或伸手去够空中的物体),这种新的“定向时间代价”是完美的工具。它就像一个指向目标的指南针,能够自动忽略死胡同。在测试中,使用这种新代价帮助机器人在“两室”导航任务中实现了 100% 的成功率,击败了仅有 97.4% 成功率的老系统。
  2. 对于接触密集型操纵任务(几何任务): 当机器人必须推、滑或堆叠物体时(例如在“Push-T”任务中推动一个 T 形块),情况变得复杂了。在这种情况下,接触点的精确形状和角度比大致方向更重要。在这些案例中,新的时间感知系统表现最好的方式是“辅助”旧的“直线距离”法,而不是取代它。它精炼了机器人的精神地图,使得直线距离变得更加准确。在“OGB-Cube”任务中,这种结合比旧系统提高了 14.2 个百分点的成功率。

他们的发现(以及未发现的部分)

研究人员进行了严格的测试,在保持其他所有变量不变的情况下,仅改变规划方法。他们发现,TD-JEPA 在所有环境中都能持续匹配或超越之前的最佳方法(LeWM 和名为 RC-aux 的方法)。

然而,他们也发现了局限性。当他们尝试仅使用这种新的基于时间的代价来处理复杂的“Push-T”任务时,机器人的表现实际上比使用旧的几何距离时要差(69% 的成功率,而后者为 86%)。为什么?因为推动一个方块需要对角度和接触点进行精细控制。虽然“时间”信号告诉机器人它正在接近目标,但它并没有提供关于如何正确触摸方块的足够细节。机器人需要几何层面的“形状”信息才能成功。这证明了虽然理解时间至关重要,但在每种情况下,它并不能取代对物理几何学的理解。

总结

本文表明,你可以通过仅仅观察视频来教会机器人理解时间的“流动”,而无需任何额外的奖励或人类反馈。通过从演示日志中挖掘事件的顺序,他们创建了一个能够理解哪个未来才是真正“更接近”目标的系统。这个新系统 TD-JEPA 缩小了机器人学习内容与规划方式之间的差距。它表明,对于某些任务,机器人应该像河流一样顺着时间的流向而行;而对于另一些任务,它应该利用这种流向来磨练其对物理形状的感觉。其结果是,机器人变得更加聪明、更具适应性,能够更好地在现实世界中进行规划,无论是穿梭于房间,还是在桌面上推动方块。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →