← 最新论文
🤖 machine learning

SCALE: State-Calibrated Latent Embeddings for JEPA Planning in the Right Geometry

该论文提出了 SCALE,一种轻量级的训练时正则化器,它通过将端到端学习的潜嵌入几何结构与标准化的任务相关状态空间进行对齐,从而在无需额外规划时开销的情况下,确保嵌入空间中的高方差方向能够有效捕捉状态信息,进而提升 JEPA 的规划性能。

原作者: Jiaming Hu, Yan Zheng, Tian Wang

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Jiaming Hu, Yan Zheng, Tian Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在构建能够像生物一样思考和行动的机器的过程中,研究人员长期以来一直依赖于一个被称为“世界模型”(world model)的概念。想象一个机器人,它不仅仅是根据眼前所见做出反应,而是会在脑海中进行关于未来的模拟。在移动任何一寸肌肉之前,它会自问:“如果我伸手去拿那个杯子,会发生什么?”它会想象一系列事件的序列,预测结果,然后才选择能带来最佳结果的行动。为了让这些模拟能够奏效,机器需要一种能够表示世界的方式,这种方式既要足够紧凑以便快速计算,又要足够详细以发挥作用。如果表示方式过于混乱,机器人就会迷失在噪声中;如果过于简单,它又会错过成功的关键细节。挑战在于寻找一种平衡点,使机器的内部世界地图不仅准确,而且其组织方式能让规划变得容易。

波士顿大学和 Unity Technologies 的研究人员最近的一项研究针对了目前构建这些心理地图时一个微妙但至关重要的缺陷。他们发现,一台机器可以学会完美地理解一项任务,但在尝试进行规划时却仍然失败。问题不在于信息缺失,而在于信息隐藏在了机器内部几何结构的错误部分。为了解决这个问题,该团队开发了一种名为 SCALE 的新方法,它通过重塑机器的内部地图,使得对于某项任务最重要的细节,在机器做出决策时能成为最突出的特征。

研究人员首先观察了机器学习表示世界的两种不同方式。一种方法用于名为 DINO-WM 的系统,它依赖于在机器人接触特定任务之前,从海量数据中学习到的特征。这种方法自然地创建了一个让重要状态之间的差异易于辨识的地图。另一种方法被称为 LeWorldModel,它教导机器从零开始预测未来。虽然这种方法具有灵活性且学习速度快,但研究人员发现,由此产生的地图往往会隐藏最重要的信息。尽管机器在被直接询问时理论上可以提取出正确答案,但它衡量不同未来可能性之间距离的方式却被无关紧要的细节所主导。这就像是一个图书馆,虽然每本书都被正确地编目了,但图书管理员却只根据书皮的颜色来决定挑选哪一本,而忽略了实际的内容。

为了理解为什么会发生这种情况,请考虑机器如何决定采取哪种行动。它会想象许多可能的未来,并测量它认为自己将到达的位置与目标位置之间的距离。在那些从零开始学习的系统中,机器对距离的内部衡量深受数据中最常见变化的影响,而这些变化通常对于特定任务而言是无关紧要的。关于任务的关键信息(例如物体的位置或关节的角度)可能已经编码在机器的记忆中,但它位于地图的一个安静角落,规划过程很少注意到它。机器可以在被迫的情况下解码这些信息,但在需要做出选择时,它并不会使用这些信息。

该团队提出了一个解决方案,旨在强制机器以不同的方式组织其地图。他们引入了一种训练规则,将机器的内部距离感与现实世界中状态之间的实际物理距离直接联系起来。在训练期间,系统会被展示成对的情境,并被告知:如果两个情境在现实中相距较远,那么它们在机器的内部表示中也必须相距较远。这并不是要取代机器的学习过程;相反,它像是一个温柔的引导,推动机器重新排列其内部地图,使最重要的任务相关差异成为最显著的特征。这确保了当机器计算未来行动的代价时,其计算是由真正对成功有意义的细节所驱动的。

研究结果非常显著。研究人员在五个不同的环境中测试了他们的新方法 SCALE,环境涵盖了从推动方块到穿越迷宫,并使用了三种不同的规划算法。在每一次测试中,使用 SCALE 训练的系统都优于标准的从零开始学习的系统。这种提升是一致的,无论可用的计算能力多少或使用哪种规划算法。为了证明成功归功于新的几何结构而非仅仅是更好的记忆力,他们将其与另一种方法进行了对比——另一种方法只是试图让任务信息更容易从机器的记忆中读取。那种替代方法确实可以准确地读取信息,但在提高规划性能方面,其一致性远不如 SCALE。这证实了成功的关键不仅在于拥有信息,更在于信息的排列方式能让规划器真正使用。

这项研究揭示了关于人工智能的一个基本洞察:一个表示的质量不仅取决于它包含什么信息,还取决于信息的结构化方式。机器可以在脑海中持有正确的答案,但如果通往答案的路径被错误类型的噪声所遮蔽,机器就会失败。通过将世界模型的内部几何结构校准到与任务现实相匹配,研究人员表明,规划变得更加可靠。这项工作表明,为了让机器真正掌握复杂的任务,我们不仅要教它们如何观察世界,还要教它们如何以一种对它们需要做出的决策有意义的方式来观察世界。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →