← 最新论文
🤖 machine learning

Sub-JEPA: Subspace Gaussian Regularization for Stable End-to-End World Models

本文提出 Sub-JEPA,该方法通过在多个随机子空间而非完整环境空间中应用高斯正则化,提升了联合嵌入预测架构(JEPAs)用于世界建模时的稳定性与灵活性,从而实现了更优的偏差 - 方差权衡,并超越了最先进的 LeWorldModel。

原作者: Kai Zhao, Dongliang Nie, Yuchen Lin, Zhehan Luo, Yixiao Gu, Deng-Ping Fan, Dan Zeng

发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Kai Zhao, Dongliang Nie, Yuchen Lin, Zhehan Luo, Yixiao Gu, Deng-Ping Fan, Dan Zeng

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用通俗语言和日常类比对论文"Sub-JEPA"的解释。

全局概览:教机器人想象未来

想象你在教一个机器人走迷宫。你不想向机器人展示墙上的每一块砖和地板上的每一粒灰尘(因为数据量太大),而是希望它学会一张“心理地图”。这张地图是对它当前位置和去向的简化总结。

在人工智能领域,这种心理地图被称为世界模型(World Model)。其中一种名为JEPA的特定模型很受欢迎,因为它效率高:它能根据当前的心理地图和一个动作(例如“向左转”),预测下一个心理地图会是什么样子。

问题所在:过于严苛的“老师”

该论文指出了当前训练这些模型时存在的一个主要问题。

把机器人的心理地图想象成一个正在参加考试的学生。为了确保学生不作弊或放弃(这被称为“崩溃”问题,即学生给每个问题都写同样的答案),老师制定了一条规则:“你的答案必须完美均匀地分布,就像一圈完美的点。

这就是之前的方法LeWorldModel(LeWM)所做的。它迫使机器人的心理地图在巨大的高维空间中呈现为一个完美、均匀的数据云。

缺陷
作者认为,这条规则对于许多现实世界的任务来说过于严苛。

  • 类比:想象一位走钢丝的人。他们的动作很复杂,但主要发生在一根细线上(钢丝)。如果你强迫走钢丝的人在钢丝周围做一个完美的 3D 球体运动,你就是在限制他们自然的移动。你是在强迫他们去使用那些根本不需要的方向。
  • 从技术术语来说,论文指出,现实世界的任务通常存在于高维空间(一个巨大、空旷的房间)中的“低维流形”(简单的路径)上。强迫数据均匀地填满整个房间,会产生一种糟糕的偏差,从而损害性能。

解决方案:Sub-JEPA(“子空间”方法)

作者提出了Sub-JEPA。他们不再强迫机器人的心理地图在整个巨大房间中成为一个完美的球体,而是将房间分解成许多更小的、随机的“子房间”(子空间)。

它是如何工作的

  1. 切片数据:想象将机器人的心理地图切成许多不同的、随机的 2D 或 3D 视图(就像从许多不同的角度观察一座雕塑)。
  2. 检查切片:在这些小切片中的每一个里,模型检查数据是否看起来像一个漂亮的、均匀的钟形曲线(高斯分布)。
  3. 结果:模型不必在大房间里成为一个完美的球体。它只需要在这些更小的、随机的切片中看起来“漂亮且均匀”即可。

优势
这就像告诉走钢丝的人:“你不必填满整个 3D 房间。只要确保如果我们从侧面看你,你看起来是平衡的;如果我们从正面看你,你看起来也是平衡的。”

  • 它保留了安全网(防止机器人崩溃成无聊、重复的答案)。
  • 但它赋予了机器人自由,使其能够沿着任务的实际路径自然移动,而不是与人为的、过于严苛的规则作斗争。

实验结果

研究人员在四个类似视频游戏的控制任务上测试了这种方法(例如机械臂推方块或无人机穿过房间)。

  1. 性能提升:Sub-JEPA 始终优于旧方法(LeWM)。机器人学会了更好地规划和移动。
  2. “秩”的联系:他们测量了机器人心理地图的“复杂”程度。他们发现,当新方法允许地图变得更简单(更紧凑,更贴合实际任务)时,机器人变得更聪明了。旧方法强迫地图变得不必要的复杂。
  3. 更平滑的路径:当他们可视化机器人的心理旅程时,新方法产生了更直、更平滑的线条。旧方法导致机器人的思维随时间推移而摇摆和漂移。
  4. 长期稳定性:当被要求在不观察现实世界的情况下想象一系列未来的动作时,新方法保持了更长时间的准确性。旧方法开始产生幻觉并偏离轨道。

总结

Sub-JEPA 是对一个复杂问题的简单修正。它认识到,强迫 AI 模型在巨大、抽象的空间中“完美均匀”往往是过于限制的。通过转而检查该空间中许多更小、随机的切片是否有序,它允许 AI 学习一种更自然、更高效、更稳定的世界理解方式。

这之间的区别在于:是强迫一条鱼在一个完美的立方体中游动(旧方法),还是让它在水中自然游动,只要从任何角度看它都保持平衡即可(新方法)。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →