← 最新论文
🤖 machine learning

AdaJEPA: An Adaptive Latent World Model

adaJEP是一种自适应潜空间世界模型,它通过在模型预测控制回路中执行测试时自监督自适应,利用观测到的状态转移来持续重新校准模型而无需额外的专家演示,从而增强了在分布偏移下的规划鲁棒性。

原作者: Ying Wang, Oumayma Bounou, Yann LeCun, Mengye Ren

发布于 2026-07-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Ying Wang, Oumayma Bounou, Yann LeCun, Mengye Ren

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在模拟器中学习驾驶汽车。你练习了数周,模拟器教会了你方向盘和油门是如何响应的。你成为了在虚拟城市中穿梭的专家。

现在,想象你把同一辆车开到了真实的道路上。但问题在于,真实的道路略有不同。也许轮胎变得更滑了,或者风力更强了,又或者路面上覆盖了一层模拟器中并不存在的灰尘。

“冻结”模型的缺陷
如今大多数 AI 系统的工作方式,就像是一个完美背诵了模拟器规则、却拒绝在踏入真实车辆后学习任何新知识的驾驶员。用技术术语来说,这些系统使用一个“世界模型”(关于世界运作方式的心智地图),而这个模型在训练完成后是冻结的。

如果现实世界发生哪怕微小的变化——比如因为降雨导致车辆操控性能改变,或者出现了一个新的障碍物——AI 的心智地图就会变得不再准确。它试图根据旧有的、完美的模拟器知识来驾驶,但车辆的反应却不符合预期。AI 持续做出那些“完美”的动作,但由于现实已经发生了变化,它最终会导致碰撞或无法到达目的地。

解决方案:AdaJEPA(可适应的驾驶员)
这篇论文介绍了一种名为 AdaJEPA 的新驱动方式,它的行为更像人类。它不像那样死板地固守旧有的训练,而是拥有一个特殊的“计划—行动—适应—重新计划”(Plan–Act–Adapt–Replan)循环。

以下是它的工作原理,我们用一个简单的类比来说明:

  1. 计划 (Plan): AI 观察前方的道路,并基于其当前的心智地图规划路线。
  2. 行动 (Act): 它采取第一步动作(比如轻转方向盘)。
  3. 观察 (Observe): 它立即观察实际发生了什么。是车滑得比预期更多了吗?还是转弯转得更急了?
  4. 适应 (Adapt,神奇的一步): 在它计划下一次移动之前,AI 利用这单次的观察结果来更新其心智地图。它会说:“好吧,我的地图显示车应该左转,但实际上它向右转了。我需要调整我对此时此刻这辆车操控方式的理解。”
  5. 重新计划 (Replan): 带着这个经过微调后的地图,它规划下一步动作。

这个过程在瞬间内反复发生,随着 AI 的移动不断循环。这就像一位驾驶员,会根据路面的即时反馈不断调整转向,而不是依赖于一周前的一张静态地图。

为什么这很重要
研究人员主要通过两种方式测试了它:

  • 视觉变化: 想象房间内的光照发生了变化,或者你推动的物体颜色变了。一个“冻结”的 AI 可能会感到困惑,因为它是在明亮光线下针对灰色物体进行训练的。AdaJEPA 会迅速意识到:“哦,这个物体现在是红色的,而且光线很暗,”并立即调整其计划。
  • 物理变化: 想象地面突然变得非常湿滑(低摩擦力),或者物体变得非常重。一个“冻结”的 AI 会使用在干燥地面上使用的相同力量,然后失败。AdaJEPA 推了一下,看到物体滑动得太远,便立即学到:“我需要减小推力,”为接下来的每一步做准备。

实验结果
论文表明 AdaJEPA 的效率极高。它不需要从头开始重新学习。它通常只需要在每次行动后进行一次微小的调整(一个“梯度步”)来修复其心智地图。

  • 在“安全区”: 即使世界完全符合 AI 的预期,AdaJEPA 也不会损害性能;它只是保持稳定运行。
  • 在“变化区”: 当世界发生变化(新的形状、不同的颜色、湿滑的地板)时,AdaJEPA 的表现大幅超越了冻结模型。它从错误中恢复的速度更快,且能更频繁地达成目标。

核心结论
论文认为,AI 不应该是一个一旦离开实验室就停止学习的静态雕塑。相反,它应该是一个在行动的同时,不断校准其对世界理解的生命系统。AdaJEPA 证明了,通过进行这些细微的实时调整,AI 处理变化多端、不可预测的世界的能力,要比那些拒绝适应的系统强得多。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →