想象一下你正在模拟器中学习驾驶汽车。你练习了数周,模拟器教会了你方向盘和油门是如何响应的。你成为了在虚拟城市中穿梭的专家。
现在,想象你把同一辆车开到了真实的道路上。但问题在于,真实的道路略有不同。也许轮胎变得更滑了,或者风力更强了,又或者路面上覆盖了一层模拟器中并不存在的灰尘。
“冻结”模型的缺陷
如今大多数 AI 系统的工作方式,就像是一个完美背诵了模拟器规则、却拒绝在踏入真实车辆后学习任何新知识的驾驶员。用技术术语来说,这些系统使用一个“世界模型”(关于世界运作方式的心智地图),而这个模型在训练完成后是冻结的。
如果现实世界发生哪怕微小的变化——比如因为降雨导致车辆操控性能改变,或者出现了一个新的障碍物——AI 的心智地图就会变得不再准确。它试图根据旧有的、完美的模拟器知识来驾驶,但车辆的反应却不符合预期。AI 持续做出那些“完美”的动作,但由于现实已经发生了变化,它最终会导致碰撞或无法到达目的地。
解决方案:AdaJEPA(可适应的驾驶员)
这篇论文介绍了一种名为 AdaJEPA 的新驱动方式,它的行为更像人类。它不像那样死板地固守旧有的训练,而是拥有一个特殊的“计划—行动—适应—重新计划”(Plan–Act–Adapt–Replan)循环。
以下是它的工作原理,我们用一个简单的类比来说明:
- 计划 (Plan): AI 观察前方的道路,并基于其当前的心智地图规划路线。
- 行动 (Act): 它采取第一步动作(比如轻转方向盘)。
- 观察 (Observe): 它立即观察实际发生了什么。是车滑得比预期更多了吗?还是转弯转得更急了?
- 适应 (Adapt,神奇的一步): 在它计划下一次移动之前,AI 利用这单次的观察结果来更新其心智地图。它会说:“好吧,我的地图显示车应该左转,但实际上它向右转了。我需要调整我对此时此刻这辆车操控方式的理解。”
- 重新计划 (Replan): 带着这个经过微调后的地图,它规划下一步动作。
这个过程在瞬间内反复发生,随着 AI 的移动不断循环。这就像一位驾驶员,会根据路面的即时反馈不断调整转向,而不是依赖于一周前的一张静态地图。
为什么这很重要
研究人员主要通过两种方式测试了它:
- 视觉变化: 想象房间内的光照发生了变化,或者你推动的物体颜色变了。一个“冻结”的 AI 可能会感到困惑,因为它是在明亮光线下针对灰色物体进行训练的。AdaJEPA 会迅速意识到:“哦,这个物体现在是红色的,而且光线很暗,”并立即调整其计划。
- 物理变化: 想象地面突然变得非常湿滑(低摩擦力),或者物体变得非常重。一个“冻结”的 AI 会使用在干燥地面上使用的相同力量,然后失败。AdaJEPA 推了一下,看到物体滑动得太远,便立即学到:“我需要减小推力,”为接下来的每一步做准备。
实验结果
论文表明 AdaJEPA 的效率极高。它不需要从头开始重新学习。它通常只需要在每次行动后进行一次微小的调整(一个“梯度步”)来修复其心智地图。
- 在“安全区”: 即使世界完全符合 AI 的预期,AdaJEPA 也不会损害性能;它只是保持稳定运行。
- 在“变化区”: 当世界发生变化(新的形状、不同的颜色、湿滑的地板)时,AdaJEPA 的表现大幅超越了冻结模型。它从错误中恢复的速度更快,且能更频繁地达成目标。
核心结论
论文认为,AI 不应该是一个一旦离开实验室就停止学习的静态雕塑。相反,它应该是一个在行动的同时,不断校准其对世界理解的生命系统。AdaJEPA 证明了,通过进行这些细微的实时调整,AI 处理变化多端、不可预测的世界的能力,要比那些拒绝适应的系统强得多。
技术摘要:AdaJEPA:一种自适应潜空间世界模型
问题陈述
潜空间世界模型,特别是联合嵌入预测架构(JEPA),通过在紧凑的潜空间内预测未来状态来实现高效规划。这些模型通常在无奖励的离线轨迹上进行训练,并与模型预测控制(MPC)结合用于目标导向型任务。然而,存在一个关键限制:世界模型在训练后通常是冻结的。
在部署时,如果由于测试时分布偏移(例如视觉变化如噪声或光照,或动态变化如摩擦力和质量)导致模型的预测变得不准确,MPC 规划器会优化一个错误的优化目标。在“潜空间想象”中看似有效的动作在真实环境中可能会失败。一步之差的小误差会在规划周期内不断累积,导致显著的性能下降。现有方法通常需要额外的专家演示、目标域微调数据或复杂的外部循环来解决这一问题,这阻碍了其在现实世界中的应用。
方法论:AdaJEPA
作者提出了 AdaJEPA,一种在 MPC 闭环内进行测试时自适应的自适应潜空间世界模型。AdaJEPA 并非将模型视为静态,而是利用来自智能体自身交互的自监督信号来持续重新校准世界模型。
“规划–执行–自适应–重规划”循环
其核心机制在每个 MPC 步骤中按如下方式运行:
- 规划 (Plan): 智能体使用当前(可能已过时的)世界模型规划一系列动作,以最小化潜空间目标到达代价。
- 执行 (Execute): 智能体在环境中执行第一个动作块 (at)。
- 观察 (Observe): 智能体接收下一个观测值 (ot+1)。
- 自适应 (Adapt): 转移过程 {ot,at,ot+1} 被添加到经验回放池中。通过少量的梯度步数(通常仅一步)来更新模型参数,以最小化该新转移上的潜空间预测误差。
- 重规划 (Replan): 更新后的模型立即用于下一次规划迭代。
技术组件
- 架构: 底层世界模型由感知编码器 (Es)、动作编码器 (Ea) 和预测器 (fθ) 组成。它在离线阶段被训练用于预测未来的潜表示 (zt+1),而非重建像素。
- 自适应损失: 自适应使用与预训练相同的自监督潜空间预测目标:
Lada(B)=∣B∣1(oi,ai,oi+1)∈B∑ℓ(fθ(zi,Ea(ai)),sg(zi+1))
其中 B 是近期转移的缓冲区,ℓ 是潜空间预测损失(例如 MSE),sg(⋅) 是停止梯度算子以防止崩溃。
- 参数更新: 为确保效率,自适应过程是轻量级的。作者仅更新一小部分参数(例如编码器和预测器的最后几层),而非整个网络。
- 缓冲区策略: 回放池 B 可以通过“最近-N”(保留最近 N 个转移)或“困难-N”(保留具有最大预测误差的转移)进行管理。
核心贡献
- 首次在规划期间进行 JEPA 自适应: 据作者所知,这是第一项在规划阶段而非仅仅依赖于预训练或离线微调来使 JEPA 世界模型进行自适应的工作。
- 闭环自监督: 该方法利用执行动作后的即时后果作为自监督信号,无需奖励标签、专家演示或单独的数据收集阶段。
- 样本与计算效率: 该框架以极低的计算开销实现了显著的性能提升。在许多实验中,在每次 MPC 重规划步骤中进行单次梯度步更新就已足够。
- 对分布偏移的鲁棒性: 该方法在视觉偏移(噪声、模糊、颜色变化)、动态偏移(质量、阻尼)和结构偏移(未见的迷宫布局)方面均展示了鲁棒性。
实验结果
作者在 PushT(方块推动)和 PointMaze(导航)基准测试下,在各种训练-测试分布偏移下评估了 AdaJEPA。
- 分布内性能: 即使在与训练数据相似的任务上,AdaJEPA 也提高了成功率(例如,在特定的 PushObj 形状上提升了 >20%)或在不降低性能的前提下维持了基准性能,证明了其在分布内应用的安全性。
- 分布外 (OOD) 性能:
- 形状偏移: 在未见的方块形状上,与冻结模型相比,AdaJE解析几乎使规划成功率翻倍。
- 视觉偏移: 该方法在高斯模糊、椒盐噪声和暗光环境下表现出明显的增益。
- 动力学与布局偏移: 在 PointMaze 中,AdaJEPA 从由低质量或高阻尼引起的失败中恢复,并显著提高了在未见迷宫布局上的成功率(例如,在特定布局偏移上获得 +25.3% 的增益)。
- 延迟: 由于仅更新一小部分参数,自适应步骤引入的延迟微乎其微(每次重规划约 0.01–0.03s)。此外,通过更快地从预测误差中恢复,智能体通常能在更少的总重规划次数内到达目标,从而缩短了总执行时间。
- 对数据稀缺性的泛化: 在低数据量的情况下,测试时自适应补偿了有限的训练覆盖范围。例如,在训练数据有限时,AdaJEPA 的表现超过了使用 16 倍轨迹量训练的冻结模型。
意义与主张
论文认为,潜空间世界模型不应在训练后保持固定,而应从部署过程中遇到的经验中持续改进。
- 生物学启发: 该方法植根于生物感觉运动自适应,即系统(如小脑)根据变化的输入和动力学调整行为。
- 数据规模的补充: 虽然更大、更多样化的训练数据可以提高泛化能力,但 AdaJEPA 提供了一种在部署期间精炼模型的样本高效路径,作为数据规模化的补充。
- 未来方向: 作者建议,下一步是将这种轻量级的测试时自适应与持续学习及主动学习相结合,以扩大世界模型的覆盖范围,从而实现更具韧性的感知与规划。
作者强调,他们的方法与特定的世界模型实现无关,在不同架构(ResNet、Transformer、DINO-based)和规划器(梯度下降、CEM)上均表现出一致的改进。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。