想象一下,你正在教一个机器人做晚饭。你不仅仅是想让它按部就班地遵循食谱;你还希望它能理解厨房本身。你希望它知道,如果炉灶变热,水就会沸腾;如果掉下了一把勺子,它会发出叮当声。这就是“世界动作模型”(World Action Models, WAMs)的梦想。这些先进的 AI 大脑不仅决定下一步该做什么,还能模拟未来,预测世界会如何根据其动作而改变,就像在机器人的脑海中运行着一个游戏引擎一样。
然而,这里有一个问题。这些机器人极其聪明,但也出奇地脆弱。如果你改变了厨房的光照,稍微移动了摄像头,或者在视频流中加入一点点静态噪声,机器人可能会陷入恐慌并弄掉汤。这就像一个能在安静书桌前完美解决数学题的优秀学生,但只要有一只苍蝇在耳边嗡嗡作响,就会不知所措。科学家们一直试图通过用成千上万个杂乱厨房的新案例来重新训练机器人来解决这个问题,但这既耗时又昂贵。核心问题在于:我们能否在机器人工作时,在不按下“重置”键并从头开始的情况下,实时修复其行为?
这篇题为《通过机械解释性和最优控制为世界动作模型注入鲁棒性》的论文,深入研究了机器人的大脑,试图看看我们能否将其引导回正轨。作者们将机器人的内部思维(称为“激活值”)视为一张地图。他们问道:在地图上是否存在一条简单的直线,能够区分“正在做正确的事”和“因为摄像头的噪声而陷入恐慌”?他们发现,对于某些机器人模型来说,答案是肯定的,确实存在一条清晰的界线。而对于另一些模型,这张地图则是一团乱麻。
为了修复那些拥有清晰界线的机器人,作者们发明了一个新技巧,叫做 WA-LQR。你可以把它想象成机器人大脑的一个超级智能自动驾驶仪。它并不只是盲目地将机器人的思维推向一个方向(这可能推得太多或太少),WA-LQR 就像一位熟练的驾驶员,在纠正一辆偏离道路行驶的汽车。它不断检查机器人在思考什么,将其与保持冷静时“应该”思考的状态进行对比,并进行微小且精确的调整,以保持机器人的航向。
实验结果虽然具有针对性,但前景广阔。当他们在两种类型的机器人大脑(Cosmos-Policy 和 DiT4DiT)上进行测试时,这个自动驾驶仪表现出色。它帮助机器人在摄像头晃动、夹爪位置偏移或视频充满静态噪声的情况下依然能成功完成任务。在某些情况下,它将成功率提升了高达 41%。然而,当他们尝试将此方法应用于第三种类型的机器人大脑(LingBot-VA)时,由于“地图”过于混乱,找不到直线,自动驾驶仪几乎无法提供帮助。这表明,虽然我们无法用这个技巧修复所有的机器人,但对于那些具有正确内部结构的机器人,我们可以让它们变得更加强韧可靠,而无需进行任何重新训练。这有点像是意识到有些车只需要一个更好的方向盘,而有些车则需要更换全新的发动机。
技术摘要:通过机械解释性与最优控制为世界动作模型注入鲁棒性
问题陈述
世界动作模型(World Action Models, WAMs)通过将动作预测与未来状态建模相结合,代表了机器人学习领域的重大进展。不同于直接将观测映射到动作的视觉-语言-动作(VLA)模型,WAMs 旨在产生具有动态连贯性的策略。然而,WAMs 在面对分布外(OOD)偏移时仍然表现脆弱,例如相机视角变化、初始机器人状态(如夹持器位置)以及视觉损坏(如高斯噪声)。
目前的鲁棒性策略通常依赖于大规模数据收集、多样化的训练集或高昂的重训练成本。本文旨在解决如何在不进行微调的情况下,通过推理时干预来提高鲁棒性的问题。核心研究问题包括:
- WAMs 的内部激活是否揭示了它们在特定扰动下失效的原因?
- 是否可以通过机械解释性(Mechanistic Interpretability, MI)识别这些表示,并以此引导模型实现鲁棒行为,而无需重新训练?
方法论
所提方法由两个主要阶段组成:用于识别可控性的机械分析,以及用于实施鲁棒性干预的激活引导。
1. WAM 激活的机械分析
作者研究了鲁棒性关键特征(例如对相机噪声或夹持器位置的敏感性)是否在 WAMs 的激活空间中表现出低维线性可分性。
- 对比数据集: 他们构建了对比数据集,在多个任务(LIBERO-10)中比较标称(干净)输入与受扰动输入(如偏移的相机、添加的噪声)。
- 线性可分性指标: 将激活进行聚合并投影到前三个主成分(PCs)上。使用线性支持向量机(SVM)来区分标称激活与受扰动激活。性能通过平均合页损失(hinge loss)来衡量;损失接近 0 表示强线性可分性,接近 1 则表示随机可分。
- 架构依赖性: 分析表明,线性可分性具有高度的架构依赖性。像 Cosmos-Policy 和 DiT4DiT 这样的模型在鲁棒性特征方面表现出清晰的低维线性结构,而 LingBot-VA 则表现出微弱或不存在的可分性。
2. 激活引导策略
基于机械分析的发现,本文提出了两种引导方法:
开环激活相加 (ActAdd):
- 通过从标称输入中减去受扰动输入的激活来计算对比方向 (d)。
- 在推理时,将一个固定向量 (γ⋅d) 添加到模型的隐藏状态中。
- 局限性: 这是一种静态的开环方法,忽略了当前激活的状态,可能导致过度引导或动作退化。
世界-动作线性二次调节器 (WA-LQR):
- 一种专为 WAMs 设计的闭环、基于模型的最优控制方法。
- 降维: 利用对比方向的奇异值分解(SVD)将高维激活投影到低维潜在子空间中。
- 局部线性: 假设扩散 Transformer 的动力学在该子空间内是局部线性的。它通过雅可比向量积(JVPs)来近似动力学,从而定义状态转移矩阵 (A) 和控制矩阵 (B)。
- 控制合成: 将引导问题表述为线性二次调节器(LQR)任务。它最小化一个代价函数,该函数惩罚对目标“特征设定点”(期望的鲁棒强度)的偏差以及控制能量。
- 自适应干预: 与 ActAdd 不同,WA-LQR 在每一层和每个时间步都会计算反馈增益 (K)。它仅在激活偏离目标特征强度时应用引导,从而在线适应 WAM 动力学的具体实现。
核心贡献
- WAM 鲁棒性的机械分析: 作者首次对 WAM 激活在鲁棒性相关扰动下的情况进行了机械性研究。他们发现,干扰特征(nuisance features)的低维线性可分性是有效进行激活引导的前提条件,且这种特性高度依赖于模型架构。
- 以可控性作为诊断工具: 他们证明了 SVM 合页损失(衡量线性可分性的指标)与引导成功率之间存在强相关性。这使得从业者能够在尝试干预之前,预判特定的 WAM 是否适用于免训练引导。
- WA-LQR 框架: 他们引入了 WA-LQR,这是首个用于 WAMs 的闭环激活引导方法。它利用扩散 Transformer 动力学的局部线性特性,合成降阶 LQR 控制器,在无需微调的情况下将激活引导至鲁棒设定点。
- 实证验证: 本文验证了:
- 具有高线性可分性的模型(Cosmos-Policy, DiT4DiT)表现出显著的鲁棒性提升。
- 可分性较低的模型(LingBot-VA)几乎没有改善,且开环方法甚至可能导致性能下降。
- WA-LQR 优于开环 ActAdd 和基于提示(prompt-based)的引导基准,特别是在避免过度引导方面。
结果
实验在 Cosmos-Policy、DiT4DiT 和 LingBot-VA 上使用 LIBERO-10 基准测试进行,涵盖三种扰动类型:相机方向偏移、初始夹持器位置变化和高斯图像噪声。
- Cosmos-Policy: 与未引导的基准相比,WA-LQR 将成功率提升了高达 41%。例如,在相机方向扰动下,成功率从约 46%(未引导)上升到约 59%(WA-LQR)。该方法成功地在不同任务间泛化了对比方向。
- DiT4DiT: 观察到了类似的改进,WA-LQR 在处理高斯噪声和夹持器位置偏移方面优于未引导和 ActAdd 基准。
- LingBot-VA: 与机械分析一致,引导带来的鲁棒性收益极小。在某些情况下,开环 ActAdd 由于过度引导导致了性能下降,而 WA-LQR 虽然缓解了这一问题,但仍未能实现显著改善,这证实了线性可分性对于该方法奏效的必要性。
- 相关性: 研究发现 SVM 合页损失(可分性指标)与成功率提升之间存在强负相关,验证了使用机械分析作为干预有效性预测器的可行性。
意义与主张
本文主张,机械解释性可以作为一种诊断工具,用以确定机器人基础模型在推理时进行鲁棒性干预的可行性。通过识别某些 WAMs(如 Cosmos-Policy 和 DiT4DiT)中的鲁棒性关键特征存在于低维、线性可分的子空间中,作者证明了免训练引导是提高部署鲁棒性的可行策略。
WA-LQR 的引入代表了从静态、开环激活修改向动态、闭环控制的转变。这种方法将 WAM 推理视为一个降阶动力系统,从而实现能够尊重模型内部状态的自适应干预。作者总结道,虽然可控性并非在所有架构中都具有普适性,但对于那些具备所需线性结构的架构,通过对隐藏表示进行机械控制,为实现鲁棒的机器人策略提供了一条无需大规模重训练或新数据收集的极具前景的路径。
作者注明的局限性:
- 该方法目前仅适用于表现出强线性可分性的模型;目前还没有通用的方法可以在不进行针对特定设置的机械分析的情况下,预测表示在任意任务或环境中的迁移性。
- 该方法对模型架构表现出强烈的依赖性,这凸显了未来设计既能保持基础模型表示,又具备内在可控性的 WAMs 的必要性。
每周获取最佳 electrical engineering 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。