核心理念:“信任的梦境”
想象一个机器人,它不仅仅是根据眼前所见做出反应,而是会先对未来几秒钟会发生的事情进行**“做梦”**。它创造了一个关于未来的心理电影(称为“想象”),检查这部电影,然后根据这个梦境来决定该做什么。
本文认为,虽然机器人的实际身体(其“反应式策略”)非常强韧且难以被欺骗,但它的**“梦境”**却极其脆弱。如果你能搞乱这个梦境,你就能诱导机器人做出极其糟糕的决策,即便机器人的身体本身仍在完美运行。
两种类型的机器人
作者解释了机器人使用这些“梦境”的两种方式:
“反应式”机器人(安全型):
- 工作原理: 它会对未来进行构想,但仅将梦境作为快速参考。它会不断检查真实世界,以确认梦境是否正确。如果梦境说“跳跃”,但现实世界显示“有一堵墙”,机器人就会忽略梦境并停止动作。
- 结果: 即使攻击者搞乱了梦境,机器人依然安全。它只会忽略错误的梦境并继续工作。论文称之为“无效结果(null result)”——因为它很乏味,因为对机器人的实际任务并没有造成任何负面影响。
“先知型”机器人(脆弱型):
- 工作原理: 这种机器人将它的梦境视为绝对真理。它在行动前不会检查现实世界。它会问:“我的梦里说会发生什么?”然后根据那个预测来行动。这就像一个安全门,它说:“如果梦境说‘安全’,我们就开门”,而完全不看外面。
- 结果: 这是弱点所在。如果你破坏了梦境,机器人就会基于谎言采取行动。论文表明,对于这类机器人,对摄像头输入进行微小的、几乎不可察觉的修改,就能让原本成功的任务变成彻底的失败。
攻击手段:搅乱梦境
研究人员发现了一种破解这种“做梦”过程的方法。
- 方法: 他们在机器人看到的图像中加入极微量的、肉眼不可见的“噪声”(静电干扰)。由于机器人的大脑是基于允许平滑计算的数学构建的(可微性),研究人员可以使用一种称为**投影梯度下降(Projected Gradient Descent)**的技术。
- 类比: 想象机器人的梦境是一张地图。研究人员不需要重画整张地图,只需要稍微移动一下起点。因为地图是连续连接的,这个微小的挪动就会改变整个预测的未来路径。
- 不对称性(核心发现):
- 破坏梦境很容易: 将梦境推向“错误”状态非常容易。研究人员发现,他们破坏梦境的效果比单纯添加随机噪声要高效 60 倍。梦境会变成一个模糊、荒诞的混乱状态。
- 控制梦境很难: 要强制梦境呈现出一个特定的新场景(比如让机器人在明明是车库的地方梦见自己在厨房)是非常困难的。梦境会抵抗被精确引导。这就像试图把一块沉重的巨石推向山坡上的特定位置;你可以轻易地把它撞离原有的路径,但你无法精准地控制它落到哪里。
防御手段:“嗅探犬”
既然研究人员知道被破坏的梦境看起来很“不对劲”(它脱离了现实的自然路径),他们便构建了一个检测器。
- 工作原理: 他们使用一个“去噪器”(一种尝试清理模糊图像的工具)来检查梦境。如果梦境是一个自然、清晰的预测,去噪器就会表现正常;如果梦境被黑客攻击了,去噪器就会感到困惑并发出警报。
- 结果: 这个检测器非常出色。它捕捉到了 100% 的被攻击梦境(AUC 1.0)。
- 代价: 研究人员尝试构建了一个“自适应攻击者”,即试图向检测器隐藏攻击痕迹的攻击者。他们发现,如果要隐藏攻击痕迹,攻击者就必须停止攻击。你无法既破坏梦境,又让它看起来很自然。防御机制经受住了考验。
现实世界测试
研究人员在名为 LaDi-WM 的特定机器人系统上测试了这一过程,该系统利用其“梦境”来规划动作(属于“先知型”)。
- 结果: 当研究人员用极微量的噪声(小到人类无法察觉)攻击梦境时,机器人的成功率从 70% 骤降至 5%。
- 对比: 如果他们添加相同数量的随机噪声(而非针对性攻击),机器人依然能正常工作(70%)。这证明了该攻击并非仅仅是“弄坏了摄像头”,而是专门破坏了机器人的**“想象力”**。
总结
- 问题所在: 信任自身“未来预测”的机器人是脆弱的。
- 攻击手段: 通过对输入进行微小且不可见的修改,可以轻易破坏这些预测。
- 防御手段: 这些被破坏的预测很容易被检测出来,因为它们看起来很“不自然”。
- 教训: 仅仅机器人的身体足够强壮是不够的,它的脑子(或它的规划器)并不一定安全。如果机器人依赖于对未来的信任预测,那么这个预测就是一个新的、危险的薄弱环节。
技术摘要:攻击受信任的想象力
问题陈述
近期的视觉-语言-动作(VLA)策略越来越多地采用“先想象后行动”的架构,即世界-动作模型(World-Action Model, WAM)首先生成未来视觉表示(z~)的潜在轨迹,随后再为动作策略提供条件。虽然先前的对抗性研究侧重于攻击反应式策略从观测到动作的路径,但本文识别出了一个新的、截然不同的攻击面:下游预言机(oracles)所消耗的受信任的想象力(trusted imagination)。
作者认为,虽然反应式策略在具有环境反馈的真实闭环中执行以纠正错误,但下游预言机(如安全门控、视觉模型预测控制(MPC)规划器或“想象并检查”验证器)将想象的未来 z~ 视为一个无需真实世界纠正信号的受信任预测。因此,反应式策略的鲁棒性并不意味着依赖于 WAM 想象力的系统的鲁棒性。其核心现象是不对称性:破坏想象力(将其推离其自然的流形)很容易,但将其精确引导至流形上的特定目标却很难。
方法论
威胁模型
作者采用了基于能力的白盒威胁模型:
- 攻击者能力: 攻击者拥有对 WAM 和编码器的完全访问权限(遵循柯克霍夫原则),并且可以通过添加 ℓ∞ 有界扰动 δ(∥δ∥∞≤ϵ)来扰动当前的摄像机观测值 o。
- 约束条件: 攻击者无法修改模型权重,无法访问预言机的内部,也无法观察真实的未来。
- 可微性: 由于对于连续扩散驱动的 WAM,从观测到想象未来的映射(o→z~)是端到端可微的(不存在离散的向量量化或原地缓存写入),这使得攻击可以利用真正的投影梯度下降(PGD)。
攻击目标
论文定义了两个攻击目标(定义 2):
- 无目标破坏(Untargeted Corruption): 通过最小化余弦相似度,最大化对抗性想象 z~adv 与洁净想象 z~clean 之间的差异。其目的是将 z~ 推离其自然的未来流形。
- 有目标引导(Targeted Steering): 尝试将 z~adv 驱动向攻击者选定的特定目标 z~tgt(例如,不同的场景或指令)。
检测机制
作者提出了一种无参数的去噪自一致性检测器(denoiser self-consistency detector)。由于被破坏的想象本质上是“脱离流形”的(偏离了模型学习到的自然未来的低维流形),该检测器通过测量在微小噪声水平下的平均未来帧速度预测范数来进行判断。高范数表示样本已脱离流形且可能已被破坏。该检测器不需要洁净的参考样本。
核心贡献
- 新的攻击面: 首次针对“想象后行动”型 WAM 的受信任想象力提出了白盒完整性攻击。作者证明了从观测到想象的映射允许对潜在未来进行真正的基于梯度的攻击。
- 不对称机制: 论文确立了无目标破坏比随机噪声强得多(约 60 倍)且在感知上可见,而针对任意场景的有目标引导则是受到严格限制的。这种不对称性是由解码帧的证据而非仅仅是潜在空间的余弦相似度所决定的。
- 鲁棒防御: 无参数的去噪检测器在区分洁净与对抗性想象方面实现了 1.0 的曲线下面积(AUC)。至关重要的是,该防御能够抵御自适应攻击者;试图通过留在流形上来规避检测的攻击者,必须牺牲其破坏想象力的能力。
- 任务级空值 vs. 预言机失效: 论文提供了一个“诚实空值(honest null)”证明,显示反应式策略对被破坏的想象保持鲁棒(成功率几乎没有下降)。然而,它展示了第一个针对特定对手的真实任务失败,即在原生想象驱动的 MPC 中,预言机对被破坏的 z~ 的信任导致了灾难性的决策。
实验结果
研究评估了跨越想象-动作耦合的三个目标:RynnVLA-002(断开耦合)、LingBot-VA(弱耦合/预言机)和 LaDi-WM(强原生耦合)。
- 无目标破坏: 在 LingBot-VA 上,无目标攻击实现的破坏程度高达随机噪声的 60 倍。在 ϵ=0.1 时,保真度验证器在 100% 的案例中切换为“不可信”,且零假阳性。解码帧显示出明显的感知伪影(模糊、重影)。
- 有目标引导: 虽然潜在空间余弦指标显示存在一定的引导,但解码帧和验证器表明,引导至真正不同场景的能力是受限的。对于跨场景目标,差距缩小仅为 ~0.2,且验证器在 0/8 的案例中正确拒绝了对抗性想象。
- 检测: 去噪自一致性检测器在 ϵ≥0.2 时实现了 AUC 1.0。表面统计量(RMS、max-abs)未能检测到攻击,证实了攻击在保持在 ℓ∞ 预算内的同时实现了脱离流形。
- 自适应攻击者: 当攻击者最小化结合了破坏程度和检测得分的损失函数时,规避检测需要大幅降低破坏程度(从 0.279 降至 0.064),证明了防御的有效性。
- 真实任务失败(LaDi-WM MPC): 在采样 MPC 设置中,对抗性破坏导致成功率崩溃。在 ϵ=0.01 时,随机噪声维持了约 0.70 的成功率(与洁净情况相似),而对抗性攻击使成功率降至 0.05(Fisher p<10−4)。这种“对手特有的窗口”表明,预言机对想象力的依赖产生了一种反应式策略所不具备的独特脆弱性。
重要性与主张
论文声称,当系统依赖于受信任的想象力时,策略的鲁棒性并不等于系统的鲁棒性。其核心论点是,“受信任的想象力”对于缺乏真实世界纠正信号的下游预言机(规划器、验证器、安全门控)而言是一个关键漏洞。
其重要性在于:
- 识别出“想象后行动”范式引入了一个不同于动作路径的特定攻击面。
- 证明了虽然反应式策略可以容忍被破坏的内部特征,但将这些特征作为预测进行处理的系统(预言机)会遭受对手特定的失败。
- 展示了破坏行为固有的“脱离流形”特性使得高度有效的无参数检测成为可能,即使面对自适应攻击者也是如此。
作者明确指出了局限性:评估是基于模拟的(LIBERO-10),有目标引导是受限的(无法任意控制场景),且“可用性”影响(任务成功率下降)在统计上是显著的,但与早期试点估计相比,其量级适中。该工作得出的结论是,主要威胁在于破坏预言机的决策过程,而非任意劫持策略的行为。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。