← 最新论文
🤖 machine learning

Attacking the Trusted Imagination: Oracle-Level Integrity Attacks on Imagine-then-Act World Models

本文识别了“先想象后行动”世界模型中的“信任想象”是一个关键漏洞,攻击者可以借此轻易地破坏未来的潜空间轨迹,从而绕过安全系统并导致任务失败,同时提出了一种无参数的去噪检测器,能够针对此类偏离流形的扰动实现完美的检测。

原作者: Linghan Chen, Kaiyan Ji, Minyu Guo

发布于 2026-06-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Linghan Chen, Kaiyan Ji, Minyu Guo

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心理念:“信任的梦境”

想象一个机器人,它不仅仅是根据眼前所见做出反应,而是会先对未来几秒钟会发生的事情进行**“做梦”**。它创造了一个关于未来的心理电影(称为“想象”),检查这部电影,然后根据这个梦境来决定该做什么。

本文认为,虽然机器人的实际身体(其“反应式策略”)非常强韧且难以被欺骗,但它的**“梦境”**却极其脆弱。如果你能搞乱这个梦境,你就能诱导机器人做出极其糟糕的决策,即便机器人的身体本身仍在完美运行。

两种类型的机器人

作者解释了机器人使用这些“梦境”的两种方式:

  1. “反应式”机器人(安全型):

    • 工作原理: 它会对未来进行构想,但仅将梦境作为快速参考。它会不断检查真实世界,以确认梦境是否正确。如果梦境说“跳跃”,但现实世界显示“有一堵墙”,机器人就会忽略梦境并停止动作。
    • 结果: 即使攻击者搞乱了梦境,机器人依然安全。它只会忽略错误的梦境并继续工作。论文称之为“无效结果(null result)”——因为它很乏味,因为对机器人的实际任务并没有造成任何负面影响。
  2. “先知型”机器人(脆弱型):

    • 工作原理: 这种机器人将它的梦境视为绝对真理。它在行动前不会检查现实世界。它会问:“我的梦里说会发生什么?”然后根据那个预测来行动。这就像一个安全门,它说:“如果梦境说‘安全’,我们就开门”,而完全不看外面。
    • 结果: 这是弱点所在。如果你破坏了梦境,机器人就会基于谎言采取行动。论文表明,对于这类机器人,对摄像头输入进行微小的、几乎不可察觉的修改,就能让原本成功的任务变成彻底的失败。

攻击手段:搅乱梦境

研究人员发现了一种破解这种“做梦”过程的方法。

  • 方法: 他们在机器人看到的图像中加入极微量的、肉眼不可见的“噪声”(静电干扰)。由于机器人的大脑是基于允许平滑计算的数学构建的(可微性),研究人员可以使用一种称为**投影梯度下降(Projected Gradient Descent)**的技术。
  • 类比: 想象机器人的梦境是一张地图。研究人员不需要重画整张地图,只需要稍微移动一下起点。因为地图是连续连接的,这个微小的挪动就会改变整个预测的未来路径。
  • 不对称性(核心发现):
    • 破坏梦境很容易: 将梦境推向“错误”状态非常容易。研究人员发现,他们破坏梦境的效果比单纯添加随机噪声要高效 60 倍。梦境会变成一个模糊、荒诞的混乱状态。
    • 控制梦境很难: 要强制梦境呈现出一个特定的新场景(比如让机器人在明明是车库的地方梦见自己在厨房)是非常困难的。梦境会抵抗被精确引导。这就像试图把一块沉重的巨石推向山坡上的特定位置;你可以轻易地把它撞离原有的路径,但你无法精准地控制它落到哪里。

防御手段:“嗅探犬”

既然研究人员知道被破坏的梦境看起来很“不对劲”(它脱离了现实的自然路径),他们便构建了一个检测器。

  • 工作原理: 他们使用一个“去噪器”(一种尝试清理模糊图像的工具)来检查梦境。如果梦境是一个自然、清晰的预测,去噪器就会表现正常;如果梦境被黑客攻击了,去噪器就会感到困惑并发出警报。
  • 结果: 这个检测器非常出色。它捕捉到了 100% 的被攻击梦境(AUC 1.0)。
  • 代价: 研究人员尝试构建了一个“自适应攻击者”,即试图向检测器隐藏攻击痕迹的攻击者。他们发现,如果要隐藏攻击痕迹,攻击者就必须停止攻击。你无法既破坏梦境,又让它看起来很自然。防御机制经受住了考验。

现实世界测试

研究人员在名为 LaDi-WM 的特定机器人系统上测试了这一过程,该系统利用其“梦境”来规划动作(属于“先知型”)。

  • 结果: 当研究人员用极微量的噪声(小到人类无法察觉)攻击梦境时,机器人的成功率从 70% 骤降至 5%
  • 对比: 如果他们添加相同数量的随机噪声(而非针对性攻击),机器人依然能正常工作(70%)。这证明了该攻击并非仅仅是“弄坏了摄像头”,而是专门破坏了机器人的**“想象力”**。

总结

  • 问题所在: 信任自身“未来预测”的机器人是脆弱的。
  • 攻击手段: 通过对输入进行微小且不可见的修改,可以轻易破坏这些预测。
  • 防御手段: 这些被破坏的预测很容易被检测出来,因为它们看起来很“不自然”。
  • 教训: 仅仅机器人的身体足够强壮是不够的,它的脑子(或它的规划器)并不一定安全。如果机器人依赖于对未来的信任预测,那么这个预测就是一个新的、危险的薄弱环节。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →