← 最新论文
🤖 AI

ARB4WM: An Adversarial Robustness Benchmark for World Models in Continuous Control

本文介绍了 ARB4WM,这是一个统一的基准框架,通过在各种扰动策略和时间攻击模式下,系统地测试针对策略、价值和潜变量动力学层级的五种白盒损失目标,来评估世界模型智能体在连续控制中的对抗鲁棒性。

原作者: Junjian Zhang, Hao Tan, Ruonan Li, Dong Zhu, Aiping Li, Zhaoquan Gu

发布于 2026-06-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Junjian Zhang, Hao Tan, Ruonan Li, Dong Zhu, Aiping Li, Zhaoquan Gu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个工厂里高科技的机械臂。它不仅仅是根据当前看到的画面做出反应,它的脑子里还有一个“做梦”的大脑。它不只是看一张图片,而是构建了一部关于世界运作方式的心智电影。它会想象:“如果我这样移动手臂,杯子就会滑到那里。”它利用这些想象出的电影来规划自己的动作。这被称为世界模型(World Model)

这篇论文介绍了一种新的测试工具,叫做 ARB4WM。把 ARB4WM 想象成这些“做梦型”机器人的“压力测试”或“反派模拟器”。它的任务是测试这些机器人的“梦境”有多容易被视频摄像头信号中微小到几乎不可见的改变所欺骗。

以下是该论文通过简单的类比进行的拆解:

1. 问题所在:破坏机器人的“耳语”

在过去,研究人员主要测试的是能否诱导机器人立即做出错误的动作。但这些“做梦型”机器人不同。如果你稍微欺骗一下摄像头,它不仅会搞乱当前的动作,还会腐蚀机器人的记忆想象力

  • 类比: 想象你在驾驶一辆使用 GPS 来预测前方道路的汽车。如果有人在 GPS 屏幕上贴了一个微小的、肉眼几乎看不见的贴纸,汽车可能不仅是现在转错了弯;它甚至可能开始相信五分钟后的路终点是一个悬崖。机器人的“心智电影”会变成一部恐怖片,导致它在稍后陷入恐慌或发生碰撞,即便此时摄像头看起来已经恢复正常了。

2. 解决方案:ARB4WM(“反派模拟器”)

作者构建了一个框架,用于测试四种不同类型的这些“做梦型”机器人(分别称为 Dreamer、R2-Dreamer、Dreamer-InfoNCE 和 Dreamer-Pro),涵盖了 20 个不同的任务,比如堆叠积木或平衡杆。

他们不仅仅是在问:“你能让机器人掉落积木吗?”他们问的是:“你如何能破坏机器人的大脑?”他们测试了五种特定的破坏系统的方法:

  • “决策混乱”攻击(The "Confused Decision" Attack): 试图让机器人对该做什么感到困惑。
  • “恐惧大脑”攻击(The "Scared Brain" Attack): 让机器人认为每种情况都很糟糕(降低其置信度评分)。
  • “坏记忆”攻击(The "Bad Memory" Attack): 腐蚀机器人的内部记忆,使其忘记自己所处的位置。
  • “破碎时光机”攻击(The "Broken Time Machine" Attack): 使机器人的未来预测(它的“梦”)与实际发生的情况不一致。
  • “错误地图”攻击(The "Wrong Map" Attack): 扰乱机器人关于世界如何运动的内部地图。

3. 研究发现:何时以及如何失效

研究人员发现了一些关于这些机器人失效方式的惊人发现:

  • 不仅仅关乎动作: 你不需要立刻诱导机器人做出错误的动作。如果你欺骗了它的“价值系统”(即它认为某种情况有多好)或它的“记忆”,它会在稍后失败。
  • “早期投毒”效应(The "Early Poison" Effect): 如果你在任务的非常开始阶段欺骗机器人,它比在结束阶段被欺骗时更难恢复。这就像是在一段漫长旅程的开始就毒死了水源;旅行者会生病并无法完成旅程,即便后来的水是干净的。
  • “闪烁”效应(The "Flash" Effect): 你不需要每秒钟都欺骗机器人。如果你每隔几秒钟欺骗一次,机器人的“梦”仍然会被严重腐蚀并导致崩溃。机器人的记忆会将错误的信息保留太久。
  • 简单的修复手段不起作用: 研究人员尝试使用“过滤器”(比如模糊图像或压缩图像)来阻止攻击。有时确实有一点帮助,但如果“反派”知道这个过滤器,他们就可以调整他们的招数来绕过它。这就像为了防范扒手而穿上一件外套;如果扒手知道你穿着外套,他们就会学会换一种方式掏你的口袋。

4. 胜者与败者

论文对比了四种机器人大脑:

  • 胜者: R2-Dreamer 是最稳健的。它是最难被欺骗的,并且在受到攻击后恢复得最好。作者认为这是因为它经过训练以避免拥有“冗余”(重复性)的记忆,使其心智地图更清晰,也更难被迷惑。
  • 败者: Dreamer-Pro 虽然被设计为非常擅长识别物体,但实际上却是最容易被欺骗的。它那种复杂的物体分组方式使其对微小的变化非常敏感。

5. 核心启示

这篇论文的核心信息是:我们不能仅仅测试机器人是否做出了正确的动作。我们必须测试它的整个内部过程:它的记忆、它的想象力和它的置信度。

如果我们想在现实生活中(如工厂或医院)使用这些机器人,我们需要停止将它们视为简单的“按下按钮的摄像头”。我们需要将它们视为复杂的“做梦者”,并测试它们的梦境有多容易被劫持。ARB4WM 工具是确保这些机器人在关键时刻不会做噩梦的新型“压力测试”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →