← 最新论文
🤖 machine learning

WMAttack: Automated Attack Search for Adversarial Evaluation of World-Model Agents

本文介绍了 WMAttack,这是一个自动化框架,它采用自校正攻击搜索和表征引导攻击检索,以高效且准确地识别更强的对抗性攻击,从而评估世界模型智能体在多样化环境中的鲁棒性。

原作者: Zhixiang Guo, Siyuan Liang, Shi Fu, Cheng Guo, Andras Balogh, Mark Jelasity, Dacheng Tao

发布于 2026-05-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhixiang Guo, Siyuan Liang, Shi Fu, Cheng Guo, Andras Balogh, Mark Jelasity, Dacheng Tao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你建造了一个非常聪明的机器人,它通过观看自己玩游戏来学习,构建一个关于接下来会发生什么的心理“电影”,然后基于这部电影做出决策。这被称为世界模型(World Model)。这些机器人在玩 Atari 游戏和复杂的控制任务方面正变得极其出色。

但问题在于:我们并不真正了解它们的“心理电影”有多么脆弱。如果你给它们展示一张略微失真的图像(比如屏幕上的一小块污渍),它们会惊慌失措并崩溃吗?还是会继续完美地游戏?

这篇论文介绍了WMAttack,这是一种新工具,旨在成为这些机器人的终极“压力测试器”。

问题:安全性的“猜谜游戏”

目前,检查机器人是否稳健,就像试图一根一根地看稻草,以便在干草堆中找到一根针。

  • 人工测试很薄弱:如果人类试图通过猜测随机的故障来破坏机器人,他们可能会错过薄弱环节。机器人看起来很强,但这仅仅是因为人类没有足够努力地尝试。
  • 暴力穷举太慢:如果你试图测试每一个可能的故障组合,那将耗费永恒的时间。每次测试都需要机器人在循环中实际“玩”游戏,这在计算上代价高昂。

解决方案:WMAttack(智能压力测试器)

作者创建了WMAttack,这是一个自动化系统,它不仅仅是随机猜测。相反,它像一个侦探大师,学习如何高效地破坏机器人。它拥有两大主要超能力:

1. RGAR:“旅行侦探”(检索)

想象你是一名侦探,正在试图解决一个新案件。你不是从头开始,而是查看你旧的案件档案。你注意到新案件与你去年解决的一个案件非常相似。你拿起当时有效的策略,并将其作为起点。

  • 工作原理:WMAttack 观察新机器人的行为(其“潜在表示”),并将其与其他机器人上的数千次过往测试进行比较。
  • 优势:它找到了一个“热启动”。它不是盲目猜测,而是从那些在外观相似机器人上行之有效的攻击策略开始。这节省了大量时间。

2. SCAS:“自我纠正的教练”(优化)

一旦侦探开始测试,他们就需要从错误中学习。如果某种特定类型的故障无法破坏机器人,教练会说:“好吧,那没起作用。让我们尝试稍微不同的角度。”

  • 工作原理:系统运行一次测试,观察机器人的性能下降了多少,然后利用该反馈来更新其“猜测策略”。它将注意力转移到那些实际上对机器人伤害最大的故障类型上。
  • 优势:它停止在弱攻击上浪费时间,并将精力集中在能导致最大失败的“必杀技”上。

结果:发现真正的薄弱环节

研究人员使用著名的 AI 模型(如 DreamerV3)在 46 种不同场景下测试了 WMAttack。

  • 优于随机:当他们将 WMAttack 与仅进行随机猜测的系统进行比较时,WMAttack 发现了更强的攻击。它导致机器人损失的分数显著更多(在某些情况下,造成的损害高达两倍)。
  • 优于“自动研究”:他们还将其与使用 AI 编写自身攻击脚本的系统(称为 Claudini)进行了比较。WMAttack 依然获胜,找到了更多破坏机器人的有效方法。
  • 效率:尽管找到完美的攻击需要时间,但 WMAttack 比其他系统更快地发现了好的攻击。它在更少的尝试次数内就达到了高质量的结果。

结论

论文认为,要真正信任这些“世界模型”机器人,我们需要一种更好的方法,在它们于现实世界中崩溃之前先将其击破。WMAttack 提供了一种智能、自动化的方法来实现这一点。它结合了过往测试的经验(RGAR)与从失败中进行的实时学习(SCAS),从而高效地揭示这些高级 AI 代理究竟有多么脆弱。

简而言之:这不仅仅是关于破坏机器人;而是关于找到最佳的破坏方式,以便我们确切知道在哪里修补漏洞。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →