← 最新论文
🤖 AI

CIVA: Critic-Induced Value-Subspace Attacks on Visual World-Model Agents

该论文提出了 CIVA,一种利用智能体评论家(critic)所诱导的低维值子空间来生成具有时间相干性且成本高效的扰动的白盒攻击方法,从而有效地破坏像 DreamerV3 这样的视觉世界模型智能体。

原作者: Jiancheng Wang, Mingli Zhu, Tong Zhang, Jiaqi Ruan, Wei Wang, Siyuan Liang, Dacheng Tao

发布于 2026-08-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Jiancheng Wang, Mingli Zhu, Tong Zhang, Jiaqi Ruan, Wei Wang, Siyuan Liang, Dacheng Tao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在快速演进的人工智能世界中,出现了一类新一代的决策系统,它们通过想象未来来学习如何行动。与那些仅仅对当前瞬间看到的图像做出反应的旧程序不同,这些先进的智能体构建了一个关于其环境的内部心理模型。它们接收一系列视觉输入(例如来自摄像机的视频流),并将其压缩成一个隐藏的、抽象的状态,这个状态既能记住已经发生的事情,也能预测接下来会发生什么。这种内部状态使它们能够提前规划好几步,就像人类驾驶员在到达弯道之前预判弯道一样。随着这些系统从视频游戏转向现实世界的机器人技术和安全至关重要的任务,理解如何干扰它们已成为一个至关重要的问题。如果一个智能体依赖于连续的内部预测流,那么摄像机中一个微小的、瞬间的故障是否重要,还是说智能体的记忆会将其平滑掉?这是研究人员目前正试图解决的核心谜题。

一组科学家发现,破坏这些“世界模型”智能体的方法并不是通过用随机噪声攻击每一帧视频,而是通过寻找视觉数据中一个特定的、隐藏的方向,而这个方向正是智能体自身大脑最为敏感的方向。在一项针对被训练用于行走、玩乒乓球以及在开放式环境中生存的智能体的研究中,研究人员发现,如果受到非常特定的攻击,这些系统会表现得异常脆弱。他们开发了一种名为 CIVA 的方法,即“评论家诱导的价值子空间攻击”(Critic-Induced Value-Subspace Attacks)。其核心思想是,这些智能体内置了一个“计分员”,它不断评估未来的前景有多好。通过研究这个计分员对微小变化的反应,研究人员发现,降低智能体得分最有效的方法,就是沿着一条非常狭窄、低维度的路径去推动视觉数据。这条路径并非随机生成的;它是图像空间中一组特定的方向,这些方向已被智能体自身的内部逻辑揭示为对其决策至关重要的部分。

研究人员针对一种被称为 DreamerV3 的复杂智能体测试了这种方法,该智能体经过训练可以执行复杂的任务,如双足行走或玩乒乓球游戏。他们设定了一个场景:攻击者只能微调智能体当前看到的图像,并且对像素的变化量有严格限制,以确保这种干扰在肉眼看来是不可见的。以往尝试破解此类系统的尝试通常将每个视频帧视为独立的攻击目标,即在序列中的每张图片上添加噪声。然而,研究人员发现,这种方法对世界模型智能体不起作用。因为智能体会记住过去的帧并将其融合到其内部状态中,孤立的噪声爆发会被冲刷掉并被遗忘。智能体的记忆起到了一种过滤器的作用,稀释了随机的、逐帧攻击的影响。

为了克服这一点,研究人员首先进行了一系列离线实验,通过探测智能体的内部“计分员”,观察哪些图像的微小变化会导致预测未来得分的最大下降。他们收集了数千个这类有效的变化,并使用一种数学技术找到了其中的共同特征。他们发现,所有最具破坏性的变化都集中在一个极小的、低维度的子空间内。想象一个巨大的、多维的房间,图像变化的每一种可能方式都是一个不同的方向;研究人员发现,智能体的弱点并不是分布在整个房间里,而是实际上被限制在其中一条狭窄的走廊内。一旦他们确定了这条走廊,他们就不再尝试搜索整个房间,而是将攻击限制在仅在该狭窄路径内移动。

在他们方法的最后阶段,研究人员在实时环境中应用了这一发现。当智能体进行游戏时,攻击者计算出在该狭窄走廊内的最佳移动路径,然后将这些变化在时间上进行平滑处理。这种平滑处理至关重要。它确保了扰动不会在帧与帧之间产生抖动或闪烁,否则会变得非常明显且计算成本高昂。通过保持攻击的稳定并使其与智能体自身的内部逻辑保持一致,研究人员能够持续地误导智能体做出错误的决策。结果令人震惊。在行走任务中,智能体的性能下降了超过 26%,这比测试过的任何其他方法都要显著。在乒乓球游戏中,下降幅度更为剧烈,智能体的得分下降了近 86%。

或许最重要的一点是,研究人员证明了他们的方法不仅有效,而且高效且隐蔽。由于攻击被限制在少量的方向上,它所需的计算能力远低于以往试图为每一帧中的每一个像素计算变化的方案。视觉变化保持得如此微妙,以至于在人类观察者看来与原始视频几乎无法区分,然而它们却完全瓦解了智能体的功能。研究还排除了仅仅通过使攻击平滑或使用随机模式就足够成功的观点。当他们尝试使用随机方向而不是根据智能体自身计分员找到的方向进行攻击时,攻击几乎完全失败了。这证实了成功的关键不仅在于攻击的数学逻辑,更在于它针对受害者智能体的特定内部结构进行了定制。

这些发现表明,我们看待攻击智能系统的方式需要改变。对于依赖记忆和内部模型的智能体而言,最危险的漏洞不在于它们所看到的单个图像,而在于这些图像随时间被处理的具体方式。研究人员展示了,通过倾听智能体自身的内部信号,人们可以找到通往其失败的捷径。这并不意味着这些系统是破碎的,而是说,它们的优势——利用连续的内部状态进行决策——同时也创造了一个独特且狭窄的弱点。随着这些技术向现实世界部署迈进,理解这种“失败的几何学”对于构建能够保护它们免受此类针对性、智能化干扰的防御机制至关重要。这项工作清晰地提醒我们,在人工智能的世界里,最有效的攻击往往是那些比机器自身更了解机器思维的攻击。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →