← 最新论文
💻 computer science

Towards Universal Physical Adversarial Attacks via a Joint Multi-Objective and Multi-Model Optimization Framework

本文提出了联合多目标与多模型优化框架(JMOF),该框架采用正交梯度对齐与双层抑制机制以解决梯度冲突并增强跨模型可迁移性,从而实现能够有效地欺骗多种黑盒视觉任务的通用物理对抗攻击。

原作者: Ziyang Liu, Hongyuan Wang, Zijian Wang, Yinxi Lu, Yunzhao Zang, Zhiqiang Yan, Qianhao Ning

发布于 2026-05-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Ziyang Liu, Hongyuan Wang, Zijian Wang, Yinxi Lu, Yunzhao Zang, Zhiqiang Yan, Qianhao Ning

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用简单语言和创意类比对这篇论文的解读。

宏观图景:“通用伪装”问题

想象你正试图给一辆汽车涂上一种特殊的“隐形斗篷”图案。目标是欺骗安全摄像头(AI),让它认为这辆车不存在,或者把它误认为是完全不同的东西。

作者们要解决的问题是:当今大多数“隐形斗篷”就像量身定制的西装。它们能完美适配某一款特定的摄像头模型(比如 YOLO 检测器),但如果你把同一辆车展示给另一个品牌的摄像头(比如 Swin-T 或 ViT),这套西装就会显得荒谬可笑,摄像头也会一眼看穿。

此外,试图设计一套能同时适配所有摄像头的西装,就像试图设计一件既是冬装、又是泳衣、还是燕尾服的夹克。如果你只是把它们胡乱拼凑在一起,最终得到的只会是一件闷热、不适且对任何用途都无效的糟糕作品。这被称为梯度冲突——冬装的指令与泳衣的指令相互对抗,导致结果失败。

本文介绍了一个名为JMOF(联合多目标与多模型优化框架)的新框架,旨在创造一种几乎能对抗任何摄像头的“通用伪装”,甚至能欺骗那些执行不同任务(如计数车辆与绘制道路)的摄像头。


他们解决的三个主要问题

作者们确定了以往尝试失败的三个具体原因:

  1. “一刀切”陷阱:

    • 问题: 以往的方法只挑选一个“教师”AI 进行学习。这种伪装变得过于痴迷于该特定教师观察事物的独特方式。
    • 解决: 他们建立了一个多元化教师委员会。与其向一位专家请教,不如向一群思维截然不同的专家(有的像短跑运动员,有的像深思熟虑者)组成的委员会请教。他们使用一种数学技巧,确保挑选出的教师彼此不会过于一致,从而使伪装学会让所有人(而不仅仅是某一个人)都感到棘手。
  2. “表象与灵魂”的冲突:

    • 问题: 一些攻击试图干扰最终答案(“表象”),而另一些则试图干扰 AI 在大脑中理解图像的方式(“灵魂”)。仅做其中一项通常都会失败。
    • 解决: 他们创造了一种双管齐下的攻击
      • 第一管(表象): 他们告诉 AI:“停止说‘汽车’!”(抑制最终输出)。
      • 第二管(灵魂): 他们告诉 AI:“停止在你的大脑中识别汽车的形状!”(扁平化内部特征)。
      • 通过同时执行这两项操作,攻击变得强大且难以逃脱。
  3. “拔河”(梯度冲突):

    • 问题: 当你向教师委员会寻求建议时,他们往往朝相反的方向拉扯。教师 A 说:“把这里涂成红色!”教师 B 说:“不,把那里涂成蓝色!”如果你只是平均他们的建议,你会得到一种浑浊的灰色,让谁都不满意。
    • 解决: 他们发明了一位名为OGA(正交梯度对齐)交通警
      • 与其强迫教师达成一致或忽略那些持反对意见的人,这位交通警会调整他们冲突的方向,使它们协同工作。
      • 想象两个人朝相反方向拉绳子。交通警不会阻止他们,而是告诉他们以 90 度角拉绳,这样他们的合力就能高效地将绳子向前移动。这将对抗的能量转化为了团队合作的能量。

在现实世界中如何运作(“物理”部分)

让数字图像看起来隐形很容易。让一辆真实的 3D 汽车看起来隐形则很难,因为涉及光照、阴影以及汽车会移动的事实。

  • 模拟器: 他们使用游戏引擎(CARLA)来模拟在雨天、晴天和夜间驾驶。这有助于伪装学会从各个角度看起来都很完美,而不仅仅是在一张完美的照片中。
  • “丢弃”技巧: 为了确保伪装不依赖于某个幸运的点(如前保险杠),他们在训练过程中随机“擦除”了汽车的部分区域。这迫使 AI 学会隐藏整辆汽车,而不仅仅是某个特定的补丁。
  • 平滑规则: 现实世界的摄像头讨厌“噪点”或颗粒状的干扰。作者们添加了一条规则,使伪装图案平滑且连续,就像真实的喷漆一样,这样当汽车移动时,它看起来就不会像数字噪点。

“超能力”:欺骗不同类型的摄像头

这篇论文最引人注目的部分是,他们的伪装不仅能愚弄“车辆计数器”。它还能愚弄:

  • 地图绘制者: 试图绘制道路和人行道的 AI(语义分割)。
  • 距离测量仪: 试图猜测汽车距离有多远的 AI(深度估计)。

通常,旨在让“车辆计数器”看不见汽车的攻击,会让“距离测量仪”认为汽车漂浮在空中。但由于他们的OGA 交通警非常擅长平衡相互冲突的指令,这种伪装成功地同时欺骗了两个系统。它让汽车对计数器隐形,并让距离测量仪认为汽车是背景的一部分。

总结

将这篇论文想象成通用变色龙的发明。

  • 旧变色龙只能改变颜色以匹配某一片特定的叶子。
  • 这只新变色龙审视着一整片由不同叶子(不同的 AI 模型)组成的森林。
  • 它倾听所有叶子的声音,利用一位聪明的裁判阻止它们互相争斗,并绘制出一种图案,使它在森林中对所有人都隐形,无论他们是在寻找叶子、虫子,还是在测量森林的大小。

其结果是一种更难被检测到的物理伪装,适用于多种不同类型的 AI,甚至能对抗执行完全不同任务的 AI。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →