← 最新论文
💻 computer science

STRAP-ViT: Segregated Tokens with Randomized -- Transformations for Defense against Adversarial Patches in ViTs

本文提出了一种名为 STRAP-ViT 的即插即用防御机制,通过利用 Jensen-Shannon 散度识别并隔离异常 Token,随后对其应用随机复合变换,从而在不增加训练成本的前提下有效抵御针对 Vision Transformer 的物理对抗补丁攻击,使其在多种攻击下仍能保持接近原始基线的鲁棒准确率。

原作者: Nandish Chattopadhyay, Anadi Goyal, Chandan Karfa, Anupam Chattopadhyay

发布于 2026-03-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Nandish Chattopadhyay, Anadi Goyal, Chandan Karfa, Anupam Chattopadhyay

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一种名为 STRAP-ViT 的新技术,它的任务是给现在的“超级大脑”(视觉 Transformer,简称 ViT)穿上一件隐形的防弹衣,防止被一种叫“对抗补丁”的恶作剧骗过。

为了让你轻松理解,我们可以把整个过程想象成一个高智商的保安(ViT)在检查一个巨大的拼图(图片)

1. 什么是“对抗补丁”?(恶作剧贴纸)

想象一下,你正在看一张猴子的照片,保安(AI)一眼就能认出:“这是一只猴子!”

但是,坏人可以在照片上贴一张小小的、看起来像乱码的贴纸(这就是“对抗补丁”)。

  • 普通人的反应:这贴纸很小,不影响我看猴子。
  • AI 的反应:这个贴纸非常狡猾。它利用了 AI 的弱点,像磁铁一样把 AI 的注意力全部吸走了。AI 突然变得非常自信地大喊:“这不是猴子!这是一个散热器!”

这种攻击在现实生活中很可怕,比如贴在汽车上的贴纸能让自动驾驶汽车把“停车标志”看成“限速 45",或者让监控摄像头把“持枪的人”识别成“拿着玩具”。

2. STRAP-ViT 是怎么工作的?(两个步骤)

STRAP-ViT 不需要重新训练 AI,它就像是一个即插即用的智能插件,在 AI 做决定的最后一刻介入。它的工作分为两步:

第一步:侦探模式(检测异常)

比喻:闻气味

当 AI 把图片切成很多小块(称为“令牌”或 Tokens)来分析时,正常的图片块闻起来是“自然”的。但是,那个恶作剧贴纸覆盖的块,闻起来味道很怪(统计学上叫“分布不同”)。

  • STRAP-ViT 的做法:它拿着一个精密的“气味检测仪”(数学上叫Jensen-Shannon 散度),去闻每一个图片块。
  • 发现:它发现有几个块的味道和正常的背景格格不入,就像在一群穿西装的人里混进了一个穿荧光绿小丑服的人。
  • 行动:它立刻标记出这几个“可疑分子”(也就是被贴纸覆盖的区域)。

第二步:魔法模式(消除威胁)

比喻:给可疑分子“换装”或“打乱”

一旦找到了那几个被贴纸污染的块,STRAP-ViT 不会直接把它们删掉(删了图片就缺角了),而是给它们施一点“魔法”。

  • 随机变换:它会对这些可疑的块进行随机的“整容手术”。比如:
    • 把它们的内容稍微压扁一点(仿射变换)。
    • 把它们的光谱能量限制住(Lp 投影)。
    • 或者给它们加一点“模糊滤镜”(温度缩放)。
  • 关键点:这个手术是随机的。就像坏人不知道保安今天会用什么方式打乱他的伪装,所以坏人很难提前准备好一种能同时抵抗所有打乱方式的贴纸。
  • 结果:贴纸的“魔力”被打破了,AI 的注意力重新回到了真正的猴子身上,而不是那个贴纸。

3. 为什么这个方法很厉害?

  • 不伤及无辜:它只处理那几个被污染的“坏块”,图片里 99% 的正常部分完全不受影响。所以,如果没有贴纸,AI 的准确率几乎不会下降。
  • 通用性强:不管 AI 是哪种型号(ViT 的各种版本),也不管贴纸是什么图案,这套方法都能用。
  • 不需要重新上学:它不需要让 AI 重新学习(训练),直接装在现有的 AI 系统里就能用,就像给手机装个杀毒软件一样简单。
  • 速度快:计算量很小,不会让 AI 变慢。

4. 实验结果:真的有效吗?

作者拿这个系统去测试了很多种恶作剧贴纸(有的大,有的小,有的甚至一张图贴好几个)。

  • 没有防御时:AI 看到贴纸就彻底晕了,准确率跌到接近 0%(比如从 80% 跌到 3%)。
  • 用了 STRAP-ViT 后:AI 的准确率瞬间回升到 78%-79%,几乎和没贴纸时一样!这比目前市面上其他最好的防御方法都要强。

总结

STRAP-ViT 就像是一个拥有火眼金睛的保安
当坏人试图用一张“魔法贴纸”迷惑 AI 时,保安能立刻闻出哪块拼图味道不对,然后随机给那块拼图“换个发型”或“换个衣服”,让贴纸的魔法失效。这样,AI 就能继续正确地认出那是“猴子”,而不是“散热器”了。

这项技术让未来的 AI 系统(比如自动驾驶、人脸识别)在面对这种物理世界的恶作剧攻击时,变得更加安全和可靠。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →