← 最新论文
💻 computer science

A Survey of Adversarial Efficiency Degradation for Vision Transformer by Exploiting Input-adaptive Optimization

本文综述了针对视觉 Transformer 的对抗性效率退化攻击,这类攻击利用了诸如 Token 修剪和早期停止等输入自适应机制,旨在不显著损害准确性的情况下增加计算成本,同时分析了特定的攻击方法、易受攻击的框架以及潜在的轻量级防御措施。

原作者: Anadi Goyal, Nandish Chattopadhyay, Anupam Chattopadhyay, Chandan Karfa

发布于 2026-08-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Anadi Goyal, Nandish Chattopadhyay, Anupam Chattopadhyay, Chandan Karfa

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个这样的世界:你智能手机的大脑——那个帮助你识别面部或导航地图的人工智能——是一位动作极快但胃口巨大的厨师。这位厨师并不总是用完全相同的方式烹饪每一道菜;它足够聪明,会先观察食材。如果你递给它一个简单的、普通的三明治,它可能会跳过繁琐的切剁步骤,直接快速上菜以节省能量。但如果你递给它一份复杂的、多层叠放的千层肉酱面,它就知道要拿出所有的刀具并投入更多时间去烹饪。这个“聪明厨师”就是一个视觉 Transformer(ViT),一种通过观察图像来工作的 AI 类型。为了让这些厨师更快、更不那么“耗电”,工程师们发明了一种叫做“Token 修剪”(token pruning)的小技巧。把图像想象成由成千上万块微小瓷砖(token)组成的马赛克。修剪系统会决定哪些瓷砖是无聊且不重要的,然后把它们扔掉,只用那些有趣的瓷砖来烹饪。这就像一位图书管理员,通过阅读书的第一页来决定剩下的内容是否值得读下去。

然而,就像任何智能系统一样,这种效率技巧也有一个秘密弱点。如果有人能欺骗图书管理员,让它把一本无聊的书误认为是一部扣人心弦的悬疑小说呢?或者,如果有人能在平淡的三明治上贴上一张微小的、肉眼看不见的贴纸,让厨师误以为它是一顿复杂的盛宴呢?这就是“对抗性攻击”(adversarial attacks)的游乐场。通常,黑客试图误导 AI 把猫看成狗。但在这一特定的科学领域,出现了一种新型的捣蛋鬼。他们并不试图改变 AI “看到什么”,而是试图破坏 AI 的“工作方式”,迫使它在简单的任务上浪费所有的精力和时间。这就像一个恶作剧者,他没有改变菜单,却说服厨师为了区区一片吐司就动用整个厨房。


论文使命:寻找“能量恶作剧者”

这篇题为《通过利用输入自适应优化实现视觉 Transformer 的对抗性效率退化》(Adversarial Efficiency Degradation for Vision Transformer by Exploiting Input-adaptive Optimization)的论文是一篇综述——一份有组织的、大型的报告——它调查了这些新型“能量恶作剧者”。作者们是一群来自印度和新加坡的研究人员,他们想要了解黑客是如何利用“聪明厨师”的技巧(如 Token 修剪)来让 AI 模型比实际需要的工作量做得更多,从而在不改变最终答案的情况下,耗尽电池并减慢速度。

两种主要的恶作剧者

论文重点研究了两种特定的攻击方式,并将它们进行对比,就像两种不同类型的恶作剧:

  1. “通用贴纸”(SlowFormer): 想象一张微小的、特定的贴纸,你可以把它贴在世界上任何一张照片上。无论照片里是猫、汽车还是日落,只要你在角落贴上这个补丁,AI 的“智能修剪”系统就会感到困惑。它会突然想:“噢不,这看起来超级复杂!我最好保留所有的瓷砖,进行完整的、沉重的计算!”论文解释说,这种贴纸是一种“通用对抗性补丁”。它只需训练一次,就可以应用于所有图像。它就像一把万能钥匙,卡住了建筑里每一个门的智能开关。
  2. “个性化噪声”(DeSparsify): 这是另一种不同类型的诡计。它不是通过贴纸,而是为每张特定的图像添加一点点肉眼看不见的静态噪声。这就像是为每一份订单向厨师低声诉说一个秘密:“嘿,这个三明治其实需要额外的切剁!”论文指出,这种方法非常精准,是针对每张图像量身定制的,目的是迫使 AI 保留比它应该保留的更多的 Token。

结果:破坏有多严重?

研究人员在三个流行的“智能修剪”系统(称为 A-ViT、ATS 和 AdaViT)上使用标准图像数据集进行了测试。以下是他们发现的结果,数值完全按照论文报告:

  • “贴纸”攻击 (SlowFormer): 当他们把这种通用补丁贴在图像上时,AI 的效率受到了巨大打击。例如,在 A-ViT 系统上,所需的计算能力(以 GFLOPs 衡量)从低至 3.70(当没有攻击发生时)一路飙升到了 4.60。这正是 AI 在完全不进行“智能处理”时所使用的能量水平!这种攻击非常成功,在 A-ViT 上实现了 100% 的“攻击成功率”,这意味着它完全击败了效率技巧。然而,有一个代价:AI 的准确率大幅下降(下降了 76.5%),这意味着 AI 对它正在观察的东西感到非常困惑。
  • “噪声”攻击 (DeSparsify): 这种方法更加隐蔽。它同样将 A-ViT 上的功率推高到了 4.60 GFLOPs,但它隐藏得更好。准确率仅下降了 0.1%。AI 仍然知道它在看一只猫,但它在识别的同时正消耗着大量的电池。在 ATS 系统上,这种攻击将功率提升到了 4.20 GFLOPs,攻击成功率为 73.3%

论文指出,虽然“贴纸”攻击威力强大,但“噪声”攻击在现实生活中往往更危险,因为它不会破坏 AI 的识别能力,从而使其更难被察觉。

反击手段:我们能阻止它们吗?

作者还研究了如何防御这些恶作剧。他们发现目前还没有完美的盾牌,但有一些很有前景的想法:

  • 教导 AI 预料麻烦(对抗性训练): 对于“贴纸”攻击,论文建议使用包含这些坏贴纸的集合来训练 AI。这就像是在安全房间里模拟风暴来练习应对风暴。当我们这样做时,贴纸对 A-ViT 的攻击成功率从 100% 下降到了 34%。AI 变得更加强韧,尽管它并未变得无懈可击。
  • “置信度检查”(基于置信度的防御): 对于“噪声”攻击,研究人员提出了一个规则,即让 AI 检查自身的置信度。如果它认为某个决策很犹豫,它会强制自己保留更多 Token,但如果它非常有信心,它就会按原计划执行。这效果出奇地好。在 ATS 系统上,这种防御将攻击成功率从 73.5% 降低到了仅为 5.3%

局限性与未来

论文谨慎地指出,这些防御措施并非万能灵药。作者指出,虽然这些方法减少了损失,但并不能完全恢复原始的速度和电池寿命。作者还强调了当前攻击中的几个重大弱点:

  1. 它们需要内部知识: 大多数此类恶作剧只有在黑客确切了解“智能修剪”系统是如何构建的情况下才能奏效。如果系统是一个“黑盒”(隐藏视图),攻击可能会失败。
  2. 它们缺乏迁移性: 为一种类型的修剪系统(如 ATS)设计的恶作剧通常无法作用于另一种(如 A-ViT)。
  3. 它们只针对“智能”系统有效: 这些攻击对于那些无论图像是什么都执行相同工作量的旧式“笨拙” AI 系统是无效的。

总之,这篇论文描绘了一个新的安全风险前沿。它表明,当我们通过允许 AI 跳过步骤来使其变得更聪明、更高效时,我们也无意中给了黑客一种新的方法,让他们可以诱使 AI 徒劳地原地打转。作者建议,虽然我们可以建立更好的围栏(防御措施),但我们需要持续研究这些“能量恶作剧者”,以确保我们未来的 AI 既聪明又安全。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →