← 最新论文
🤖 machine learning

Low Rank Adaptation for Adversarial Perturbation

本文证明了对抗扰动具有内在的低秩结构,并利用这一特性通过将扰动搜索限制在低维子空间来开发一种更高效、更有效的黑盒攻击方法。

原作者: Han Liu, Shanghao Shi, Yevgeniy Vorobeychik, Chongjie Zhang, Ning Zhang

发布于 2026-05-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Han Liu, Shanghao Shi, Yevgeniy Vorobeychik, Chongjie Zhang, Ning Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用通俗语言和日常类比对论文《对抗扰动的低秩适应》的解释。

核心理念:寻找“秘密捷径”

想象你正试图欺骗一位非常聪明的保安(AI 模型),让他放一个小偷(恶意输入)进入大楼。在 AI 领域,这被称为对抗攻击

通常,为了欺骗保安,你必须尝试成千上万种不同的伪装(扰动),直到找到一种有效的方法。这既缓慢又昂贵,而且经常导致你被抓获,因为你向保安问了太多问题。

这篇论文的作者发现了一个惊人的秘密:你不需要尝试每一种可能的伪装。

他们发现,欺骗这些 AI 模型所需的“把戏”实际上非常简单。它们存在于一个巨大而复杂的可能性世界中的微小、低维“捷径”里。这就像意识到要打开一个巨大的高科技金库,你不需要尝试十亿位密码锁上的每一个组合;你只需要拨动三个特定的弹子。

灵感来源:LoRA(“便利贴”方法)

这篇论文始于大型语言模型(LLM)中的一个概念,称为LoRA(低秩适应)。

  • 旧方法:过去,为了教会一个庞大的 AI 一项新技能,你需要重写它的整个大脑(所有权重)。这就像为了添加一个新事实而重写整部百科全书。这既耗时又昂贵。
  • LoRA 方法:研究人员意识到,你只需要在现有页面上贴几张“便利贴”(低秩矩阵)就能教会它新东西。这种方法便宜、快速且高效。

作者问道:“如果 AI 学习存在这些‘便利贴’捷径,那么用于破坏 AI 的把戏(对抗扰动)是否也存在捷径?”

发现:“低秩”结构

论文证明了是的,确实存在。

当攻击者试图愚弄 AI 时,他们对图像或文本所做的改变并非随机的混乱。它们高度有序,并集中在“数学空间”的一个非常小的区域内。

  • 类比:想象一片浩瀚的海洋(AI 的输入空间)。大多数人认为攻击者必须搅动整片海洋才能掀起波浪。但作者发现,你只需要搅动一个微小的、特定的水坑,就能掀起足以掀翻 AI 的巨浪。

他们通过数学证明了这一点,并在多种不同的 AI 模型(如识别鸟类、汽车或通用物体的模型)上通过数据展示了这一现象。

解决方案:“阴影地图”攻击

由于攻击者通常无法看到 AI 的内部大脑(这被称为黑盒设置),他们无法轻易找到这个需要搅动的“水坑”。他们通常必须盲目猜测,这需要数百万次尝试。

作者构建了一种新方法,无需看到大脑即可找到这条捷径:

  1. 阴影模型:攻击者使用一个不同的、公开可用的 AI 模型(“参考模型”)和一些随机图片(“辅助数据集”),这些甚至与目标模型不同。
  2. 翻译器:他们利用这个阴影模型来找出输入的哪些部分对做出决策最重要。他们使用“可解释 AI"工具(像手电筒一样显示哪些像素最重要)来过滤掉噪声。
  3. 压缩:他们训练一个特殊工具(自动编码器)来学习这些重要“把戏”的“形状”。这创建了一个低秩子空间——捷径的压缩地图。
  4. 攻击:攻击者不再在整个海洋中猜测,而只在这个微小的压缩地图内的水域中搅动。

结果:更快、更便宜、更强大

当他们用这种新方法测试标准攻击时:

  • 速度:速度大幅提升。在某些情况下,欺骗 AI 所需的“提问”(查询)次数减少了90%
  • 隐蔽性:这些把戏更加微妙,意味着 AI 被愚弄时产生的扭曲不那么明显。
  • 通用性:即使“阴影模型”和“随机图片”与目标 AI 完全不同(例如,使用人脸图片来欺骗识别鸟类的 AI),该方法依然有效。

为什么这很重要(根据论文所述)

这篇论文主要关注两点:

  1. 更好的攻击:它使研究人员能够以更少的资源和更快的速度测试 AI 系统的脆弱性。如果你能用更少的资源快速攻破一个系统,你就能更快地发现漏洞。
  2. 更好的防御:由于攻击如此高效,这表明当前的防御可能比我们想象的更弱。此外,理解攻击存在于一个“小空间”中,有助于构建专门封锁该小空间的防御措施,从而节省内存和计算能力。

简而言之:这篇论文发现,破坏 AI 比我们想象的要容易,因为系统中的“裂缝”既小又有序。通过找到通往这些裂缝的地图,攻击者可以以更少的时间和精力更快地攻破系统。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →