Tangent Subspace Boundary Attack: A Query-Efficient Decision-Based Black-BoxAdversarial Attack
本文提出了切向子空间边界攻击(Tangent Subspace Boundary Attack, TSBA),这是一种查询高效的基于决策的黑盒对抗攻击方法,通过将扰动更新限制在决策边界的低维切向子空间内,该方法改进了现有方法,旨在稳定搜索过程并显著降低查询复杂度,同时保持具有竞争力的失真水平。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图在安全摄像头的镜头上贴一个微小的、隐形的贴纸,让它把“停止”标志误认为“限速”标志。你看不见摄像头的内部代码(它是一个“黑盒”),你也无法向它询问任何提示,比如“你离目标更近了”。你只能提问:“你认为这是什么?”然后等待一个简单的“是”或“否”。
这就是黑客试图欺骗人工智能时的噩梦场景。你正在阅读的论文 《切空间边界攻击》(Tangent Subspace Boundary Attack, TSBA) 解决了这个问题,它提出:“不要在黑暗中随机瞎猜。让我们利用几何学,沿着边缘行走。”
问题所在:盲人徒步者
想象你是一名徒步旅行者,正站在悬崖边(即人工智能改变判断的“决策边界”)。你想迈出尽可能小的一步,跌入“错误答案”的区域,但你看不见地面。
- 旧方法(边界攻击/Boundary Attack): 你在原地转圈,挥舞着手臂乱撞,并随机迈步。如果你掉下去了,你就爬回来重新尝试;如果你留在边缘,你就再试一次随机迈步。这太累人了。为了找到那个完美的跌落点,你需要进行成千上万次尝试(查询)。
- “聪明”的旧方法(HopSkipJumpAttack/HSJA): 你尝试通过走几步小路并观察是否会掉下去,来猜测哪边是下坡。这虽然好一些,但你仍然需要大量猜测,而且有时会猜错,导致浪费时间爬回来。
作者认为这些方法效率低下,因为它们忽略了你站立处悬崖的形状。它们把边缘视为一个锯齿状、混乱的废墟,而实际上,如果你仔细观察,它是平滑且可预测的。
解决方案:切空间边界攻击 (TSBA)
作者提出了一种新策略,将悬崖边缘视为一张平滑且平坦的桌子。以下是他们如何实现这一点的,使用了三个聪明的技巧:
1. 二分搜索(“精准定位”技巧)
与其在周围徘徊寻找边缘,TSBA 使用了“二分搜索”。想象你和你与悬崖边缘之间拿着一根长杆。你让长杆来回滑动,每次将距离减半,直到你恰好位于人工智能改变判断的那条线上。这无需浪费步骤即可瞬间找到边缘。
2. 切空间(“横向行走”技巧)
一旦你到达边缘,旧方法可能会不小心向前或向后迈步,从而远离你的目标。TSBA 说:“不。我们只横着走。”
他们强制要求每一步都必须与你来的方向正交(即成完美的 90 度角)。想象你在走钢丝。你不能向地面或天空迈步;你只能沿着绳索移动。这确保了你迈出的每一步都在让你接近那个完美的、微小的贴纸,而不会让贴纸变得更大或更杂乱。
3. 低维子空间(“狭窄走廊”技巧)
世界是巨大的(高维的),到处乱找很慢。TSBA 构建了一个狭窄的走廊(低维子空间),并且只在这个走廊内寻找步骤。这就像是在一个房间里寻找丢失的钥匙,而不是在整个城市里搜寻。这使得搜索过程极其迅速。
结果:更快、更小、更强
作者在 ImageNet 上测试了该方法,这是一个拥有超过一百万张照片、包含 1,000 个不同类别的庞大数据库。他们使用了一个标准的模型,叫做 ResNet-50。
以下是 TSBA 与旧冠军们的对比结果:
速度测试: 当黑客被允许向人工智能提问 500 次(查询)时:
- 旧的 边界攻击 (Boundary Attack) 仅在 28% 的情况下成功。
- HopSkipJumpAttack (HSJA) 成功率为 38%。
- TSBA 成功率为 46%。
- 更棒的是: 为了实现成功的攻击,TSBA 仅需要中位数 150 次提问,而 HSJA 需要 210 次,边界攻击则需要 340 次。
“隐形性”测试: 目标是让贴纸尽可能小,以便人类无法察觉。TSBA 创造的改变(较低的 失真)始终比其他方法更小、更不易被察觉。事实上,当他们尝试欺骗一个经过专门训练以对抗攻击的“超安全”人工智能(PGD 鲁棒模型)时,TSBA 仍能以低失真实现 70% 的成功率,而其他方法很难超过 55%。
他们排除了什么
论文非常明确地指出了在这一特定设置下哪些方法不起作用。他们反驳了这样一种观点,即你需要通过进行多次随机采样来估算“梯度”(山坡的斜率)。他们证明这种方法会产生过多的“噪声”并浪费查询次数。他们也排除了需要探索整个庞大 3D 图像空间的想法;他们指出,将搜索限制在一个更小、更聪明的空间切片中反而更好。
他们有多确定?
作者非常有信心,但他们坚持基于事实。他们不仅仅是猜测;他们在真实数据上进行了广泛的实验。
- 他们在来自 10 个不同类别的 100 张图像上测量了结果。
- 他们在特定的限制下运行了测试:500、1,000 和 1,500 次查询。
- 他们证明了,如果移除他们的任何一个技巧(二分搜索、横向行走或狭窄走廊),攻击效果都会变差。例如,如果移除“横向行走”规则,成功率会从 71% 下降到 65%,而所需的查询次数会从 1,800 跳升至 2,200。
底线
论文表明,欺骗人工智能的秘诀不在于仅仅向靶板投掷更多的飞镖,而在于理解目标的几何结构。通过严格沿着人工智能决策线的边缘行走,并保持在一个狭窄且高效的路径内,TSBA 能够以比以往更少的提问次数和更小、更隐形的改变来欺骗人工智能。
这就像是通过了解保安脚落下的确切位置,然后精准地迈出一步,而不是在建筑周围乱跑,从而找到绊倒保安的最佳时机。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。