IDATA: Scalable Invertible Diffusion for Unrestricted Adversarial Transfer Attack
本文提出了 IDATA,这是一个内存高效且可扩展的可逆扩散框架,它结合了一个用于常数级内存反向传播的可逆扩散模块,以及一个用于增强针对深度视觉模型的非限制性对抗攻击的迁移性和视觉不可感知性的低频约束模块。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,数字世界是一座巨大且繁忙的城市,其中的计算机扮演着保安、交警和检票员的角色。这些“深度视觉模型”是那些能在机场识别你面孔的摄像头、驱动自动驾驶汽车的系统以及识别你宠物的应用程序背后的“大脑”。但就像任何安全系统一样,它们有一个致命的弱点:它们可以被欺骗。如果你给保安看一张贴了几张几乎看不见的微小贴纸的停止标志照片,保安可能会突然认为那是限速标志。这被称为“对抗性攻击”。
长期以来,黑客必须非常小心,只能在图像中添加极其微小的、符合数学规律的点来迷惑计算机。但最近,科学家们发现了一种更强大的方法,即利用“扩散模型”来欺骗这些保安。把扩散模型想象成一位神奇的艺术家,他能将一片模糊、嘈lej的静态噪声云变成一幅清晰、美丽的画作。黑客意识到,他们可以在艺术家绘画的过程中,偷偷在艺术家的速写本里塞进一点点“诡计”,这样最终生成的图像对我们来说看起来完全正常,却会让计算机的大脑短路。问题在于,这个魔术技巧非常笨重且笨拙。它需要大量的计算机内存,就像为了画一张画而试图把一座图书馆背在书包里一样。此外,这种做法有时会让诡计变得过于明显,留下奇怪的、带有噪点的痕迹,从而破坏了幻觉。
这正是新研究团队提出一个聪明解决方案——IDATA 的地方。他们希望让这个“魔术技巧”变得更轻量、更快,且更难被察觉。他们意识到,旧的方法绘制这些被欺骗的图像,就像是为了向后走一段路而不得不记住旅途中每一个细节一样。如果你走了50步,你就必须记住全部50步才能往回走。IDATA 改变了规则,让这段旅程变得“可逆”。想象一下你在迷宫中行走,你走的每一步都会留下一个完美的、可逆转的足迹。你可以向前走,放下秘密信息,然后完美地原路返回,而不需要记住整个路径——你只需要精准地回溯你的脚步即可。这使得计算机无论旅程多长,都只需要使用极少量的内存。
但这里存在第二个问题:旧的方法是“频率无关的”,这是一个高级说法,意思是指它们并不在意修改哪种类型的细节。它们既会干扰物体的宏观重要形状(比如停止标志的圆形轮廓),也会干扰微小的、颤动的细节(比如木纹的纹理)。研究人员发现,干扰这些微小的、颤动的细节往往会让图片看起来很怪异,并暴露诡计。因此,他们添加了一个特殊的过滤器,称为低频约束模块(LFCM)。把这想象成一位厨师,他决定只为炖菜中的主要食材调味,而不去动点缀用的配料。通过仅将他们的“诡计”添加到图像中稳定的、低频的部分(即宏观的形状和结构),并忽略颤动的、高频的噪声,他们创造出的攻击手段更难被察觉,并且能更好地迷惑不同类型的计算机大脑。
团队使用 IDATA 测试了许多不同的计算机模型,从简单的模型到看起来像人类大脑的复杂模型。他们发现 IDATA 取得了巨大的成功。它欺骗计算机的效果与之前的最佳方法不相上下,甚至更好,但它使用的计算机内存却只是前者的极小部分。在测试中,当其他方法需要高达 37.9 GB 的内存来运行时,IDATA 仅用 13.1 GB 就完成了任务。此外,它生成的图片极其难以被察觉;其视觉失真得分保持在 0.138 以下,这比他们测试的几乎所有其他方法都要低(即表现更好)。
研究人员还检查了即使在计算机穿着“盔甲”(旨在清理被欺骗图像的防御措施)时,这个诡计是否依然有效。IDATA 表现得依然强劲,证明它创造的诡计具有天然的鲁棒性。然而,论文指出,虽然这是一个非常有前景的工具,用于测试我们数字世界的安全性,但它并不是解决一切问题的“万灵药”。它是一个强大的新方法,用于压力测试我们的系统,帮助我们了解哪里存在裂缝,以便我们在坏人发现它们之前将其修复。作者总结道,通过使这些攻击具备可扩展性和高效性,IDATA 提供了一种有效的新途径,用于评估运行我们现代世界的深度视觉模型的安全性。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。