KAN-Robust-Bench: A Benchmark for Evaluating the Robustness of Kolmogorov-Arnold Networks
本文介绍了 KAN-Robust-Bench,这是一个用于评估 Kolmogorov-Arnold 网络针对强对抗攻击的认证鲁棒性与经验鲁棒性的基准测试,旨在确定最优的防御策略与架构。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在现代世界中,人工智能已成为日常生活中一个沉默的伙伴,为我们整理电子邮件、引导汽车行驶并诊断疾病。这些系统通过在海量数据中寻找模式来学习,就像孩子通过观察许多张猫的照片来识别猫一样。然而,这种学习过程存在一个隐藏的弱点。正如人类会被巧妙的错觉所欺骗一样,这些计算机模型也会被图像中微小到几乎不可见的改变所愚弄。研究人员可能会在了一张停止标志的图片上添加一些数字噪点——这些变化微小到人类肉眼根本无法察觉——而计算机可能会突然将其识别为限速标志。这种脆弱性被称为“规避攻击”(evasion attack),它对任何依赖人工智能做出安全决策的系统都构成了严重的安全性风险。
为了理解如何保护这些系统,科学家们一直在不断测试各种新型的“计算机大脑”。几十年来,标准设计一直是一种以层级处理信息特定类型的网络。最近,一种被称为柯尔莫哥洛夫-阿诺德网络(Kolmogorov-Arnold Network,简称 KAN)的不同设计作为一种有前景的替代方案出现了。旧的设计堆叠固定函数的层,而 KAN 使用灵活的、可学习的曲线,能够更自然地适应数据中的复杂形状。研究人员面临的一个重大问题是,这种更灵活的设计是否也更加脆弱。如果一个模型更擅长学习,它是否也更容易被欺骗?来自新不伦瑞克大学的一个研究小组决定通过让几种新的 KAN 设计接受一系列严格的压力测试来回答这个问题,将它们置于最强大的已知欺骗人工智能的方法面前进行对抗。
研究人员专注于三种特定版本的 KAN 架构,每种架构都旨在处理视觉任务,如识别照片中的物体。他们使用两组标准的图像集对这些模型进行了测试:一组包含常见的物体(如汽车和动物),另一组则包含路标上的数字。为了观察这些模型如何应对挑战,团队使它们遭受了三种不同类型的数字攻击。第一种类型是一种快速的一步式技巧,它将图像向模型最容易出错的方向进行微调。第二种类型是一种更具耐心的多步攻击,它通过反复优化技巧,直到找到迷惑模型的完美方式。第三种类型是一种高度复杂的优化攻击,它寻找导致失败所需的最小可能变化。
为了抵御这些技巧,团队尝试了三种不同的策略。第一种是通过向模型展示正常图片和带有陷阱的修改版本来进行训练,迫使计算机学会如何忽略噪声。第二种策略涉及在模型观察图像之前添加一层随机静电或噪声,从而有效地模糊了攻击者所依赖的锐利边缘。第三种方法涉及通过数学证明,即使图像在一定限度内被改变,模型的决策也不会发生变化,从而建立了一个保证稳定性的安全网。
结果清晰地描绘了这些新网络在压力下的表现。当模型没有任何特殊保护时,它们表现得异常脆弱。即使是最先进的 KAN 设计也会被最简单的攻击所愚弄,随着噪声的增加,其准确率大幅下降。然而,当研究人员应用通过陷阱图像进行训练的策略时,结果发生了彻底的变化。这种被称为“对抗训练”(adversarial training)的方法被证明是最强大的盾牌。经过此类训练的模型即使面对最强大的多步攻击也能保持高准确率。例如,在路标数据集上,经过这种训练的模型即使在攻击达到最大强度时,仍能保持 67% 以上的准确率,而未经训练的版本则会崩塌至接近零。
另外两种防御策略提供了不同种类的保护。添加随机噪声的方法虽然不像训练法那样能有效阻止模型被愚弄,但它提供了一种不同类型的安全性。它提供了一个数学保证,即如果图像在特定微小范围内发生改变,模型的答案不会改变。这很有价值,因为它提供了一个已知的安全边界,尽管该方法在面对最强攻击时的整体性能可能不如训练后的模型。第三种利用数学边界来检查稳定性的策略也提高了模型的韧性,但通常在保护力度上不及直接使用攻击进行训练的方法。
其中一个最有趣的发现是,模型的内部结构选择与防御策略同样重要。在测试的三种不同 KAN 设计中,一种特定的架构始终优于其他架构。这种特定的设计通过结合不同的图像特征混合方式,在所有测试中都表现出了最强的鲁棒性。它能更好地抵御快速技巧、耐心的多步攻击以及复杂的优化攻击。这表明,仅仅转向一种新型网络是不够的;网络的具体构建方式决定了它能承受多大程度的攻击。
研究还表明,任务的难度改变了结果。模型在路标数据集上的表现明显优于在常见物体数据集上的表现。在路标数据集上,即使是未经训练的模型在抵御攻击方面也表现得相当出色,而受保护的模型准确率达到了 90% 以上。这表明某些类型的视觉数据对于这些系统来说,在安全性处理方面天生比其他类型更容易。
最终,研究表明,虽然这些新的柯尔莫哥洛夫-阿诺德网络是强大的工具,但它们并非对欺骗免疫。保护它们最可靠的方法是在学习阶段教它们什么是攻击。虽然其他方法可以提供数学上的安全性保证,但它们并不总是能转化为面对最强技巧时同等的现实世界性能。这项工作为开发者提供了一条清晰的路线图:如果他们希望这些灵活的新型网络是安全的,就必须将防御直接构建到训练过程中,确保模型学会看穿噪声,而不仅仅是忽略噪声。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。