这篇论文介绍了一种名为 NERO-Net 的新方法,它的目标是让人工智能(AI)变得更“皮实”,不容易被坏人 trick(欺骗)。
为了让你更容易理解,我们可以把训练 AI 模型想象成培养一名超级特工,而这篇论文就是关于如何设计这位特工的“大脑结构”,让他天生就具备防骗能力。
1. 背景:AI 的“阿喀琉斯之踵”
现在的 AI(比如能识别猫和狗的图片识别系统)非常聪明,但它们有一个致命弱点:对抗样本。
- 比喻:想象你在街上看到一只猫,AI 也能认出是猫。但如果有人在猫的脸上贴了一张贴纸(人眼几乎看不出来),AI 就会突然大喊:“这是一辆坦克!”
- 这种贴纸就是“对抗攻击”。坏人利用这种弱点,可以让自动驾驶汽车把“停止”标志看成“限速 60",造成严重事故。
2. 现有的问题:只练“肌肉”,没练“内功”
以前,科学家想解决这个问题,主要靠对抗训练(Adversarial Training)。
- 比喻:这就像给特工安排了一个“陪练”,专门往他脸上贴各种奇怪的贴纸,逼着他去适应。练久了,特工确实能认出贴了贴纸的猫了。
- 缺点:这种方法只是让特工“练出来了”,而不是他的“大脑结构”本身变强了。一旦换个环境,或者遇到没练过的贴纸,他可能又傻了。而且,这种训练非常耗时耗力。
3. NERO-Net 的解决方案:进化出“天生防骗”的大脑
这篇论文提出了 NERO-Net,它不靠“陪练”,而是靠进化(Neuroevolution)。
- 核心思想:就像达尔文的进化论一样,NERO-Net 会生成成千上万个不同结构的 AI 模型(就像生出了成千上万个不同基因的孩子)。
- 筛选机制:它不只看谁认猫认得准(干净数据准确率),还要看谁没经过特殊训练就能认出贴了贴纸的猫(对抗鲁棒性)。
- 比喻:以前的筛选标准是“谁跑得快”,现在的标准是“谁在满是陷阱的路上还能跑得快”。那些天生结构好、不容易被骗的“孩子”会被留下来繁殖,那些结构有缺陷的会被淘汰。
4. 关键创新:如何“作弊”式地进化?
在进化过程中,如果每次都让 AI 去和强大的黑客(复杂的攻击算法)对打,计算量太大,进化就太慢了。
- 聪明的策略:NERO-Net 在进化阶段,只用一种比较简单的“黑客”(FGSM 攻击)来测试。
- 为什么有效:虽然这个“黑客”比较简单,但它能像试金石一样,把那些结构脆弱、一碰就碎的模型筛掉。
- 结果:最终选出来的那个“最强个体”,即使只用普通方法训练,它的“大脑结构”本身就非常坚固。
5. 实验结果:真的有用吗?
研究人员在 CIFAR-10(一个标准的图片识别数据集)上测试了这个方法:
- 进化阶段:选出的最佳模型,在没有经过特殊防骗训练的情况下,面对简单攻击时,准确率达到了 33%(普通模型可能接近 0%),而识别正常图片的准确率依然高达 87%。
- 进一步训练:如果把这个“天生强壮”的模型再拿去进行常规的防骗训练,它的表现更是突飞猛进,面对最复杂的攻击(AutoAttack),准确率达到了 40% 左右。
- 意外惊喜:这个模型是专门为了防“贴纸攻击”(L∞ 攻击)设计的,结果发现它对另一种类型的攻击(L2 攻击,比如模糊处理)也意外地很擅长。这说明它的“大脑结构”是全方位强壮的。
6. 总结与比喻
如果把设计 AI 模型比作盖房子:
- 传统方法:房子盖好后,发现不抗震,于是花钱去加固墙体、安装减震器(对抗训练)。
- NERO-Net:在盖房子之前,先设计几千种不同的图纸。通过模拟地震,发现某种特定的“梁柱结构”天生就特别抗震。于是,我们直接采用这种图纸盖房子。
- 结论:这种“天生抗震”的房子,不仅省去了后期加固的麻烦,而且底子更硬,面对各种灾害(不同类型的攻击)都更有抵抗力。
一句话总结:
NERO-Net 通过“自然选择”的方式,自动设计出了一种天生就难以被欺骗的 AI 大脑结构,让 AI 在面对恶意攻击时,不再需要依赖笨重的“事后补救”,而是从骨子里就变得更安全、更可靠。
NERO-Net:一种用于设计对抗鲁棒 CNN 的神经进化方法
1. 研究背景与问题 (Problem)
随着人工神经网络(ANN)的广泛应用,其对抗脆弱性(Adversarial Fragility)已成为安全关键场景中的主要障碍。对抗样本(Adversarial Examples)通过添加微小的扰动欺骗模型,导致分类错误。
- 现有挑战:
- 目前的防御手段主要依赖对抗训练(Adversarial Training),但这往往掩盖了架构本身对鲁棒性的贡献。
- 现有的神经进化(Neuroevolution, NE)或神经架构搜索(NAS)方法通常优先考虑预测性能,而忽视了鲁棒性。
- 许多研究使用基于单元(cell-based)的受限搜索空间,限制了新颖拓扑结构的涌现。
- 在进化过程中集成对抗训练会增加计算成本,且难以区分鲁棒性是源于架构设计还是训练策略。
- 核心问题:如何设计一种神经进化框架,能够在不进行对抗训练的情况下,自动发现具有内在鲁棒性(Intrinsic Robustness)的卷积神经网络(CNN)架构?
2. 方法论 (Methodology)
论文提出了 NERO-Net(NeuroEvolution of adversarially RObust artificial neural Networks),基于 Fast-DENSER 算法进行了改进。其核心在于将鲁棒性评估融入适应度函数,并避免在进化循环中使用对抗训练。
2.1 核心策略
- 非对抗性进化:候选模型在进化过程中仅使用标准训练(Standard Training)。
- 适应度函数设计 (Fβ):
- 采用加权调和鲁棒性分数(Weighted Harmonic Robustness Score),同时优化清洁准确率(Clean Accuracy, C)和对抗准确率(Adversarial Accuracy, A)。
- 公式:Fβ=(1+β2)⋅C+β2⋅AC×A。
- 参数 β 控制对清洁数据性能的保留权重(实验中设为 4)。
- 评估攻击:在进化搜索阶段,使用单步 FGSM 攻击作为鲁棒性的快速估计器,以平衡计算效率与区分度。
- 预热机制 (Warm-up):
- 进化初期仅优化清洁准确率,待种群平均适应度达到阈值 τ 后,再引入对抗鲁棒性约束,防止早期搜索陷入局部最优或退化。
- 异常检测:
- 剔除数值不稳定(Loss 爆炸)或“退化解”(如模型将所有样本预测为同一类以获得虚假高鲁棒性)的个体。
2.2 架构表示与变异 (Representation & Variation)
- 块状层编码 (Blocks of Layers):
- 引入
convblock 和 poolblock 非终结符,将卷积、激活函数、批归一化(BN)等操作组合成块,而非单独编码每一层。这更符合现代 CNN 的设计模式,并减少了搜索空间。
- 灵活的连接性 (Flexible Connectivity):
- 改进了层间连接机制,允许跳跃连接(Skip Connections)跳过中间层(例如层 3 直接连接层 1),不再强制连接前一层。这增加了拓扑结构的多样性。
- 参数类型扩展:
- 引入
int_power2 和 int_power10 类型,用于高效编码滤波器数量等参数,压缩搜索空间。
- 训练时间控制:
- 设置训练时间上限(30 分钟),防止计算成本无限增长,并引入“短路”机制处理达到上限的变异。
2.3 搜索空间
- 基于 CIFAR-10 数据集。
- 搜索空间设计参考了 NSGA-Net 的宏观结构,但更加灵活:包含 Stem(可选)、特征提取块(Macro-nodes 和 Transition-blocks)、可选的最后转换层、分类头(最多 5 个全连接层)以及学习策略优化器。
- 支持 L∞ 和 L2 范数的扰动评估。
3. 主要贡献 (Key Contributions)
- NERO-Net 框架:提出了一种专门的神经进化框架,通过协同优化清洁准确率和对抗准确率,设计具有内在鲁棒性的 CNN。
- 灵活的基因型表示:引入了可调整的计算块(Blocks)和更广泛的拓扑连接模式(如非连续跳跃连接),扩展了搜索空间,促进了新颖架构的涌现。
- 内在鲁棒性的验证:证明了进化算法可以在不使用对抗训练的情况下,发现对对抗攻击具有天然抵抗力的架构。
- 多威胁鲁棒性:展示了针对 L∞ 威胁模型优化的架构,在未经专门优化的情况下,也能对 L2 扰动表现出鲁棒性。
4. 实验结果 (Results)
4.1 进化搜索阶段 (CIFAR-10, L∞, ϵ=8/255)
- 最佳个体表现:
- 清洁准确率:87.49%
- FGSM 对抗准确率:33.25%
- 适应度:0.7983
- 该结果是在仅使用标准训练且未进行对抗防御的情况下获得的。
4.2 进一步训练与评估
为了挖掘架构潜力,对最佳个体进行了扩展的标准训练和对抗训练:
4.3 架构特征
- 最佳架构包含 13 个 Macro-nodes 和 7 个 Transition-blocks。
- 激活函数混合使用 ReLU 和 SiLU (Swish)。
- 充分利用了进化出的跳跃连接,部分 Macro-nodes 连接到了非相邻的过渡块之前。
5. 意义与结论 (Significance & Conclusion)
- 内在鲁棒性:NERO-Net 证明了通过神经进化可以直接发现具有内在抗攻击能力的架构,而不仅仅依赖对抗训练这一“补丁”。
- 架构设计的启示:研究揭示了特定的拓扑结构(如灵活的跳跃连接、块状设计)与鲁棒性之间的关联,为未来设计鲁棒网络提供了新视角。
- 多威胁适应性:针对 L∞ 优化的架构意外地展现了对 L2 扰动的鲁棒性,表明进化搜索可能捕捉到了更通用的防御特征。
- 局限与未来:
- 神经进化的计算成本仍然较高。
- 在对抗训练设置下,NERO-Net 的表现略逊于专门针对对抗训练优化的 NAS 模型(如 NSGA-Net),这可能是因为未针对大模型优化对抗训练超参数。
- 未来工作将探索零成本代理(Zero-cost proxies)以降低计算开销,并深入研究基因型微小变化对对抗鲁棒性的非线性影响。
总结:NERO-Net 为设计安全、鲁棒的深度学习模型提供了一条新路径,即通过进化算法自动搜索具有内在防御能力的架构,减少了对昂贵对抗训练过程的依赖。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。