← 最新论文
🤖 machine learning

Why Does Robustness Reduce Superposition?

本文通过实证解释了对抗训练如何通过迫使模型放弃非鲁棒特征,从而减少网络中需要表示的特征总数,进而降低叠加态。

原作者: Adam Elimadi

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Adam Elimadi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在人工智能领域,计算机模型通常被视为“黑盒”:我们输入数据,它们给出答案,但其内部运作机制却是一个谜。多年来,研究人员一直对这些系统中的一种奇怪漏洞感到困惑。即使是最准确的模型,也可能被“对抗样本”所欺骗——这些是图像或声音中微小的、几乎不可察觉的变化,会导致计算机产生完全错误的判断。例如,一张熊猫的照片可能通过仅改变几个像素,就在人类肉眼无法察觉的情况下,让计算机确信它看到的是一只长臂猿。科学家们早就知道,这些模型依赖数据中的某些模式来做出决策,但他们并不完全理解这些模式是如何存储在机器的“大脑”中的,也不明白为什么机器会如此轻易地被这些模式所迷惑。

最近的研究引入了“叠加”(superposition)这一概念来解释这个存储问题。将模型想象成一个拥有固定数量货架的房间。如果模型需要记住的东西超过了货架的数量,它就必须开始将物品堆叠在一起,或者将它们挤压在同一个空间里。这就是叠加:模型试图在有限的物理空间内存储更多的特征。另一项研究表明,当模型接受训练以抵御这些棘手的对抗样本时,它们的鲁棒性(稳健性)会增强,但它们似乎也停止了如此密集地打包信息。它们似乎停止了叠加。然而,没有人能解释这种变化背后的机制。为什么教导一个模型忽略微小的诡计,会导致它干脆停止记住某些东西呢?

独立研究员亚当·埃利马迪(Adam Elimadi)在一次关于人工智能可解释性的研讨会上展示的一项新研究,为这个问题提供了一个清晰的答案。该研究者旨在追踪当模型接受鲁棒性训练时发生的连锁反应。通过模拟大型现实世界系统行为的简化计算机模型,该研究表明,对抗性训练迫使模型放弃特定类型的信息。模型意识到,某些数据模式由于过于脆弱,在受到攻击时无法发挥作用。这些被称为“非鲁棒特征”的模式,就像是容易被噪音淹没的低语。当模型接受抗噪训练时,它意识到持有这些脆弱的低语是一种负担。因此,它完全丢弃了它们。因为模型不再需要存储这些被丢弃的特征,它需要打包进有限空间的东西也就减少了,叠加的需求自然也就消失了。

为了证明这一点,研究人员首先观察到,经过抗攻击训练的模型所代表的特征数量,始终少于在普通数据上训练的模型。在这些实验中,研究人员给了模型特定的“稀疏性”(sparsity),这是一个控制允许激活多少特征的设置。在广泛的这些设置下,鲁棒模型总是选择表示更少的特征。随后,研究转向了这些特征的几何结构——本质上是它们在模型内部空间中的位置。研究发现,鲁棒模型选择丢弃的特征,正是那些彼此之间干扰最大的特征。它们是那些一旦打包在一起就会产生混乱和错误的特征。在训练中幸存下来的模型只保留了那些能够整齐排列的特征,通常将它们排列在相反的方向以最小化冲突,同时丢弃了其余部分。

这项研究最关键的部分涉及一个合成数据集,研究人员在训练开始前就已经确切知道哪些特征是“鲁棒的”,哪些是“非鲁棒的”。在这个受控环境中,鲁棒特征是强大且稳定的信号,而非鲁棒特征则是微弱且易受干扰的。当模型接受抗攻击训练时,无论有多少可用空间,它每次都会丢弃完全相同的非鲁棒特征集。即使模型有足够的空间存储所有内容,对抗性训练也会让它相信,保留这些非鲁棒特征是危险的。该研究证实,叠加的减少并非随机的副作用,而是模型剔除那些使其容易受骗的特定脆弱特征的直接结果。

这一发现为理解人工智能中安全性与效率之间的关系提供了一种新途径。它表明,增强模型的鲁棒性不仅仅是增加防御措施,更是从根本上改变模型认为哪些信息值得记忆。通过迫使模型面对自身知识的脆弱性,对抗性训练简化了其内部结构。模型不再试图抓住每一个可能的模式,而是只专注于那些稳定且可靠的模式。虽然这些发现是在简化的“玩具模型”中建立的,但它们为这一此前仍是谜团的现象提供了清晰的机械论解释。研究人员的下一步工作将是观察这种丢弃脆弱特征并减少叠加的过程,是否也会发生在驱动现代技术的复杂现实世界模型中。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →