想象一下你正在教一个机器人识别猫。你给它看一张照片,它说:“猫!”但它是怎么知道的呢?它是在看毛茸茸的耳朵,还是仅仅因为角落里有一个红色的项圈而在瞎猜?在人工智能的世界里,这被称为归因(attribution):即弄清楚图像中的哪些部分真正说服了计算机做出其判断。通常,我们只是检查机器人是否判断正确。但如果机器人是因为错误的原因而判断正确了呢?如果你把照片倒过来,一个聪明的机器人仍然应该能在脸部的相对位置看到猫的耳朵。如果机器人突然开始盯着背景看,那它就是不可靠的。这篇论文解决了一个大问题:我们如何教这些人工智能模型停止瞎猜,并开始关注那些真正的线索,即使在图片被扭曲、翻转或旋转的情况下也是如此?
这项研究背后的研究人员注意到,目前许多检查人工智能“推理”的方法有点像在使用一张模糊的地图。它们试图让人工智能保持一致性,但它们往往检查的是错误的对象。他们发现,如果人工智能最初看的并不是正确的证据,那么仅仅告诉它“看同一个地方”是行不通的。为了解决这个问题,他们发明了一种新的训练技巧。他们没有仅仅猜测人工智能应该看哪里,而是让人工智能玩一个与自己进行的“找不同”游戏。他们教模型寻找一组微小且完美的线索来证明这是一只猫,然后强迫它即使在图片翻转后也能找到这些完全相同的线索。
这就是他们发现的魔力:通过强迫人工智能坚持使用这些可靠的线索,该模型不仅变得更擅长解释自己,而且在处理棘手情况下的识别能力也变得更聪明了。在一项名为 ImageNet-100 的大规模图像测试集中,他们的方法让人工智能的“推理”变得更加稳定,得分从 0.14 跳升至 0.27。它还使人工智能的解释在证明猫存在方面的表现提升了 52.1%,并将从脑海中“删除”猫的情况减少了 62.2%。最棒的部分是?人工智能并没有丧失其通用的智能;它的准确率仅下降了微乎其微的 0.28 个百分点。他们证明了,当你教机器人去信任正确的证据时,它会成为一个更加可靠的朋友,即使世界变得有些摇晃不稳。
技术摘要:一致性证据,鲁棒识别
问题陈述
归因方法被广泛用于识别深度神经网络预测背后的输入证据。然而,这些方法在主动改善模型行为方面的潜力仍未得到充分探索。一个关键问题是,在保持标签不变的几何变换(如翻转或旋转)下,存在归因不一致性的现象。虽然预测类别可能保持不变,但模型往往会将依赖从原始对象证据转移到不同或无关的区域。这表明模型对几何变换具有敏感性,从而削弱了鲁棒性。
现有的归因正则化方法通常依赖于源自梯度图(如 Grad-CAM)的自监督一致性目标。这类方法的一个根本局限在于忠实度(faithfulness):基于梯度的热力图并不总能准确反映驱动模型决策的证据。因此,对齐这些图只能确保“解释输出”的一致性,却不能保证底层“决策过程”的一致性。模型可能实现了解释层面的一致性,但仍然依赖于对变换敏感的证据。本研究旨在解决的核心挑战是:如何将忠实的、与决策挂钩的归因转化为有效的训练信号,从而在无需人工标注的情况下,实现一致的证据依赖。
方法论
作者提出了一种基于图像区域**次模搜索(submodular search)**的无标注归因正则化框架。该方法分为两个阶段运行:
查询阶段(生成监督信号):
该框架并未采用基于梯度的热力图,而是利用基于搜索的归因方法(具体为 LIMA)来提取紧凑且具有类判别性的证据。该过程通过贪婪地选择图像区域,使结合了一致性、置信度和协作性指标的次模得分函数最大化。当达到一致性阈值时,搜索终止。
- 过滤: 仅保留分类正确、具有高置信度且产生紧凑归因区域的样本。这确保了监督信号源自可靠的模型行为。
- 监督序列: 对于保留的样本,所选区域的有序序列以及停止条件构成了“搜索衍生监督”。
训练阶段(次模排序损失):
为了正则化模型,该框架将变换后图像的归因搜索轨迹与原始图像的空间对应轨迹进行对齐。由于搜索过程是离散且连续的,因此需要一个可微的代理函数。作者引入了由两部分组成的次模排序损失(Submodular Ranking Loss):
- 选择-排序损失 (LSelR):在对变换图像进行贪婪搜索的每一步中,该项强制要求空间对应的目标区域(来自原始序列)在所有剩余非目标候选区域中排名更高。
- 选择-截断损失 (LSelT):该项鼓励变换轨迹的累积证据在目标终止步骤时,满足与原始查询序列相同的停止准则。
总目标函数结合了标准的分类损失与次模排序损失,并由超参数 λ 进行加权。该框架通过约束搜索空间和稀疏正则化等优化手段来实现,以管理计算开销。
核心贡献
- 忠实归因的前提条件:本研究围绕“监督必须忠实地代表预测背后的证据”这一原则构建归因正则化,超越了简单的图一致性。
- 无标注框架:一种新颖的框架,通过过滤后的次模搜索提取紧凑的监督序列,消除了对人工提供相关性标注的需求。
- 次模排序损失:一种可微的损失函数,能够对齐变换轨迹中的候选选择并强制执行停止准则,为原本离散的证据选择过程提供了代理。
- 实证验证:通过广泛实验证明了该方法提高了归因稳定性和忠实度,同时增强了对变换输入的鲁棒性,且对洁净图像的准确率影响极小。
实验结果
该方法在 ImageNet-100 和 ImageNet-1K 上针对 ViT-B/16、ViT-L/16、ResNet-50 和 ConvNeXt-B 架构进行了评估。
- 归因质量 (ImageNet-100, ViT-B/16):
- 归因稳定性从 0.14 提升至 0.27。
- **插入(Insertion)**得分提升了 52.1%。
- **删除(Deletion)**得分降低了 62.2%。
- 分类准确率仅下降了 0.28 个百分点。
- 鲁棒性 (ImageNet-1K):
- 变换输入平均准确率分别提升了 0.55 (ResNet-50) 和 0.33 (ConvNeXt-B) 个百分点。
- 洁净准确率下降幅度限制在 0.30 个百分点以内。
- 效率:该方法的训练吞吐量与 CGC 相当,比 CLIP-AFT 更快,且其 GPU 显存需求显著低于二阶梯度方法。
意义与主张
论文声称,忠实的归因能够促进一致的证据依赖,且不会实质性地损害预测性能。通过将重点从对齐可能不忠实的梯度图转向对齐源自次模搜索的实际证据选择过程,该方法解决了变换敏感性的根源问题。结果表明,对决策相关证据而非仅仅是对其解释输出实施等变性约束,可以产生更鲁棒的模型,使其在几何变换过程中能够依赖空间对应的证据。作者指出,代码将很快发布,以促进进一步的研究。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。