← 最新论文
🤖 machine learning

Decomposition of Evidence, Contradiction, and Fragility in Perturbation Responses

本文引入了 DECAF,这是一个将基于扰动的模型解释分解为独特的证据、矛盾和脆弱性组件的新型框架,证明了这种轨迹感知方法在多种视觉和表格任务中的准确性、效率和可解释性方面均显著优于传统的基于幅值的归因方法。

原作者: Lei You

发布于 2026-08-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Lei You

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图理解为什么你的一个朋友做出了某个特定的选择,比如选了红色的衬衫而不是蓝色的。你可能会问:“他们对这个颜色反应有多大?”如果他们立刻抓起了红衬衫,你会说:“哇,反应真强烈!”但这里有个棘手的地方:巨大的反应并不总是意味着同样的东西。也许他们是真的很喜欢那件红衬衫(一个好的理由)。也许他们是因为太讨厌蓝衬衫了,所以才抓起红衬衫以远离它(一个坏的理由)。又或者,他们抓起红衬衫是因为感到困惑,结果在抓的过程中才意识到自己其实一直更喜欢蓝色的那件(一种转瞬即逝、脆弱的反应)。

这就是“AI 可解释性”(AI explainability)的世界,这是一个科学家试图窥探计算机模型内部“黑盒”以了解其思考过程的领域。长期以来,主要的工具是测量反应的“量级”(magnitude)——基本上就是当你微调输入时,AI 的答案发生了多大的变化。这就像是在测量门被关上的声音有多响。但正如这篇论文所指出的,知道门关得有多响并不能告诉你门是被愤怒地摔上了,还是因为喜悦,亦或是仅仅因为一阵并不存在的风吹动了它。作者 Lei You(来自丹麦技术大学)认为,我们一直忽略了噪声背后的“意义”,并构建了一种新的方法来理清这一切。

该论文引入了一种名为 DECAF 的方法(其名称代表了证据、矛盾与脆弱性的分解:Decomposition of Evidence, Contradiction, and Fragility)。把 DECAF 想象成一个超级聪明的侦探,它不仅听门撞击的声音有多大,还会观察一个人走向门时的整个过程。

DECAF 是如何工作的,让我们用一个简单的故事来说明:想象你正在看一个魔术表演,魔术师将一张牌从国王变成了王后。

  1. 证据 (Evidence): 当魔术师展示卡片时,如果这种变化感觉像是正在向最终结果(王后)积累,DECAF 就称之为证据。它是支持最终决策的那部分反应。
  2. 矛盾 (Contradiction): 有时候,卡片可能在某一瞬间看起来像国王,然后变成王后,接着又变回国王,最后才定格为王后。如果反应在任何时候都与最终结果相悖,DECAF 就称之为矛盾。这就像 AI 在改变主意之前说:“等等,我以为它是国王呢!”
  3. 脆弱性 (Fragility): 最后,想象魔术师挥动一张看起来像王后的牌,但当你仔细观察结尾时,发现它其实只是一张白纸。这张牌看起来发生了变化,但最终结果却是“无”。如果 AI 在表演过程中反应强烈,但最终答案基本为零,DECA F 就称之为脆弱性。这种反应仅仅是因为所走的路径而存在,而非源于真实的差异。

作者通过几种不同的方式测试了这个想法。首先,他们创建了受控的视频游戏和谜题,在这些场景中,他们完全清楚 AI 应该 在做什么。他们发现 DECAF 可以识别出 AI 何时依赖于“捷径”(比如根据背景颜色进行猜测)而非实际物体。如果 AI 使用的是捷径,DECAF 的“证据”得分会完美匹配这种行为。如果 AI 感到困惑或正在改变主意,“矛盾”得分就会激增。

然后,他们将这一方法应用于现实世界,进行了一项涉及 72 个不同 AI 模型观察 ImageNet-9 数据集(一个包含不同背景图片的集合)的大规模测试。他们对比了那些具有完全相同的“响度”但底层行为却不同的案例。

  • 结果: 如果你仅仅观察响度(量级),你猜对正确行为的概率仅为 35.0%。这基本上就是抛硬币。
  • DECAF 的修正: 当他们使用 DECAF 来观察反应的类型(证据 vs. 矛盾 vs. 脆弱性)时,他们得到正确答案的概率达到了 96.4%

论文还发现了一个关于我们如何向 AI 展示信息的重要发现。他们测试了两种展示图像的方式:一种是将整张图片慢慢淡入(类似于融合),另一种是将图像逐块揭开(类似于拼图)。他们发现,改变图像揭示的方式会改变反应的总“响度”近 80%。然而,“证据”(可靠的理由)几乎没有变化。相反,“脆弱性”(由于路径导致的混乱噪声)却爆炸式增长,增长了超过 4 倍。这证明了反应的总大小是具有误导性的;它往往更多地反映了 AI 对展示图像的方法的敏感程度,而非图像本身。

最后,作者展示了 DECAF 的效率极高。在一个拥有 10 亿参数 的巨型 AI 模型(DINOv2 模型)上,DECAF 完成任务所需的时间比其他流行方法少 4.75 倍,消耗的内存也少 2.36 倍,同时依然能出色地完成工作。

简而言之,这篇论文表明,我们过去太过于关注 AI 反应了多少,而忽略了那次反应到底意味着什么。通过将反应分解为证据(支持)、矛盾(反对)和脆弱性(转瞬即逝的噪声),DECAF 为我们提供了一个更清晰、更真实的画面,让我们了解这些数字大脑究竟在想什么。它是一个不仅能测量门撞击声,还能帮助我们理解门为何被撞上的工具。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →