← 最新论文
🤖 AI

DAVE: Distribution-aware Attribution via ViT Gradient Decomposition

本文介绍了 DAVE,这是一种针对视觉 Transformer 的具有数学理论依据的归因方法,它通过分解输入梯度来隔离稳定的、局部等变的成分并消除架构伪影,从而实现高分辨率且稳定的像素级解释的生成。

原作者: Adam Wróbel, Siddhartha Gairola, Jacek Tabor, Bernt Schiele, Bartosz Zieliński, Dawid Rymarczyk

发布于 2026-02-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Adam Wróbel, Siddhartha Gairola, Jacek Tabor, Bernt Schiele, Bartosz Zieliński, Dawid Rymarczyk

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一个非常聪明的机器人(视觉 Transformer),它看了一眼图片并说:“那是一个足球!”但如果你问这个机器人:“你为什么觉得那是足球?”它给出的答案却令人困惑。它可能会模糊地指向整个画面,或者更糟,指向一个仅仅是因为机器人的构建方式而存在的奇怪网格模式。

这篇论文介绍了一个名为 DAVE(基于视觉 Transformer 梯度分解的分布感知归因)的新工具来解决这种困惑。你可以把 DAVE 想象成一个高分辨率、具有降噪功能的闪光灯,它能帮助我们看清机器人到底在看什么。

以下是它的工作原理,通过简单的概念进行拆解:

1. 问题所在:“收音机里的静电噪声”

当目前的 AI 模型试图解释它们的决策时,它们经常会产生“静电”或“伪影”。

  • 类比: 想象你在听广播电台,但背景中一直有嗡嗡声和一层奇怪的网格图案覆盖在音乐上。你能听到歌曲(预测结果),但这些静电(解释)让你很难分辨出哪种乐器在演奏哪个音符。
  • 现实情况: 在视觉 Transformer 中,模型处理图像的方式(将其分解为补丁并使用“注意力机制”)会产生这些人工模式。现有的方法经常会被这种静电分散注意力,指向网格线而不是实际的物体。

2. 解决方案:将信号与噪声分离

DAVE 通过数学方法将机器人的“思考过程”(梯度)拆解为两个截然不同的部分:

  • 部分 A:真实的信号(有效变换): 这是机器人大脑中真正随图像内容而变化的部分。如果移动足球,这部分也会随之移动。这是有用的信息。
  • 部分 B:机器人的怪癖(算子变化): 这是仅仅因为机器人的内部齿轮发生了微小偏移而变化的部分,即使图像本身没有变化。这就是“噪声”或“网格模式”。

隐喻: 想象一位厨师在品尝汤的味道。

  • 信号: 厨师说:“味道咸是因为盐。”(这是真实的原因)。
  • 噪声: 厨师说:“味道咸是因为我手里拿的勺子在震动。”(这是工具产生的伪影,而不是汤本身的问题)。
  • DAVE 的任务: 它过滤掉震动的勺子,然后告诉你:“是因为盐。”

3. 魔法技巧:“稳健的手”过滤器

一旦 DAVE 将真实的信号与机器人的怪癖分离,它就会执行一个被称为**等变滤波(Equivariant Filtering)**的聪明操作。

  • 类比: 想象你正在人群中寻找一张特定的脸。如果你稍微歪一下头,那张脸仍然是同一张脸。如果你稍微移动一下视线,那张脸依然在那里。
  • DAVE 如何利用这一点: DAVE 询问模型:“如果我稍微旋转这张图片或移动几个像素,你的解释会改变吗?”
    • 如果解释跳动得非常剧烈,DAVE 就知道那是极不稳定的“噪声”,并将其丢弃。
    • 如果解释保持一致(就像那张脸保持不变一样),DAVE 就会保留它。
  • 结果: 这产生了一个平滑、稳定的图谱,突出了实际物体(如足球),而没有那些锯齿状的、网格状的伪影。

4. 最后的润色:模糊粗糙的边缘

最后,DAVE 对结果应用了一个轻微的“模糊”(低通滤波)。

  • 类比: 想象透过一层薄雾看一张高清晰度的照片。雾气去除了微小的、令人分心的尘埃(高频噪声),但保持了主图的清晰。
  • 结果: 最终的图谱平滑、精确,并突出了模型用来做出决策的准确像素。

他们发现了什么?

作者在许多不同的 AI 模型(如 DeiT 和 DINO)以及一个庞大的图像数据库(ImageNet)上测试了 DAVE。

  • 更高的准确性: 当他们检查 AI 的解释是否真的指向了物体时,DAVE 比之前的方法表现得更好。它更频繁地找到了目标物体。
  • 更少的噪声: DAVE 生成的视觉图谱没有那些烦人的网格模式。它们看起来像是自然、人类可理解的高亮显示。
  • 稳定性: 如果他们稍微改变图片(旋转或移动),DAVE 的解释依然保持不变,这证明了它观察的是物体,而不是像素

简而言之: DAVE 是一种新的聆听 AI 模型的方式,它过滤掉了由模型自身架构引起的“静电噪声”,为我们提供了一个清晰、稳定且准确的视角,让我们看清 AI 究竟在看什么。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →