← 最新论文
🤖 machine learning

Gradient-Skipping Relevance Propagation for Efficient Explainability of Vision Transformers

本文介绍了 GradSkip,一种针对视觉 Transformer 的新型相关性传播方法,它通过自适应加权注意力头并动态地通过残差连接分配相关性,提高了忠实度和定位能力,在实现最先进性能的同时,其计算量(GFLOPs)比现有方法减少了 14 倍以上。

原作者: Christopher Buratti, Michele Marchetti, Federica Parlapiano, Davide Traini, Domenico Ursino, Luca Virgili

发布于 2026-07-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Christopher Buratti, Michele Marchetti, Federica Parlapiano, Davide Traini, Domenico Ursino, Luca Virgili

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一个名为视觉 Transformer (ViT) 的超级聪明机器人大脑。它在观察图片并识别其中的物体方面表现出色——比如发现一只瓢虫或一辆卡车。但问题在于,这个机器人有点像个“黑盒”。你可以问它:“为什么你觉得那是卡车?”它只会回答:“因为我觉得是。”它不会向你展示图片的哪些部分让它做出了这样的决定。

科学家们曾尝试窥探机器人的大脑以了解其思考方式,但他们旧有的工具就像是用大锤去砸坚果。这些工具将机器人的每一个部分都视为同等重要,并且忽略了那些让信息直接穿梭而无需改变的“捷径”导线。这使得解释过程变得混乱且往往是错误的。

于是,GradSkip 登场了。这是一个由 Christopher Buratti 及其团队发明的新颖工具,旨在解决这一乱象。你可以把 GradSkip 想象成一个聪明的侦探,它不仅仅是同时观察整个大脑,而且准确地知道哪些神经元在承担重任,哪些神经元只是在“睡觉”。

旧工具犯下的两个大错

论文指出,之前的侦探存在两个主要的错误方式:

  1. “人人平等”的错误: 想象一个合唱团,有些歌手是正在唱着完美高音的独唱员,而其他人只是在背景中哼唱。旧工具将每一位歌手都视为在以相同的音量歌唱。GradSkip 则意识到,有些“注意力头”(即合唱团的部分)对于决策至关重要,而其他的则只是噪音。它学会了倾听独唱员,并忽略背景的哼唱。
  2. “捷径”的错误: Transformer 拥有酷炫的“跳跃连接”(skip connections)——这就像一条秘密隧道,让信息可以跳过整个房间直接到达下一个房间。旧工具将这些隧道视为仅仅是不改变任何内容的空走廊。但有时,信息在主房间里会发生改变,有时则不会。GradSkip 是第一个进行检查的工具:“这条信息是直接通过了隧道,还是在主房间里经历了转化?”它弄清楚了应该给每条路径多少信用。

GradSkip 如何解开谜团

GradSkip 使用一种巧妙的两步策略来弄清机器人在想什么:

  • 第一步:“谁是谁”过滤器: 它观察机器人的大脑并询问:“哪些注意力头实际上在干活?”它使用一种特殊的数学技巧(结合梯度流和一种“稀疏性”度量,类似于检查聚光灯有多聚焦)来挑选出最重要的注意力头。这就像是一个夜店的保安,只允许酷炫且相关的神经元进入,并将嘈umes(噪音)踢出去。
  • 第二步:“路径分割器”: 当侦探向后追踪思考过程时,它会在主路径和跳跃路径之间分配“相关性”(即对决策的贡献度)。如果机器人只是将信息传递而未作改变,GradSkip 会将大部分信用归于跳跃路径。如果机器人进行了大量的思考,它则会将信用归于主路径。这是一种动态且公平的信用分配方式。

证明:它有效,而且很快!

团队在许多图片上测试了 GradSkip,从标准的 1,000 张图像集 (ImageNet1K) 到医疗血细胞照片 (BloodMNIST),他们还尝试了一个让机器人为图像每个部分进行颜色编码的任务(分割)。

以下是他们的发现:

  • 它是最诚实的解释: 当他们测试解释与机器人实际决策的匹配程度时,GradSkip 表现最佳。在 ImageNet1K 测试中,在其中一个关键指标上,它比第二好的方法高出了 12.50%。在医疗血细胞测试中,它的表现同样出色。
  • 它极其精准: 当他们要求机器人指向物体时,GradSkip 是最准确的。
  • 它是速度达人: 这是最酷的部分。那些旧的、准确的方法就像是在开坦克——效果很好但消耗大量燃料。GradSkip 则像是一辆流线型的跑车。它比第二好的准确方法使用的 GFLOPs(衡量计算工作量的指标)少了 14.45 倍。对于分类任务,它仅需 69.39 GFLOPs,对于分割任务,仅需 28.52 GFLOPs

GradSkip 不是什么

论文非常明确地说明了 GradSkip 不具备的功能:

  • 如果你无法看到机器人大脑内部的情况,它就无法工作。你需要能够运行“反向传播”(检查梯度),因此它不能用于那些无法看到内部齿轮的模型。
  • 它并不能神奇地修复一切。在某些棘手的情况下,例如图片中有多个同类物体时,它虽然仍然表现很好,但论文承认要获得完美分数仍有难度。
  • 它不观察“CLS token”(一些机器人用来总结整张图片的特殊 token)。作者指出,对于使用这种 token 的标准机器人,忽略它可能会错过一些线索,但对于其他类型的机器人(如 SegFormer),它的效果非常完美。

总结

GradSkip 不仅仅是一个小小的改进;它是一种更聪明的聆听机器人的方式。通过意识到并非所有的脑部零件都是平等的,并且尊重那些“捷径”导线,它为我们提供了一个清晰、诚实且超快速的视角,去观察视觉 Transformer 如何做出决策。作者认为,这可能会成为医疗成像等领域的游戏规则改变者,因为在这些领域,理解机器人“为什么”做出某种诊断,与诊断本身一样重要。而且最棒的是,它完成这一切时并不需要超级计算机。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →