Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI
本文通过对175项研究进行系统性的分类与审计,揭示了在将 Grad-CAM 应用于视觉 Transformer 时普遍存在的算法方法论模糊性以及缺乏严谨实现细节的问题,并指出将其视为其 CNN 对应物的平凡扩展的做法,掩盖了影响可复现性与解释性的关键选择。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图理解一位才华横溢、动作极快的侦探是如何破解谜题的。在旧时代,这位侦探使用一套特定的工具:一个放大镜,它会一个接一个地观察犯罪现场微小的、网格状的区块。这个工具被称为 Grad-CAM。它曾因能照亮照片中帮助侦探做出判断(例如:“啊哈!这是一只猫!”或“这是一辆车!”)的确切位置而闻名。由于侦探是按整齐的网格观察照片的,所以该工具可以轻松地指向特定的方块并说:“我们在这个方块里看到了猫的耳朵。”
但最近,这位侦探得到了巨大的升级。这位新侦探(被称为视觉 Transformer 或 ViT)不再盯着网格看,而是同时观察整张图片,将其分解成一长串被称为“token”(标记)的小笔记。这就像是在读一个由线索组成的完整故事,而不是在看一张地图。问题在于,旧的放大镜(Grad-CAM)是为网格设计的,而不是为列表设计的。它不知道如何指向列表中的一个“词”并说:“这个词很重要!”
因此,科学家们开始尝试将旧的放大镜强行套用在新侦探的笔记列表上。他们想知道这位新侦探为什么会做出其选择。但问题在于,没有人就“如何做”达成一致。有些人指向第一个笔记,有些人指向中间,有些人看向整个列表,还有一些人只是在瞎猜。这篇论文就像是一位来审计所有报告的侦探督察。他们想知道:“我们到底是在正确地使用这个工具,还是仅仅在装样子?”
审计:一场系统性的混乱
本文的作者 Casey Wall 及其团队决定亲自扮演侦探。他们进行了一场大规模的文献搜寻,寻找每一篇试图将旧有的“Grad-CAM”工具应用于新的“视觉 Transformer”侦探的论文。他们从超过 550 篇论文的大堆资料开始。经过非常仔细的筛选过程,他们将范围缩小到了 175 篇真正尝试应用这种方法的论文。
他们的发现简直是一团糟。他们发现,大多数论文仍将新侦探的笔记列表视为旧的网格。他们在没有解释如何使其适配的情况下,就直接使用了这个工具。
论文引入了一个“分类法”(taxonomy),这只是一个用于描述详细清单或选项菜单的专业术语。作者意识到,当你尝试在视觉 Transformer 上使用 Grad-CAM 时,你必须做出几个重大的决策,而几乎没有人把这些决策记录下来:
- 看哪里: 你是看侦探写的第一个笔记?中间的一个?还是最后的总结?
- 测量什么: 你是在测量一个特定笔记的重要性,还是在测量侦探的“主思想”([CLS] token)对其他笔记的关注程度?
- 如何混合: 如果侦探拥有许多不同的“头”(类似于许多不同的视角),你是将它们全部平均化,还是逐一查看它们?
作者通过一些测试来展示这些选择究竟有多重要。他们采用了一个标准模型,并使用来自其清单的不同设置运行了同一张图片。结果如何?“热力图”(显示模型看到了什么的发光图像)完全取决于他们做了哪些选择。一种设置可能会突出照片中的狗,另一种可能突出草地,而第三种则可能几乎什么都不显示。
大问题:“即插即用”却缺乏说明书
研究发现,在他们查看的 175 篇论文中,竟然有高达 101 篇(约 58%)仅仅引用了关于旧网格型侦探的原型论文,而没有解释他们是如何将其适配到新的列表型侦探上的。另有 17 篇论文只是指向了一个代码库(GitHub 仓库),却没有解释背后的数学原理。只有 26 篇论文(约 15%)真正花时间解释了他们的具体选择或引用了相关论文。
作者认为这是一个严重的问题。当一位科学家说,“我们使用 Grad-CAM 来证明我们的模型是公平的”,但他们却没有告诉你使用的是哪个版本的 Grad-CAM 时,你就无法信任这个结果。这就像如果一位厨师说,“我烤了一个蛋糕”,但他没告诉你用的是面粉还是沙子,也没说他烤了 10 分钟还是 10 个小时。结果看起来可能像个蛋糕,但你无法确定这是否是大家都在讨论的那个蛋糕。
这篇论文实际说了什么(以及没说什么)
论文非常谨慎,并没有说:“这就是做这件事的‘唯一正确’方法。”相反,他们建议目前还没有一个单一的“正确”答案。他们发现,该领域尚未就此达成标准化的做法。
他们明确排除了“直接拿旧公式套用到新模型上而不加思考”的可能性。他们证明,这样做会产生“方法论歧义”(methodological ambiguity),这是一种高级说法,意思就是“关于工具如何工作的混乱”。
作者建议,为了推动领域的发展,研究人员需要停止将这些新模型上的 Grad-CAM 视为一个简单的、自动化的步骤。他们需要准确写下他们选择了哪个“特征”(feature)、测量了哪个“梯度”(gradient),以及如何将数据“重塑”(reshape)回图像。
为什么这很重要
这不仅仅是学术上的吹毛求疵。这些热力图被用来证明 AI 模型是安全、公平且值得信赖的,尤其是在医疗诊断或自动驾驶等重要领域。如果解释是模糊的,我们就无法确定 AI 是否真的在观察正确的东西。论文结论指出,在科学家开始对自己的选择变得极其具体之前,研究论文中看到的那些发光的图像,可能更多是为了看起来很酷,而不是为了讲述真相。
简而言之,论文建议我们需要停止猜测,开始写下我们的配方。在此之前,我们在这些新 AI 模型上看到的“Grad-CAM”仍然是一个谜,我们无法确定它到底在告诉我们什么。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。