← 最新论文
💻 computer science

From Local to Global to Mechanistic: An iERF-Centered Unified Framework for Interpreting Vision Models

本文提出了一种以统一iERF为核心的框架,通过共享比率分解、概念锚定特征解释和层间概念归因,将局部、全局与机制性可解释性融为一体,从而为视觉模型如何将像素转化为决策提供稳健且基于证据的解释。

原作者: Yearim Kim, Sangyu Han, Nojun Kwak

发布于 2026-05-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Yearim Kim, Sangyu Han, Nojun Kwak

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一个超级聪明的机器人,它看一眼照片就能立刻知道:“那是只狗!”或者“那是只猫!”但如果你问机器人为什么这么认为,它只会说:“因为我就是这么说的。”它就像一个黑盒。

本文介绍了一种打开这个黑盒的新方法。作者构建了一个统一系统,以回答关于这些视觉模型如何工作的三个核心问题:

  1. 局部视角:机器人究竟在看哪里?
  2. 全局视角:机器人学到了哪些具体的想法或“概念”?
  3. 机制视角:机器人如何将这些小想法组合起来做出最终决策?

为此,他们创建了一个名为PFV-iERF 包的单一“超级单元”。你可以把它想象成一张带有 GPS 标签的存储卡

  • PFV(逐点特征向量):这就是“存储卡”。它保存了机器人发现的特定信息片段(例如“毛发纹理”或“尖耳朵”)。
  • iERF(实例特定有效感受野):这就是"GPS 标签”。它告诉你原始照片中究竟是哪些像素触发了该记忆。

以下是他们系统的工作原理,分为三个部分:

1. 局部视角:“侦探的放大镜”

问题:旧的 AI 解释方法往往给出模糊的热力图,或者在图像发生轻微变化(例如微小的噪声)时感到困惑。它们可能会说:“机器人在看整只狗”,但无法 pinpoint 真正起作用的精确像素。

解决方案(SRD):作者使用了一种名为**共享比率分解(SRD)**的方法。

  • 类比:想象一场接力赛。机器人将接力棒(信息)从一名选手传递给下一名。SRD 追踪接力棒的速度有多少确切地来自上一位选手。
  • 工作原理:它不是靠猜测,而是通过数学分解机器人内部的计算,精确查看每个像素对最终决策的贡献程度。
  • 结果:它生成了一张清晰的高清地图,精确显示机器人使用了哪些像素。其精确度极高,即使你试图通过微小的、肉眼不可见的图像修改来欺骗机器人,这张地图依然保持诚实,不会混淆。

2. 全局视角:“概念词典”

问题:有时,机器人学到的概念是分散的。例如,“打哈欠”这个概念可能由图像角落的一张嘴和另一处的舌头共同触发。旧方法试图通过寻找图像中“最响亮”的部分来发现这些概念,但当概念是分散的(非局部的)时,这种方法就会失效。这在现代模型(如 Transformer)中尤为明显,因为它们会同时混合来自各处的信息。

解决方案(CAFE):他们使用了概念锚定特征解释(CAFE)

  • 类比:想象机器人有一本抽象词汇(概念)的词典。旧方法试图通过向你展示该词汇出现频率最高的图片来定义像“绝望”这样的词。但如果“绝望”是由角落里的一个打翻的药瓶触发的,而机器人的“注意力”却集中在背景上呢?旧方法就会出错。
  • 工作原理:CAFE 利用"GPS 标签”(iERF)来透过表象看本质。它忽略机器人当前注意力集中在哪里,而是问:“究竟是哪些具体像素导致了这个概念被激活?”
  • 结果:它能正确识别出像“三”这样的概念意味着“数三个物体”,即使这些物体分散在整个图像中。它将抽象概念锚定在真实、可验证的像素上。

3. 机制视角:“概念的家谱”

问题:我们知道机器人看到了什么以及看向哪里,但我们不知道它是如何构建最终答案的。“毛发” + “耳朵” + “尾巴”是如何变成“狗”的?

解决方案(ICG & ICAT):他们构建了一个层间概念图

  • 类比:把机器人的大脑想象成一栋多层建筑。底层看到简单的东西(线条、颜色),顶层做出最终决策。这张图绘制了一棵连接底层想法到顶层想法的“家谱树”。
  • 工作原理:他们追溯一个想法的“血统”。他们会问:“顶层的‘狗’概念是否源自底层的‘毛发’概念?”他们使用一种名为ICAT(层间概念归因)的方法来衡量这些连接强度。
  • 结果:他们发现**集成梯度(Integrated Gradients)**是绘制这张家谱树的最佳工具。
    • 成功案例:他们展示了机器人如何通过追踪从微小的“红色”像素一直到最终决策的路径,正确识别出“家雀”。
    • 失败案例:他们展示了机器人如何被欺骗。在一种情况下,一只“虎斑猫”被误认为是“拳击手犬”,因为猫脸上“条纹脸”的概念意外触发了“狗”的路径。在另一种情况下,一只“边境牧羊犬”被黑客攻击,看起来像“海蛞蝓”,因为一个微小的“皱纹”概念被放大,从而覆盖了狗的身份。

总结

本文声称,通过使用PFV-iERF单元(即带有 GPS 标签的存储卡),他们可以:

  1. 绘制机器人视线更清晰、更诚实的地图(局部)。
  2. 正确定义抽象概念,即使这些概念分散在整个图像中(全局)。
  3. 追踪确切路径,了解微小的视觉线索如何组合成重大决策,从而揭示机器人犯错或被黑客攻击的原因(机制)。

他们在各种模型(如 ResNet 和视觉 Transformer)上测试了该方法,发现其表现优于以往方法,且对欺骗手段更具鲁棒性。它提供了一条从原始像素到最终决策的清晰、有据可依的叙事。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →