Metonymy in vision models undermines attention-based interpretability
本文揭示了现代预训练视觉 Transformer 通过表现出“对象内泄漏”(视觉转喻)而违背了局部性假设,这削弱了基于注意力的可解释性方法在基于部件的推理中的忠实性,并证明了一种两阶段方法能够有效缓解该问题,从而改进属性驱动的部件发现。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是论文《视觉模型中的转喻削弱了基于注意力的可解释性》的解读,将其拆解为简单概念并辅以日常类比。
核心问题:作弊的“侦探”
想象一下,你试图教计算机通过观察鸟的局部特征来识别鸟类。你希望计算机能说出:“我知道这是一只蓝松鸦,因为我看到了蓝色的翅膀",或者“这是一只知更鸟,因为我看到了红色的胸部"。
为了实现这一目标,研究人员使用了一种名为注意力机制的特殊工具。这就好比侦探手中的放大镜。当计算机观察一只鸟时,放大镜会高亮显示它正在关注的具体部位(如翅膀),而忽略鸟的其他部分。其理念是:如果计算机聚焦于翅膀,它应该仅利用来自翅膀的信息来做出判断。
论文的发现:
作者发现,现代人工智能模型正在“作弊”。即使放大镜严格聚焦在翅膀上,计算机实际上仍在通过“墙壁”“嗅探”鸟的其他部位。
在语言学中,这被称为转喻。这就好比说“白宫发表了一份声明”,而你实际意指“总统发表了一份声明”。部分(建筑物)代表了整体(行政机构)。
在这些人工智能模型中,“翅膀”这一部分不仅包含关于羽毛的信息,它还秘密地包含了关于“头部”、“腿部”和“喙”的信息。
- 类比: 想象你试图仅通过观察一个人的左手来猜测他最喜欢的食物。在正常世界中,你的手无法告诉你关于他胃的任何信息。但在这些人工智能模型中,手与胃之间存在着神奇的连接。如果这个人喜欢披萨,即使你没有看他的嘴,他的左手也会闪烁着“披萨能量”。
为何这很重要:“忠实”的谎言
论文认为,这使得当前的“可解释”人工智能变得不可信。
许多研究人员认为他们的模型是“可解释的”,因为他们可以向你展示一张热力图(发光的地图),上面写着:“看,我正在看喙!”
- 现实情况: 模型确实在看喙,但它做出判断的依据却是腿部,因为“喙”的表征中混杂了“腿部”的信息。
- 结果: 解释看起来是诚实的,但推理过程却是谎言。模型实际上并没有针对它所指向的部位进行推理;它只是在走捷径。
解决方案:“隔音室”
作者提出了一种构建这些模型的新方法,以阻止这种作弊行为。他们称之为两阶段方法。
第一阶段:侦探寻找房间。
首先,模型观察整只鸟,并勾勒出不同部位(头部、翅膀、腿部)的轮廓。这就像房地产经纪人识别房屋中的各个房间。
第二阶段:隔音房间。
模型不再一次性观察整栋房子,而是将每个房间放入一个独立的、隔音的盒子中。
- 它取出“翅膀”盒子,将其放入一个没有任何来自“头部”或“腿部”声音能传入的房间。
- 它迫使计算机仅使用该隔音盒子内部的信息来对翅膀进行猜测。
类比:
想象一个小组项目,所有人都在同一个房间里。如果你问“翅膀”学生他们的观点,他们可能会仅仅重复“头部”学生说的话,因为他们能听到对方。
作者提出的解决方案是将每个学生放入一个独立的隔音亭中。现在,如果你问“翅膀”学生,他们必须仅根据自己对翅膀的了解来给出答案。他们无法通过偷听他人来作弊。
结果:它有效吗?
作者在三种不同类型的“物体”上测试了这种方法:
- 鸟类(CUB 数据集): 检查模型是否能识别翅膀颜色或喙的形状。
- 人脸(CelebA 数据集): 检查模型是否能识别眼睛颜色或某人是否戴着帽子。
- 胸部 X 光片(CheXpert 数据集): 检查模型是否能发现肺部问题。
他们的发现:
- 旧方法(晚期掩码): “翅膀”学生可以轻松猜出“腿部”的颜色。模型感到困惑且不忠实。
- 新方法(两阶段/隔音): “翅膀”学生只能猜测与翅膀相关的事物。模型在真正理解特定部位方面变得更好。
- 权衡: 构建这些隔音房间需要更多的计算能力(大约增加一倍),但它使模型的推理变得诚实且准确。
结语
论文总结道,如果你希望人工智能能够解释为什么它基于图像的某个特定部分做出了决定,你就不能仅使用标准模型。它们太“嘈杂”了,会泄露来自其他部分的信息。你需要通过架构隔离(即隔音房间)来构建它们,以确保当人工智能指向某个部位时,它实际上是在思考那个部位,而不是仅仅基于整个物体进行猜测。
简而言之: 该论文证明了当前的人工智能模型在它们正在观察什么的问题上撒了谎,并提供了一种“隔音”的构建方法,迫使它们说出真相。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。