← 最新论文
💻 computer science

Explaining Image Similarity with Automatically Extracted Concept Activation Vectors

本文介绍了一种与模型和指标无关的框架,该框架通过稀疏自编码器自动提取概念激活向量来解释图像相似性,从而能够针对单个图像对和图像组,提供关于驱动相似性评分的具体概念(如纹理、形状或颜色)的忠实且具解释性的见解。

原作者: Isaac Roberts, Petra Bevandic, Alexander Schulz, Barbara Hammer

发布于 2026-07-31
📖 1 分钟阅读☕ 轻松阅读

原作者: Isaac Roberts, Petra Bevandic, Alexander Schulz, Barbara Hammer

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正走在一座巨大的、隐形的图书馆里,这里的每一本书都是一张图像。在这座图书馆里,书并不是按标题或作者来组织的,而是根据它们彼此之间的“感觉”来排列。一张金毛寻回犬的照片可能会紧挨着一张蓬松猫的照片,不是因为它们是同一种动物,而是因为它们共享某种“蓬松”的氛围。这就是当今计算机看待世界的方式:它们将图像转化为秘密代码(称为嵌入),并通过测量这些代码之间的距离来判断两张图片是否相似。这就是寻找丢失照片、识别面部或推荐完美穿搭背后的魔力。但棘手的地方在于:计算机可以告诉你两张图片很相似,但它往往无法告诉你“为什么”。这就像一个朋友说:“这两首歌听起来很像,”却拒绝解释是因为鼓点、歌手的声音,还是节奏。长期以来,科学家们一直试图通过在图像上高亮显示亮点点的地图来窥探幕后的奥秘,但这些地图往往会忽略大局,比如导致相似性的具体“成分”(如纹理或形状)。

这篇论文介绍了一种解决这一谜团的新颖且聪明的方法。作者 Isaac Roberts 及其团队构建了一个系统,它就像是一个图像的“风味检测器”。该系统不再仅仅观察图像,而是将图像的秘密代码分解为其基本的构建模块,他们称之为“概念”。把这些概念想象成和弦中的单个音符:一个音符可能是“条纹”,另一个是“红色”,还有一个是“圆形”。该团队使用一种特殊的工具(稀疏自编码器)来自动寻找这些音符,而无需人类去教它们是什么。一旦有了这份音符清单,他们就玩了一个小游戏:他们从图像的代码中抽走一个特定的音符,然后观察“相似度得分”下降了多少。如果抽走“条纹”这个音符会让两件衬衫在计算机眼中看起来完全不同,那么条纹就是它们相似的主要原因。他们在数千张图像上进行了测试,发现他们的方法比以往猜测的方法要可靠得多。他们展示了通过直接调整秘密代码,他们可以解释为什么一件条纹衬衫与另一件条纹衬衫相匹配,即使它们的颜色不同。他们甚至利用这一点找到了共享相同“理由”而非仅仅是相同外观的图像组,证明了他们的“风味检测器”可以帮助我们理解计算机如何看待世界的隐藏逻辑。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →