← 最新论文
💻 computer science

Capability \neq Interpretability: Human Interpretability of Vision Foundation Models

本文提出了一种基于心理物理学的框架,证明视觉基础模型的可解释性始终低于监督学习对应模型,并揭示可解释性是一个独立维度,由特征局部性和粗粒度语义对齐驱动,而非整体模型能力。

原作者: Julien Colin, Lore Goetschalckx, Nuria Oliver, Thomas Serre

发布于 2026-05-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Julien Colin, Lore Goetschalckx, Nuria Oliver, Thomas Serre

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用简单语言和日常类比对这篇论文的解读。

核心问题:我们能理解 AI 的“大脑”吗?

想象你有一个超级聪明的机器人,它能以惊人的准确度识别猫、汽车或交通信号灯。它工作得如此出色,以至于被用于驾驶汽车和协助医生诊断疾病。但问题在于:它实际上是如何“看”世界的?

如果你问机器人:“这张图片的哪一部分让你认为它是一只猫?”它没有声音。它只有内部信号(特征)在发光。这篇论文提出的核心问题是:普通人能否观察这些信号并理解它们的含义?

作者将这一概念称为可解释性。这并非关乎机器人有多“聪明”(其能力),而是关乎它的思维对我们来说有多“清晰”。

旧方法与新方法

旧方法(“多项选择”陷阱):
之前的测试试图通过向人类展示图片并询问“这两张图片中哪一张匹配 AI 的信号?”来检验人类是否理解了 AI 的特征。

  • 缺陷: 作者发现这种方法存在一个漏洞。人类往往只需知道该特征“不是”什么,就能答对。
    • 类比: 假设我向你展示一张玉米田的照片和一张海滩的照片,并说:“这个 AI 信号与玉米无关。”即使你完全不知道这个信号实际上“是”什么,你也很容易选出海滩。你只是在排除错误答案,而非真正理解信号。这使得测试变得不公平且不可靠。

新方法(“侦探”框架):
作者建立了一个更公平的新测试,包含两个部分,就像侦探试图解开谜团一样:

  1. 定位性(“在哪里”游戏):

    • 设置: 你看到一个“神秘信号”以及几个触发该信号的示例(例如一张轮胎的照片,或一张显示信号亮度的热力图)。
    • 任务: 你被展示一张图片,并被要求点击你认为该信号会亮起的确切位置。
    • 目标: 你能指出图像中与该信号匹配的具体部分(如轮胎)吗?
  2. 可命名性(“是什么”游戏):

    • 设置: 与上述相同的视觉线索。
    • 任务: 你必须写一段简短的描述,说明该信号代表什么。
    • 目标: 你能用文字描述它吗?(例如:“这是一个车轮”或“这是一个红灯”)。

为了确保他们测试的是纯粹的“特征”,而非杂乱混合的神经元,他们使用了一种特殊工具(稀疏自编码器)来隔离单一、清晰的概念,就像从冰沙中分离出单独的配料一样。

惊人的发现:更聪明并不意味着更清晰

研究人员测试了六种不同的 AI 模型:

  • 2 个旧模型: 以传统的监督方式训练(像是有老师指导的学生)。
  • 4 个“基础”模型: 新的、庞大的、超级强大的模型(如 DINO、CLIP),它们在整个互联网上进行训练,几乎无所不能。

结果:
“基础”模型比旧模型更难解释

  • 类比: 想象旧模型就像一个通过死记硬背教科书学习的学生。你可以轻松地问他们:“你为什么选那个答案?”他们会给出清晰的理由。
  • 新的基础模型则像是一个通过阅读人类知识宝库而学习的天才。他们更聪明,能解决更难的问题,但如果你让他们解释推理过程,他们会给出模糊、令人困惑的答案。他们的内部“思想”更难被人类捕捉。

至关重要的是,“更聪明”并没有帮助。 论文发现,模型在任务上的表现(如识别物体)与人类理解其特征的难易程度之间没有任何关联。成为一名更好的司机并不意味着你的大脑更容易被解读。

什么让特征易于理解?

作者发现了两个具体因素,能让 AI 的“思想”更易于人类掌握:

  1. 局部性(“聚光灯”效应):

    • 如果一个特征在一个紧密、特定的区域亮起(例如仅汽车的轮胎),人类很容易理解它。
    • 如果一个特征同时在各处亮起(例如整辆车以及道路以及天空),人类就会感到困惑。新的基础模型往往具有这些覆盖范围过广的“弥散”信号。
    • 类比: 如果一个人戴着亮红色的帽子(局部),在人群中更容易找到他;如果这个人只是人群“整体氛围”的一部分(弥散),则更难找到。
  2. 粗粒度对齐(“大局”匹配):

    • 人类通过广泛的类别来理解世界(例如“动物”、“车辆”)。如果 AI 将其特征组织成与这些大类相匹配,人类就能更好地理解它。
    • 如果 AI 专注于微小、超具体的细节(例如一只蝴蝶翅膀的确切纹理与另一只蝴蝶相比),人类反而会觉得更难理解。
    • 类比: 如果你向我展示“北美”和“南美”(粗粒度),解释地图会更容易;而不是试图解释城市中每一条街道的具体形状(细粒度)。

唯一的亮点:DINOv3

有一个例外。一个名为DINOv3的模型既非常强大,又非常可解释。为什么?因为构建它的人专门编程让它寻找“局部”特征(在特定位置亮起的东西)。这证明我们可以构建既聪明又易于理解的模型,但我们必须从一开始就将这一目标纳入设计。

总结

  • 能力 \neq 可解释性: 仅仅因为 AI 超级聪明,并不意味着我们能理解它的思考方式。事实上,最新、最聪明的模型往往是最理解的。
  • 差距: 在“把工作做好”和“清晰解释工作”之间存在差距。
  • 解决方案: 为了使 AI 更加透明,我们需要训练它们关注具体、局部的细节,并将知识组织成广泛的、类似人类的类别,而不仅仅是让它们变得更大、更强大。

论文得出结论:我们不能假设随着 AI 变得更聪明,它自然会变得更易于理解。我们必须从一开始就构建这种清晰度。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →