← 最新论文
💻 computer science

Naming the Concepts Classifiers Rely On: Language-Anchored Decomposition for Faithful Explanation

本文引入了语言锚定分解(Language-Anchored Decomposition, LAD),这是一个事后框架,通过对非负矩阵分解进行求逆,以学习受语言落地区域图约束的概念基,从而为深度神经网络生成忠实、空间精确且具有人类可解释性的解释,进而实现命名化且与决策相关的解释,而无需修改原始模型。

原作者: Ahsan Habib Akash, Dipkamal Bhusal, Stacey Jones, Donald A. Adjeroh, Binod Bhattarai, Prashnna Kumar Gyawali

发布于 2026-07-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Ahsan Habib Akash, Dipkamal Bhusal, Stacey Jones, Donald A. Adjeroh, Binod Bhattarai, Prashnna Kumar Gyawali

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一个超级聪明的 AI,它可以通过观察照片来告诉你其中有什么。它在工作中表现出色,但它就像一个“黑盒”:你看到照片输入进去,然后答案输出出来,但你完全不知道它是为什么做出那个选择的。

目前探测这个黑盒的方法存在一个问题。有些方法可以告诉你 AI 看了什么(比如“它看到了猫耳朵”),但它们无法告诉你那个东西叫什么名字。另一些方法虽然能给出一个名称(比如“尖耳朵”),但它们必须通过从头开始重新构建这个 AI 来实现,这改变了原始 AI 的运作方式。

这篇论文介绍了一种名为 LAD(语言锚定分解,Language-Anchored Decomposition) 的新方法。把它想象成一个“翻译器”,让你能够在不修改原始 AI 的情况下,窥探其内部并获得清晰、带有名称的解释。

以下是它的工作原理,我们使用几个简单的类比:

1. 问题所在:“神秘配料”汤

想象 AI 是一位厨师,正在制作一锅完美的汤(即预测结果)。

  • 旧方法 就像是在品尝这锅汤,然后说:“它尝起来有‘配料 #4’的味道。” 但你不知道“配料 #4”是“盐”、“胡椒”还是某种“神秘香料”。你必须在品尝之后再去猜测它的名字,而且每次品尝时,这个名字可能都不一样。
  • 其他方法 则像是要求厨师在烹饪之前先写好食谱。但为了做到这一点,你必须雇佣一位新的厨师并从头开始训练他。这位新厨师做出的汤可能会与你想要理解的原始汤略有不同。

2. LAD 的解决方案:“锚定”食谱

LAD 与众不同。它在不改变任何事物的情况下,观察原始厨师的烹饪过程。

第一步:菜单(语言锚点)
首先,LAD 会请一位聪明的语言模型(就像一位知识渊博的美食评论家)来猜测特定菜肴可能包含的配料清单。如果这道菜是“猫”,评论家会建议:“尖耳朵”、“胡须”、“绿眼睛”。这些就是我们想要使用的名称

第二步:地图(CLIP 的连接)
接下来,LAD 使用一个名为 CLIP 的工具来观察照片,并找到这些特定事物的位置。它绘制了一张地图,展示了“尖耳朵”在图片中的具体位置。

第三步:魔术技巧(反转数学运算)
这是最巧妙的部分。通常,当科学家试图分解一张图像时,他们会尝试同时猜测配料和食谱。
LAD 则反其道而行之。它将名称固定不动(即“语言锚点”)。它说:“我们已经知道配料是‘尖耳朵’和‘胡须’了。现在,告诉我们:厨师到底用了多少比例的每种配料来制作这锅汤?”

它迫使数学运算去寻找一个既符合原始 AI 思考逻辑,又仅使用预选名称的食谱。

3. 为什么“锚点”很重要

论文证明了这种“锚点”不仅仅是一个事后贴上的花哨标签,它是必不可少的。

  • 如果没有锚点: 如果你让 AI 自己去猜测名称,它可能会找到一种有助于得到正确答案的模式,但这种模式可能是奇怪且无法解释的(比如“角落里某种特定的蓝色调”)。这种解释在数学上是准确的,但对人类来说毫无意义。
  • 有了锚点: 通过强制 AI 使用人类的语言来解释自己,该方法过滤掉了那些奇怪的模式。它只保留了那些对决策真正重要、且具有明确名称的概念。

4. 结果:清晰、具名的解释

论文在动物、场景甚至医学图像(如眼底扫描)的照片上测试了该方法。

  • 对于一张吉他的照片: LAD 不会说“因子 1 很重要”,而是会说:“模型正在观察枫木琴颈旋钮。”
  • 对于一张医学眼底扫描图: 它不会只显示一个模糊的红点,而是会说:“模型看到了视盘附近的玻璃体混浊样结构(Drusen-like structures)。”

核心结论

LAD 是一个工具,它让你能够询问 AI:“你为什么认为这是一只猫?”并得到诸如“因为我看到了尖耳朵胡须”之类的回答,而无需重新训练 AI 或改变它的思考方式。它让 AI 的“思考过程”变得透明、具名且值得信赖,同时保持原始模型完全不变。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →