← 最新论文
🤖 machine learning

Concept-Based Abductive and Contrastive Explanations for Behaviors of Vision Models

本文提出了一种新颖的框架,用于生成基于概念的溯因与对比解释,这些解释能够识别最小的高层级因果相关概念集合,以解释视觉模型的个体预测及常见行为,从而有效弥合了人类可理解的概念解释与形式化因果推理之间的鸿沟。

原作者: Ronaldo Canizales, Divya Gopinath, Corina Păsăreanu, Ravi Mangal

发布于 2026-05-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Ronaldo Canizales, Divya Gopinath, Corina Păsăreanu, Ravi Mangal

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一个非常聪明但神秘的机器人,它会查看图片并猜测图片内容(比如区分猫和狗)。你问机器人:“你为什么认为这张图片是猫?”

通常,机器人会给你一个令人困惑的回答,比如:“因为像素 45、102 和 89。”这毫无帮助。你想知道的是:“因为它有胡须和尖耳朵。”

这篇论文介绍了一种新方法,让你能用通俗易懂的人类概念向机器人提问并获得回答。以下是他们做法的简明解释:

1. 问题:两种不同的语言

研究人员注意到,以往的方法陷入了两个不同的阵营:

  • 阵营 A(概念): 尝试用人类词汇(如“毛发”或“轮子”)来解释事物,但无法证明为什么这些词汇重要。这就像猜测机器人喜欢“毛发”,仅仅是因为它常在猫身上看到毛发,却不知道机器人是否真的需要毛发才能做出判断。
  • 阵营 B(形式逻辑): 能够精确证明是哪些微小细节(如特定像素)导致了决策,但这些答案过于技术化,人类难以理解。

解决方案: 他们在两个阵营之间架起了一座桥梁。他们创造了一种方法,能够找出机器人做出猜测所绝对必要最小、最核心的人类概念集合(如“毛发”和“耳朵”)。

2. 魔法技巧:“擦除”概念

为了弄清楚机器人真正关心的是什么,研究人员使用了一种巧妙的技巧,称为概念擦除

想象机器人的大脑是一锅想法的汤。

  • 测试: 他们拿一张猫的图片,问机器人:“这是什么?”机器人回答:“猫。”
  • 擦除: 接着,他们从这锅“猫”的汤中,神奇地移除“毛发”这个概念。
  • 结果:
    • 如果机器人突然说“我不知道”或猜成“狗”,那么毛发就是关键。机器人需要“毛发”这个概念才能确定。
    • 如果机器人仍然说“猫”,那么“毛发”对于该特定决策来说其实并非必要。

他们在计算机内部通过数学方法完成这一过程,而不是真正从照片中裁剪掉像素,而是“关闭”机器人内部大脑中关于“毛发”的想法。

3. 两种回答类型

这篇论文定义了两种解释机器人行为的方式,使用了侦探类比:

  • “为什么”(溯因解释):

    • 问题: “机器人需要多少最少的证据才能确信这是一只猫?”
    • 回答: “它需要毛发尖耳朵。如果去掉这些,它就不再猜测‘猫’了。”
    • 类比: 这就像侦探说:“要侦破此案,我必须拥有指纹和鞋印。缺少其中任何一个,我都无法确定。”
  • “如果……会怎样”(对比解释):

    • 问题: “我能做出最小的什么改变,来诱骗机器人猜测其他内容?”
    • 回答: “如果你移除胡须,机器人就会认为它是狗。”
    • 类比: 这就像问:“我需要修改多少签名,才能让伪造者认为它是假的?”

4. 寻找“共同线索”

研究人员不仅仅查看一张图片。他们查看了数百张图片,在这些图片中,机器人要么犯了同样的错误,要么都给出了正确的答案。

他们发现,机器人几乎在所有这些图片中,通常都依赖相同的少数几个概念

  • 例子: 如果机器人认为 98% 的“卡车”图片实际上是“汽车”,通常是因为它在寻找“轮子”和“道路”,却忽略了“卡车货箱”。
  • 与其列出成千上万个微小的原因,他们发现仅仅3 到 4 个概念就能解释机器人几乎所有的行为。这使得解释非常简短,易于人类阅读。

5. “魔法透镜”(CLIP)

他们最初是如何让机器人理解像“毛发”或“轮子”这样的词汇的?
他们使用了一种名为CLIP的特殊工具(一种同时理解图片和文字的机器人)。

  • 他们教会机器人将其内部的“像素汤”翻译成 CLIP 的“词汇汤”。
  • 这使得他们能够向机器人询问关于“毛发”的问题,尽管机器人最初只知道像素。这就像给机器人一本字典,让它能讲你的语言。

6. 他们的发现

  • 简短即美好: 最好的解释非常简短。通常,只需 1 或 2 个概念就能解释机器人做出决策的原因。冗长复杂的概念列表很少是真正的原因。
  • 泛化能力: 这些简短的解释适用于许多图片,而不仅仅是一张。如果机器人在一张图片上需要“毛发”来猜测“猫”,那么它通常对所有猫的图片都需要“毛发”。
  • 发现错误: 他们可以轻松发现机器人何时依赖“虚假”线索。例如,如果机器人仅仅因为看到了“水”(即使没有船)就认为图片是“船”,他们就能捕捉到这种错误。

总结

这篇论文创造了一种与 AI 视觉模型对话的新方式。你得到的不再是一串令人困惑的数字,而是一份简短清晰的人类概念列表(如“毛发”、“轮子”或“天空”),它确切地解释了 AI 为何做出该选择。他们证明,通过逐一“擦除”这些概念,可以找到 AI 决策背后最小、最重要的原因。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →