← 最新论文
🤖 AI

Activation-Deactivation: A General Framework for Robust Post-hoc Explainable AI

本文介绍了激活-去激活(Activation-Deactivation, AD),这是一种新颖的后验解释性框架,它通过使用内部模型去激活来取代输入扰动,从而在无需额外训练的情况下生成更具鲁棒性和迁移性的解释。

原作者: Akchunya Chanchal, David A. Kelly, Hana Chockler

发布于 2026-07-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Akchunya Chanchal, David A. Kelly, Hana Chockler

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一个非常聪明但神秘的机器人,它通过观察图片来告诉你它看到了什么(比如“那是一只罴!”或者“那是一只鸭嘴兽!”)。问题在于,这个机器人是一个“黑盒”——你无法看到它是如何思考的。你想知道:是图片的哪些部分让机器人说出了“罴”这个词?

这就是可解释人工智能(XAI)的问题。这篇论文介绍了一种回答这个问题的全新方法,叫做激活-去激活(Activation-Deactivation, AD),以及一个专门用于此工具的工具,叫做 convad

以下是它的工作原理,使用简单的类比:

旧方法:“坏邻居”问题

目前大多数方法试图通过**改变(mutate)**图片来解释机器人的决策。

  • 类比: 假设你想知道一位厨师著名的汤之所以好喝是因为胡萝卜。为了测试这一点,你从汤里舀出一勺,然后把胡萝卜换成了……卫生纸沙子蓝色油漆
  • 问题: 如果你在汤里放了卫生纸,这碗汤就不再是“汤”了。它变成了一个奇怪的、超出分布(out-of-distribution)的混乱物。如果厨师说:“我不喜欢这个,”你并不知道是因为缺少了胡萝卜,还是仅仅因为你用卫生纸毁了这碗汤。
  • 在论文中: 这被称为使用“分布外变体(out-of-distribution mutants)”。旧方法会用随机值(如零、灰色或噪声)来遮盖图像的部分。取决于你用什么来遮盖,你会得到不同的、往往令人困惑的答案。有时,仅仅因为你用错误的颜色遮盖了雪景,机器人就会把一张雪人的照片误认为是一只绵羊。

新方法:“静音开关”(激活-去激活)

作者说:“为什么要改变食材?直接告诉机器人忽略它们不就行了吗。”

  • 类比: 与其把胡萝卜换成卫生纸,不如想象一下你只是关掉了厨房里胡萝卜所在区域的灯。胡萝卜仍然在那里,但厨师的眼睛(机器人的传感器)看不见它们。其余的汤依然保持完美正常。
  • 工作原理: convad 工具完全没有改变图片。相反,它进入机器人的大脑(神经网络)并拨动开关。如果图片的某个部分应该被“遮盖”,该工具就会阻止来自该部分的信息在机器人的大脑中传递。它实际上是在说:“假装这张图片的这部分不存在”,而无需实际改变图像数据。

为什么这更好?

  1. 不再是猜谜游戏: 旧方法需要你猜测:“我应该用黑色遮盖?灰色?还是白色?”论文表明,答案会完全取决于你的猜测。convad 不需要任何猜测。它只需关闭信号即可。
  2. 稳定性: 因为它不会引入奇怪的“卫生纸”像素,机器人的反应要可靠得多。论文在许多不同类型的机器人(模型)和图片(数据集)上测试了这一点。
  3. “金发姑娘区”(恰到好处): 研究人员发现,convad 的解释恰到好处。它们不会太大(浪费空间在无关像素上),也不会太嘈杂(令人困惑),而且非常鲁棒(即使你把图片放在纯色背景下,它们依然有效)。

结果

论文将 convad 与当前最优秀的方法(如 LayerMask、LIME 和 Grad-CAM)进行了对比测试。

  • 鲁棒性: 即使背景发生变化,convad 在提供机器人真正信任的解释方面也比其他方法好 30-40%。
  • 可迁移性: 如果你使用 convad 在一种类型的机器人上找到了图片的“重要部分”,这些相同的部分通常也适用于另一种类型的机器人。其他方法往往会失败。
  • 无需训练: 你可以拿任何已经训练好的机器人,接入 convad,它就能立即工作。你不需要重新教导机器人任何东西。

缺陷(局限性)

  • 内部访问权限: 要使用 convad,你需要能够打开机器人的大脑并接触到电线(访问模型的内部层)。你不能在你看不到内部结构的机器人(真正的“黑盒”)上使用它。
  • 泄漏: 有时,如果“关闭”开关不够完美,可能会有极少量的信息“泄漏”出来,就像门缝下的光线一样。作者承认了这一点,但表示这是一种罕见的极端情况。

总结

这篇论文提出了一种理解 AI 决策的新方法。与其用奇怪的值弄乱输入图片(比如“卫生纸”汤),convad 只是通过切断模型内部的信号,告诉 AI 忽略图片的特定部分。这使得 AI 做出决策的原因变得更加清晰、可靠且值得信赖。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →