← 最新论文
🤖 AI

Position: Explanation Stability Is a Property of the Model Method Pair, Not the Model

本立场文件认为,解释稳定性并非模型的内在属性,而是特定模型-方法对的涌现特征,因此必须进行跨方法验证,以避免产生关于安全性或可靠性的误导性陈述。

原作者: Kabilan Elangovan, Daniel Ting

发布于 2026-07-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Kabilan Elangovan, Daniel Ting

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图弄清楚为什么一个机器人厨师把你的吐司烤焦了。你问机器人:“你为什么要那样做?”它用发光的指尖指向了面包。但这里有个陷阱:机器人有两种不同的指向方式。一种我们称之为“激光笔”,它能精准地标出面包最热的那一点;另一种我们称之为“聚光灯”,它投射出一个宽阔的光束,覆盖整个烤面包机,强调整个区域。如果你只使用“激光笔”,你可能会觉得这个机器人非常一致。但如果你切换到“聚光灯”,机器人可能会突然指向厨房的完全不同的部分!这就是人工智能(AI)领域,特别是被称为“可解释人工智能”(XAI)的一个领域中,一个日益严重的问题核心。

在人工智能的世界里,我们构建“模型”(可以理解为超级聪明的数字大脑)来做出决策,比如识别 X 光片中的疾病。但这些模型通常是“黑箱”——我们知道输入了什么,也知道输出了什么,但我们并不总是知道它们是如何做出决策的。为了解决这个问题,科学家们使用了“归因方法”。这些工具就像高亮笔一样,向我们展示图像中的哪些部分(比如 X 光片中的暗点)对 AI 的决策最为重要。长期以来,研究人员一直假设,如果一个 AI 模型是稳定且可靠的,那么无论你使用哪种高亮工具,它的高亮笔都会指向同一个位置。这篇论文指出,这个假设是错误的。它认为,“解释的稳定性”并不是 AI 大脑本身的属性,而是取决于你恰好正在使用的特定高亮工具。如果你更换了工具,即使 AI 的最终答案保持不变,它讲述的故事也可能会完全改变。

伟大的高亮工具大交换

本文的作者 Kabilan Elangovan 和 Daniel Ting 决定通过一项使用胸部 X 光片的受控实验来测试这个想法。他们采用了三个著名的 AI 模型——DenseNet201、ResNet50V2 和 InceptionV3——并教会它们识别包括肺炎和新冠肺炎在内的五种不同的肺部疾病。他们训练这些模型直到它们能够胜任这项工作,在所有三个模型中都达到了超过 99% 的成功率(AUC)。换句话说,它们在诊断疾病方面同样出色。

紧接着,转折出现了。研究人员要求这些模型使用两种截然不同的高亮工具来解释它们为何做出这些诊断:LayerCAMGrad-CAM++

  • LayerCAM 就像是一个高分辨率显微镜。它逐像素地观察图像,保留精细的细节和局部纹理。
  • Grad-CAM++ 则更像是一个广角镜头。它观察大局,利用复杂的数学运算,根据图像的整体重要性来权衡不同部分。

研究人员想要观察:如果他们对模型进行微小的调整(这个过程称为“微调”),高亮工具会保持稳定吗?它们会继续指向同样的肺部部位吗?

情节转折:取决于工具

故事在这里变得疯狂起来。结果显示,“稳定性”完全取决于你使用的是哪种高亮工具。这就像是请三个人来描述一幅画:一个人可能会说,“这幅画很稳定,因为颜色没有变化”;而另一个人则会说,“不,形状正在剧烈移动。”两人可能都是对的,但他们使用的规则不同。

  • InceptionV3 的惊喜: 当研究人员使用 LayerCAM(显微镜)时,InceptionV3 看起来是最稳定的模型。它保持着紧凑的焦点,稳定性得分(称为 IoU)为 0.777。它看起来像是一个完美的、可靠的 AI。

  • Grad-CAM++ 的震惊: 但当他们切换到 Grad-CAM++(广角镜头)时,InceptionV3 崩溃了。它的稳定性得分降至 0.643,出现了 17.3% 的巨大退化。突然之间,这个看起来如此稳健的模型竟然变得非常摇摆不定,仅仅是因为更换了工具。

  • DenseNet201 的英雄表现: 另一方面,DenseNet201 是这场风暴中的定海神针。无论他们使用显微镜还是广角镜头,它的稳定性得分几乎没有变化。它从 0.699 变到了 0.690,仅有 1.3% 的波动。这个模型似乎具有“方法无关性”,这意味着无论使用什么工具,它的解释都能保持一致。

  • ResNet50V2 的挣扎: ResNet50V2 的表现很糟糕。在 LayerCAM 下,它起初有一个中等的得分 0.519,但在 Grad-CAM++ 下却跌落到了 0.383。它无论如何都是不稳定的,而且跌幅尤其剧烈。

最令人震惊的部分是什么?这三个模型仍然能以 99% 的准确率做出诊断。它们的“答案”是完美的,但它们的“理由”却像风中的沙堡一样,随着你观察它们的工具而四处漂移。

为什么这很重要:“虚假安全”陷阱

论文认为,这一发现打破了我们信任 AI 的一个主要规则。目前,如果一位研究人员说“我们的 AI 模型是稳定且值得信赖的”,他们通常是通过展示仅来自一种高亮工具的结果来证明这一点。这篇论文指出,这样做在科学上是无效的。这就像声称一辆汽车是“安全”的,因为它通过了某种特定类型气囊的碰撞测试,但从未测试过另一种气囊。

作者指出,如果你只通过 LayerCAM 的镜头来看 InceptionV3,你可能会认为它是医院的最佳选择。但如果医院实际上使用的是 Grad-CAM++(或者软件更新并更换了工具),该 AI 的解释可能会变得不可靠,从而误导医生。论文建议,解释稳定性不是模型本身的特征,而是“模型 + 方法”组合的属性。 你无法将两者分开。

总结:检查你的工具

那么,我们该怎么做呢?作者针对我们如何研究和监管 AI 提出了几点建议:

  1. 不要信任单一工具: 研究人员除非已经用至少两种不同的高亮方法进行了测试,否则绝不应声称一个模型是“稳定”的。如果结果发生剧烈变化,那么该模型并不稳定,它只是碰巧对准了那一个工具。
  2. 监管机构需要明确: 当医疗设备获得像 FDA 这样的机构批准时,必须锁定用于生成解释的具体高亮工具。如果医院稍后更换了工具,该设备可能需要重新审批,因为 AI 给出的“理由”可能会发生变化。
  3. 选择合适的架构: 如果你正在构建医疗 AI,你可能希望选择像 DenseNet201 这样在不同工具面前都能站稳脚跟的模型,而不是 InceptionV3 这种高度依赖特定方法的脆弱模型。

简而言之,这篇论文是一个警钟。它告诉我们,在 AI 世界中,一个解释的“真相”不仅取决于 AI 的大脑,还取决于我们用来观察它的眼镜。如果我们想在医疗等生死攸关的场景中信任 AI,我们需要确保无论戴上哪副眼镜,我们的解释都能经得起考验。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →