← 最新论文
🤖 machine learning

Reliability, Faithfulness, and the Limits of Post-hoc Explanations of Opaque Scientific Models

本文认为,虽然可靠性和忠实性是解释科学机器学习模型的必要条件,但若没有外部佐证,仅凭这两者本身不足以验证关于底层现象真实结构机制的断言。

原作者: Nick Oh, Helen Jin

发布于 2026-06-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Nick Oh, Helen Jin

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

大局观: “黑盒”侦探

想象一下,科学家们正在试图理解一种复杂的自然现象(比如某种疾病是如何运作的,或者一颗恒星是如何燃烧的)。他们构建了一个超级智能的计算机模型(AI)来预测会发生什么。这个模型非常准确——它几乎每次都能得到正确答案。这就是可靠性(Reliability)

但这个模型是一个“黑盒”。我们不知道它是如何得出这些答案的。因此,科学家们使用特殊的工具(如 SHAP 或 LIME)来窥探内部,并询问:“你用哪些线索做出了那个决定?”工具会给出一个答案,例如:“模型观察了患者的年龄和皮肤颜色。”这就是忠实度(Faithfulness)

论文的核心观点:
作者认为,即使一个模型是完美可靠的(总是正确的)且解释是完美忠实的(如实反映了模型的行为),你仍然无法得出该模型确实理解了现实世界运作方式的结论。

你可以知道机器做了什么,但你不知道它做这件事的理由是否正确


三步链条

论文描述了科学家们经常尝试使用的一种逻辑链条,看起来如下:

  1. 现实世界(现象): 我们正在研究的实际事物(例如,真实的疾病)。
  2. 模型: 预测该疾病的 AI。
  3. 解释: 告诉我们 AI 在想什么的工具。

误区: 科学家们经常假设:

  • “模型匹配现实世界(可靠性)。”
  • “解释匹配模型(忠实度)。”
  • 因此: “解释匹配现实世界。”

论文指出: 这种逻辑是破碎的。这个链条缺少了一个至关重要的环节。


类比 1:作弊的学生 vs. 天才

想象一个正在参加数学考试的学生。

  • 可靠性: 这个学生每一道题都答对了。他们是正确答案的完美预测者。
  • 忠实度: 一名监考员观察着这个学生,并如实报告了学生的行为。报告显示:“学生通过观察题目编号的最后一位数字,并根据试卷中的某种模式来猜测答案。”

陷阱:
如果你只看可靠性(满分)和忠实度(监考员诚实的报告),你可能会想:“哇,这个学生掌握了一种解决问题的绝妙新方法!”

但实际上,这个学生只是在利用一个仅对这套特定试卷有效的“窍门”进行作弊。他们并没有学到数学(现象的结构);他们只是找到了一个恰好奏效的捷径。

论文认为,AI 模型经常会出现这种情况。它们找到了“捷径”(比如观察照片的背景而不是疾病本身),这些捷径让它们表现得很准确,但这些捷径并不是现实世界运作的方式。

类比 2:两座时钟

想象你有两座时钟。

  • 时钟 A 是一座高质量的真实时钟,其齿轮运动与太阳的移动相匹配。
  • 时钟 B 是一座坏掉的时钟,它恰好停在了太阳当前所在的时间点,但这仅仅是因为有人把它设定成了那个时间。

两座时钟都显示了正确的时间(可靠性)。
如果你拍下一张两座时钟内部的照片,你会得到对它们内部结构的忠实描述(忠实度)。

  • 时钟 A 的内部显示齿轮正在转动。
  • 时钟 B 的内部显示指针是静止的。

如果你只知道两座时钟都显示了正确的时间,并且拥有对它们内部结构的忠实描述,你仍然无法知道哪一座是真的在追踪太阳。其中一座仅仅是运气好。

论文指出,可靠性忠实度就像是检查时钟是否显示了正确的时间以及描述它们的内部构造。这两项检查都无法告诉你,时钟是否真的与太阳建立了连接(即真实的机制)。


“完美”的情景也无济于事

你可能会想:“如果模型是完美的呢?如果它从不出错呢?”

论文说:即便如此,也无关紧要。

想象一个能 100% 完美预测某种疾病的模型。

  • 场景 1: 模型学习到了真实的生物学诱因(“正确”的结构)。
  • 场景 2: 模型学习到了数据中一种奇怪的、不可见的模式(比如患者接受治疗的医院),这种模式恰好与疾病相关,但并不是病因。

这两个模型都是 100% 可靠的
这两个模型都有 100% 忠实的解释(准确告诉了你它们观察了什么)。

但在场景 2 中,尽管解释对于模型而言是真实的,但它对于疾病的成因来说是在撒谎。模型对结果是对的,但对原因是错的。

结论:我们到底能做什么?

论文得出结论:我们不能仅仅通过观察模型及其解释,就对现实世界是如何运作的(机制)做出强有力的断言。

  • 这个链条“能”做什么: 它可以提供想法假设。它可以说:“嘿,模型认为这个特征很重要。也许我们应该去现实世界中调查一下这个特征。”
  • 这个链条“不能”做什么: 它不能证明该特征确实是真正的诱因。

要了解真相,科学家需要外部帮助。他们需要引入其他知识、进行现实世界的实验,或利用现有的理论来验证模型的“捷径”是否真的是一种真实的机制。单靠模型和它的解释,不足以跨越“计算机是对的”与“我们理解了宇宙”之间的鸿沟。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →