← 最新论文
🔢 mathematics

When Are AI Explanations Recoverable? Identifiability, Stability, and Transfer from an Inverse-Problem Perspective

本文通过将 AI 解释形式化为逆问题,建立了一个用于确定 AI 解释可恢复性的数学框架,推导出了线性与非线性系统下可辨识性与稳定性的完整三分法,并提供了能够区分内在欠定性与算法变异性的显式界限。

原作者: Chibuike Chiedozie Ibebuchi

发布于 2026-08-24
📖 1 分钟阅读🧠 深度阅读

原作者: Chibuike Chiedozie Ibebuchi

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在人工智能领域,衡量一个模型的标准通常是它预测未来的能力。如果一个系统能够准确预报患者的健康状况或股票价格,我们往往会信任其判断。然而,对预测的信任与对解释的信任是两回事。当模型做出决策时,我们通常想知道原因。它是依赖于某个特定的症状吗?它是否更看重某一个因素?这些解释旨在揭示机器的内在逻辑,充当其推理过程的窗口。然而,一个令人不安的现实存在着:两个不同的模型可以对每一个案例都做出完全相同的预测,却能为这些预测提供截然不同的理由。一个可能归因于某个特定特征,而另一个则完全忽略该特征,尽管两者都得到了正确的答案。这产生了一个根本性的谜题:如果可观测的行为是完全一致的,我们能否确定哪一个解释才是真实的?

这个问题处于一项新研究的核心,该研究并未将寻找 AI 解释视为一个改进软件的问题,而是将其视为一个物理学和几何学问题。研究人员 Chibuike Chiedozie Ibebuchi 来自摩根州立大学,他通过将此问题构架为一个“逆问题”来处理。在科学中,正向问题探讨当你按下按钮时会发生什么;而逆问题则追问,为了产生你所看到的这种结果,机器内部必须发生了什么。这项研究探讨了预测的“为什么”是否可以从预测的“是什么”中被唯一且稳定地恢复出来。作者发现,答案并非简单的“是”或“否”。相反,解释的可恢复性完全取决于模型所训练数据的数学形状。研究证明,对于某些类型的问题,答案就在眼皮底下;而对于另一些问题,无论投入多少计算能力,在数学上都是无法找到答案的。

研究人员开发了一种精确的方法来衡量解释的极限。他们设想了一种场景:两个 AI 系统如此相似,以至于它们的预测差异仅在于微乎其微、几乎不可察觉的程度。随后他们问道:这两个系统的解释会有多大差异?如果即使在预测几乎相同的情况下,解释也会发生剧烈波动,那么这种解释是不稳定的。如果即使在预测完全相同时,解释也可以完全不同,那么这种解释是无法识别的。该研究为这些状态划定了一条清晰的界限。它表明,只有当解释与模型实际能够“看到”的数据方向相一致时,解释才是可恢复的。如果解释依赖于模型无法看到的方向,那么解释就永远丢失了。如果解释依赖于模型能看到但只能隐约察觉的方向,那么这个解释在理论上存在,但在实践中由于对噪声过于敏感而变得毫无用处。

在处理线性模型(这在许多统计应用中很常见)的具体案例时,作者推导出了一个精确的公式,作为衡量这种不确定性的标尺。该公式将解释的稳定性直接与数据的几何关系联系起来。当数据特征高度相关时(即所谓的共线性情况),标尺显示解释会变得越来越不稳定。研究表明,随着数据点之间相关性的增加,解释的不确定性也随之增长,并在相关性达到完美时趋于无穷大。研究人员通过计算机模拟测试了这一理论。他们创建了一些场景,将数据关系从完全清晰调整到几乎无法分辨。在每种情况下,计算机的行为都与数学预测完全吻合。当数据表现良好时,解释是稳定的;当数据在不同维度上近乎一致时,解释发生了剧烈分歧,这证实了这种不稳定性并非软件的漏洞,而是可用信息的本质属性。

研究还探讨了当 AI 使用更复杂的非线性规则进行决策时会发生什么。人们可能会希望更复杂的模型能够理顺由混乱数据引起的困惑。然而,研究人员发现,复杂性并不能挽救丢失的解释。如果一段信息在最初就缺失于数据之中,那么任何程度的非线性扭曲都无法将其找回。研究证明,如果一个解释依赖于模型无法观测到的隐藏变量,那么非线性模型仍然无法识别它。解释依然像在线性案例中一样隐形。这一发现至关重要,因为它消除了这样一种观点:即更复杂的算法可以解决那些在本质上由数据无法确定的问题。

此外,该研究还探讨了“迁移”问题,即当数据发生轻微变化时,一个在某种情况下有效的解释是否仍能保持有效。作者发现,稳定性并不由数据的微小变化来保证。如果底层数据分布发生哪怕极其微小的偏移,曾经稳定的解释可能会突然变得无法恢复。这发生在数据偏移将问题推向信息丢失的边界时。研究提供了一个特定的条件,即“谱间隔”(spectral margin),必须维持这一间隔才能确保在从一个数据集转移到另一个数据集时,解释依然可靠。如果没有这个间隔,即使是数据的微小变化也会摧毁解释模型行为的能力。

这项工作最后重新定义了我们应当如何对待可解释人工智能。研究建议,我们不应立即寻找生成解释的最佳算法,而必须首先询问:寻找一个解释是否本身就是可能的?在信任一个特征归因或灵敏度评分之前,我们必须确定生成该评分所需的信息是否确实存在于可观测的预测之中。该研究将由算法选择引起的变异性与由数据本身引起的不确定性区分开来。它为判断一个解释性主张是由证据支持还是在本质上由于数据不足而无法确定,提供了数学基础。通过定义知识的边界,这项研究为建立对人工智能的信任提供了必要的基石,确保我们不会将一个稳定的算法误认为是稳定的真理。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →