← 最新论文
🤖 machine learning

Instance-wise Linearization of Neural Network for Model Interpretation

本文提出了一种实例级线性化方法,该方法基于独特的激活模式,将神经网络的非线性前向计算重新表述为单次线性矩阵乘法,从而提供精确的特征归因,并揭示在监督和无监督学习任务中输入特征究竟是如何对预测做出贡献的。

原作者: Zhimin Li, Shusen Liu, Kailkhura Bhavya, Peer-Timo Bremer, Valerio Pascucci

发布于 2026-09-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhimin Li, Shusen Liu, Kailkhura Bhavya, Peer-Timo Bremer, Valerio Pascucci

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在现代世界中,人工智能已成为日常生活中一个沉默的伙伴,引导着从医疗诊断到贷款审批的各项决策。这些系统的核心是神经网络,即旨在像人类大脑从经验中学习一样,从数据中学习模式的计算机程序。这些网络由简单的处理单元层组成,这些单元负责传递信息,将原始输入转化为最终答案。多年来,这些系统一直非常高效,但对依赖它们的人们来说,它们在很大程度上仍是一个谜。当一个网络做出决策时,通常无法准确看出哪些信息片段最为重要,或者系统是如何结合这些信息得出结论的。这种缺乏透明度的问题已成为一个重大障碍,因为政府和科学家越来越多地要求这些自动化系统在承担关键任务之前,必须能够解释其推理过程。

现在,一组研究人员提出了一种方法,试图揭开这个“黑盒”的面纱,他们并非通过猜测系统如何思考,而是通过在特定时刻对其思维过程进行数学上的简化。他们的研究表明,虽然神经网络作为一个整体时极其复杂,但对于任何特定的单次预测,其行为其实是非常直接的。通过将单次预测视为一个独特的事件,研究人员发现,他们可以剥离网络的非线性复杂性,并在特定的局部区域内,将其整个决策过程重写为一个简单的直接计算过程。这种方法使他们能够精确观察每一项输入数据是如何对最终结果做出贡献的,从而将一个神秘的算法转变为一张清晰的因果关系图。

这一发现的核心在于对这些网络运作方式的一个简单观察。神经网络使用被称为激活单元的特殊组件来决定是否向前传递信号或停止传递。这些单元创造了非线性行为,这意味着输入与输出之间的关系不是一条直线,而这正是系统如此强大但也如此难以理解的原因。然而,研究人员注意到,对于任何单次预测,网络只会沿着一条特定的路径通过这些激活单元。一旦选择了这条路径,网络复杂的、蜿蜒的行为就会坍缩为一个线性过程。在这种特定情况下,网络不再进行复杂的、曲线式的决策;它只是简单地将输入乘以一组数字并加上一个常数值。

为了证明这一点,该团队开发了一种重写数据在神经网络中向前传递路径的方法。他们采用了用于计算机视觉的标准层(例如扫描图像边缘或形状的层),并展示了每一层都可以转换为标准的矩阵乘法。这包括扫描图像的卷积层、减少图像尺寸的池化层,甚至包括帮助深度网络学习得更好的跳跃连接(skip connections)。通过将每一个层都转换为这种线性格式,他们可以将所有层合并为一个巨大的方程。其结果是一个单一的公式,其中输入乘以一个巨大的权重矩阵并加上一个偏置项,从而产生输出。这个公式代表了该网络针对特定图像在其局部线性区域内的精确决策,揭示了每个像素对最终得分的具体贡献程度。

研究人员在几个著名的图像识别模型上测试了这种方法,包括那些用于识别手写数字以及汽车、动物等复杂物体的模型。他们发现这些网络在决策方式上存在一种令人惊讶的分裂。对于在基础数字图像上训练的较简单模型,公式中的主要计算部分承担了决策的几乎全部权重,而常数加项项则可以忽略不计。然而,对于在困难数据集上训练的更复杂的模型,常数项成为了主导力量。在这些先进的网络中,常数本身往往就能决定大部分的预测结果,而输入特征的详细计算所起的作用相对较小。这一发现挑战了人们的普遍假设,即网络的内部计算始终是其选择的主要驱动力,这表明对于许多现代系统而言,一个固定的偏差值(bias)正在发挥着举足轻重的作用。

这种看待神经网络的新视角提供了一个强大的工具,不仅能了解模型预测了什么,还能了解它是如何得出该预测的。由于该方法将决策分解为来自每个输入特征的直接贡献,因此它可以生成一张详细的地图,显示图像的哪些部分有助于网络确定特定标签,而哪些部分则起到了反作用。在手写数字实验中,研究人员展示了这张地图如何准确地突出显示了定义一个数字的笔画,例如数字“7”的环状部分或数字“1”的垂直线。与其他可能仅在猜测重要性的方法不同,这种方法是基于网络针对该特定图像的实际数学逻辑来计算每个像素的贡献,前提是网络使用了分段线性激活函数。

该技术的用途不仅限于简单的图像分类,还延伸到了无监督学习领域,在无监督学习中,网络被用于在没有人类标签的情况下组织数据。研究人员将他们的方法应用于一种称为参数化 t-SNE 的技术,该技术使用神经网络将高维数据压缩成二维地图以供人类观察。通常情况下,很难理解为什么网络会将两个数据点放在地图上的相近位置。通过应用这种线性化方法,团队可以追踪每个数据点在网络中的旅程,并观察哪些特征导致它落在特定的位置。他们发现,在地图上靠在一起的样本往往具有相似的特征贡献,但有时,看起来靠得很近的点实际上是由完全不同的内部原因驱动的,这种细微差别在传统的分析工具中是无法察觉的。

最终,这项工作提供了一个灵活的框架,可以在无需从头重建模型的情况下实现神经网络的去神秘化。通过认识到单次预测是在局部区域内的一个线性事件,研究人员表明,决策过程可以被重新表述为一个清晰的数学陈述。这并不意味着这些网络是简单的,而是意味着它们的复杂性可以在被暂停的同时,被逐步进行检查。无论是为了确保人工智能做出公平的决策,还是为了帮助科学家理解模型是如何看待世界的,这种方法都提供了一个直接观察机器逻辑的窗口,用精确的计算取代了推测。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →