想象你有两个外观完全相同的机器人。它们行走、说话和解决数学问题的方式如出一辙。但如果你打开它们的胸膛,会发现内部齿轮的排列方式截然不同:一个的齿轮是垂直堆叠的,另一个则是水平展开的。
问题所在:
在人工智能领域,科学家们希望理解这些机器人(神经网络)究竟“如何”思考。这被称为“机制可解释性”。但这里有一个大难题:你如何证明两种截然不同的内部结构实际上正在执行完全相同的功能?
当前的方法就像是通过观察机器人行走来进行比较。
- “行为”测试: 如果它们在特定路径上行走的方式相同,我们就假设它们是相同的。但如果其中一个机器人拥有一个秘密技巧,仅在尚未走过的路径上才生效呢?我们就会错过它。
- “蓝图”测试: 如果我们仅仅比较蓝图(机器人内部的数值),我们可能会因为齿轮翻转就说它们不同,即使它们执行完全相同的任务。这就好比说两栋房子不同,因为一栋的厨房在左边,另一栋在右边,尽管房间的功能完全一致。
解决方案:“张量相似性”
本文的作者发明了一种比较这些机器人的新方法。他们称之为张量相似性。
可以这样理解:他们不是查看蓝图或观察机器人行走,而是使用一面特殊的“魔镜”,直接审视机器人数学运算的“本质”。
“魔镜”(对称不变性):
想象你用黏土制作了一座雕塑。你可以挤压、拉伸或旋转它,但只要形状没变,它就是同一座雕塑。当前的方法在雕塑被旋转时会感到困惑。作者的新方法则忽略旋转,只关心函数的“形状”。如果两个机器人执行相同的数学运算,这种方法会给它们打出满分,即使它们内部的数值看起来截然不同。
“X 光”(无需数据):
大多数测试需要向机器人输入数千个问题,以观察其回答。而新方法不需要任何问题。它直接审视机器人的内部“大脑”(权重),并通过数学计算得出答案。这就像是一台 X 光机,无需让病人行走就能判断骨头是否断裂。
“特殊机器人”(基于张量的模型):
为了让这面魔镜发挥作用,作者必须使用一种略有不同的“黏土”来构建他们的机器人,即“张量”(具体而言是多线性模型)。这些机器人的运作方式与常规人工智能无异,但其内部数学结构经过特殊设计,使得这种特殊比较成为可能。这是一种权衡:你必须以特定方式构建机器人,才能获得这种超精准的比较工具。
他们的发现(实验结果):
团队在四种不同场景下测试了这一新工具:
- “失忆”测试: 他们教机器人识别数字 0 到 4,然后加入 5 到 9。随后,他们试图让机器人忘记数字 9。旧工具无法分辨机器人“哪一部分”正在遗忘。而新工具则像激光一样直接指向负责数字 9 的特定“齿轮”,精确展示了记忆丧失发生的位置。
- “顿悟”时刻(Grokking): 有时,人工智能在长期挣扎后会突然在某项任务上表现极佳。新工具显示,这并非突然的跳跃,而是机器人内部齿轮缓慢、连续的重组,而旧工具未能捕捉到这一点。
- “秘密握手”(后门): 他们在机器人中植入了一个秘密触发器:“如果你看到黑色菱形,就将其称为 9。”机器人对正常图片的处理依然完美无缺,因此标准测试认为它没有问题。但新工具通过审视内部数学,即使在没有看到黑色菱形的情况下,也立即发现了这个“秘密握手”。
- “语言”测试: 他们将此方法应用于语言模型(一种撰写文本的机器人)。当机器人学习新模式时,新工具显示出清晰、锐利的变化,而其他工具看到的则是一团模糊的混乱。
核心结论:
本文认为,要真正理解人工智能,我们需要一种能够比较其内部逻辑的方法,这种方法不应被数值的排列方式或输入的数据所迷惑。他们的新指标“张量相似性”正是做到了这一点,但目前它仅适用于特定类型的人工智能架构(基于张量的模型)。它将“这两个大脑是否相同?”这一混乱的问题,转化为一个清晰、可解的数学问题。
技术摘要:用于机械可解释性的张量相似性
问题陈述
机械可解释性旨在将神经网络分解为有意义的组成部分,以理解其内部计算过程。该领域的一个关键先决条件是能够严格验证两个分解后的组件(或两个不同的模型)是否实现了相同的底层函数。当前的评估方法存在两个主要局限性:
- 经验/行为相似性:在特定数据集上比较模型输出或激活值的方法,对分布外(OOD)机制视而不见。它们无法检测仅在特定输入下触发的后门,或者如果分解依赖于近似启发式方法而非真实函数,则无法检测其泛化失败的问题。
- 基于参数的相似性:比较权重矩阵(例如矩阵余弦相似性)的方法对权重空间对称性(如置换和缩放)高度敏感。当模型以不同方式训练,或机制分散在多层而非集中在单个神经元时,它们无法识别功能等价性。
目前缺乏一种严格、独立于数据集的度量标准,该标准对上述对称性具有不变性,并能够捕捉全局功能等价性。
方法论
作者提出了张量相似性(Tensor Similarity),这是一种专为基于张量的神经网络(特别是双线性变换器等多线性模型)设计的基于权重的度量。该方法用多项式(多线性)架构替代标准的非线性激活函数,以实现对权重的代数分析。
核心架构转变
该方法依赖于多线性模型,其中激活函数被替换为乘法门控(例如双线性层和双线性注意力)。
- 双线性层:通过二次多项式将提升输入 x~=(1,x) 映射到输出:A(x)=D((Lx~)⊙(Rx~))。
- 多线性表示:这些层可以表示为权重张量 A 与 n 个输入副本的缩并:A(x)=A⋅in⊗nx~。
- 深度模型:深度多线性网络被构建为全局张量的树状结构分解,从而能够在不实例化指数级大的全局张量的情况下进行高效计算。
张量相似性度量
该度量定义为两个权重张量 A 和 B 之间的广义内积,并通过其诱导范数进行归一化:
simM(A,B)=∥A∥M∥B∥M⟨A∣M∣B⟩
其中 M 是度量张量。
为了确保该度量满足对称不变性和数据集独立性的标准,作者推导出了 M 的特定形式:
- 对称化:基于极化同构,作者确立了两个多线性模型在功能上等价,当且仅当它们的权重张量在对称子空间中具有相同的代表。该度量将张量投影到该对称子空间,以消除与输入置换对称性相关的自由度。
- 高斯度量:为了进一步细化度量并将其与行为相似性联系起来,作者利用标准高斯分布下的输入张量期望值(x∼N(0,I))来定义 M。使用Isserlis 定理,这产生了一个闭式度量,该度量计算整个高斯输入空间上的激活内积,而非采样数据集。
- 高效计算:一种基于 Gram 的递归算法允许通过逐层处理局部张量来计算深度网络的相似性,从而避免了实例化完整全局张量的需求。
主要贡献
- ** principled 基于权重的度量**:本文引入了一种对权重空间对称性(置换、缩放)不变且独立于输入数据集的度量。它通过检查两个模型是否实现了相同的多项式逻辑,正式验证了功能等价性。
- 闭式、无数据分析:与行为度量不同,张量相似性不需要采样数据。它在整个高斯输入空间上进行积分,使其能够检测标准性能度量无法察觉的分布外机制(如后门)。
- 定位能力:该度量可以“切片”以聚焦于特定的输出维度,或“差分”张量以隔离检查点之间的功能变化,从而允许将特定机制归因于特定输出。
- 可扩展性:递归算法确保该度量在计算上对深度网络是可行的,避免了与蒙特卡洛采样相关的指数级或二次收敛界限。
结果
作者在四个不同领域验证了张量相似性,证明了其优于现有度量(CKA、矩阵余弦、行为相似性):
- 灾难性遗忘(视觉):在 SVHN 上的渐进式训练设置中,当数据集减少时,张量相似性精确地定位了特定数字(例如数字'9')的知识丢失。它显示受影响类别的相似性急剧下降,而其他类别保持稳定,而行为度量则显示出模糊的信号。
- 顿悟(模运算):在模加法任务中,张量相似性追踪了模型向特定傅里叶频率的连续重组。它揭示了即使在准确率跃升至完美之后,结构重组仍在继续,这比单纯的准确率曲线提供了更清晰的训练动态视图。
- 后门检测(分布外):当在 SVHN 中注入后门(在黑色菱形补丁上触发)时,干净数据上的标准行为度量未能检测到变化。然而,张量相似性仅凭干净数据就标记了后门,并将变化定位到特定的受攻击类别('9'),证明了其检测分布外机制的能力。
- 语言建模:应用于在 The Pile 上训练的双层双线性注意力变换器时,张量相似性揭示了清晰的块结构和训练体制中的尖锐转变,而现有度量则模糊了这些特征。它比行为代理更有效地追踪复杂 n-gram 统计的形成。
意义与主张
本文将张量相似性定位为机械可解释性的基础工具。其主要意义在于将测量相似性和验证忠实性的问题从经验近似问题转化为一个已解决的代数问题。
- 忠实性:通过依赖多线性模型的代数性质,该度量确保分解捕捉到真实的底层函数,而非近似启发式方法。
- 鲁棒性:它通过应用于整个分布,提供了更强的鲁棒性主张,有效地排除了仅在特定输入(如后门)上触发的机制。
- 局限性:作者谦逊地承认,该方法目前依赖于多线性模型,这排除了大多数使用非多项式非线性函数的最先进架构。然而,他们辩称,多线性模型作为可解释性的重要测试平台,且有证据表明它们可以匹配标准架构的性能。
- 未来展望:这项工作表明,对多线性模型的限制是进行可行代数分析的必要权衡,但它为未来的归因方法(例如计算深度变换器中路径之间的相似性)铺平了道路,并支持了多线性架构比普通深度网络更具透明度的观点。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。