← 最新论文
🤖 machine learning

When Are Two Networks the Same? Tensor Similarity for Mechanistic Interpretability

本文引入了“张量相似性”,这是一种对权重空间对称性具有不变性的基于权重的度量,能够高效地验证基于张量的神经网络之间的全局功能等价性,从而将机械可解释性从经验近似转化为已解决代数问题。

原作者: ML Nissen Gonzalez, Melwina Albuquerque, Laurence Wroe, Jacob Meyer Cohen, Logan Riggs Smith, Thomas Dooms

发布于 2026-05-15
📖 1 分钟阅读☕ 轻松阅读

原作者: ML Nissen Gonzalez, Melwina Albuquerque, Laurence Wroe, Jacob Meyer Cohen, Logan Riggs Smith, Thomas Dooms

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你有两个外观完全相同的机器人。它们行走、说话和解决数学问题的方式如出一辙。但如果你打开它们的胸膛,会发现内部齿轮的排列方式截然不同:一个的齿轮是垂直堆叠的,另一个则是水平展开的。

问题所在:
在人工智能领域,科学家们希望理解这些机器人(神经网络)究竟“如何”思考。这被称为“机制可解释性”。但这里有一个大难题:你如何证明两种截然不同的内部结构实际上正在执行完全相同的功能?

当前的方法就像是通过观察机器人行走来进行比较。

  • “行为”测试: 如果它们在特定路径上行走的方式相同,我们就假设它们是相同的。但如果其中一个机器人拥有一个秘密技巧,仅在尚未走过的路径上才生效呢?我们就会错过它。
  • “蓝图”测试: 如果我们仅仅比较蓝图(机器人内部的数值),我们可能会因为齿轮翻转就说它们不同,即使它们执行完全相同的任务。这就好比说两栋房子不同,因为一栋的厨房在左边,另一栋在右边,尽管房间的功能完全一致。

解决方案:“张量相似性”
本文的作者发明了一种比较这些机器人的新方法。他们称之为张量相似性

可以这样理解:他们不是查看蓝图或观察机器人行走,而是使用一面特殊的“魔镜”,直接审视机器人数学运算的“本质”。

  1. “魔镜”(对称不变性):
    想象你用黏土制作了一座雕塑。你可以挤压、拉伸或旋转它,但只要形状没变,它就是同一座雕塑。当前的方法在雕塑被旋转时会感到困惑。作者的新方法则忽略旋转,只关心函数的“形状”。如果两个机器人执行相同的数学运算,这种方法会给它们打出满分,即使它们内部的数值看起来截然不同。

  2. “X 光”(无需数据):
    大多数测试需要向机器人输入数千个问题,以观察其回答。而新方法不需要任何问题。它直接审视机器人的内部“大脑”(权重),并通过数学计算得出答案。这就像是一台 X 光机,无需让病人行走就能判断骨头是否断裂。

  3. “特殊机器人”(基于张量的模型):
    为了让这面魔镜发挥作用,作者必须使用一种略有不同的“黏土”来构建他们的机器人,即“张量”(具体而言是多线性模型)。这些机器人的运作方式与常规人工智能无异,但其内部数学结构经过特殊设计,使得这种特殊比较成为可能。这是一种权衡:你必须以特定方式构建机器人,才能获得这种超精准的比较工具。

他们的发现(实验结果):
团队在四种不同场景下测试了这一新工具:

  • “失忆”测试: 他们教机器人识别数字 0 到 4,然后加入 5 到 9。随后,他们试图让机器人忘记数字 9。旧工具无法分辨机器人“哪一部分”正在遗忘。而新工具则像激光一样直接指向负责数字 9 的特定“齿轮”,精确展示了记忆丧失发生的位置。
  • “顿悟”时刻(Grokking): 有时,人工智能在长期挣扎后会突然在某项任务上表现极佳。新工具显示,这并非突然的跳跃,而是机器人内部齿轮缓慢、连续的重组,而旧工具未能捕捉到这一点。
  • “秘密握手”(后门): 他们在机器人中植入了一个秘密触发器:“如果你看到黑色菱形,就将其称为 9。”机器人对正常图片的处理依然完美无缺,因此标准测试认为它没有问题。但新工具通过审视内部数学,即使在没有看到黑色菱形的情况下,也立即发现了这个“秘密握手”。
  • “语言”测试: 他们将此方法应用于语言模型(一种撰写文本的机器人)。当机器人学习新模式时,新工具显示出清晰、锐利的变化,而其他工具看到的则是一团模糊的混乱。

核心结论:
本文认为,要真正理解人工智能,我们需要一种能够比较其内部逻辑的方法,这种方法不应被数值的排列方式或输入的数据所迷惑。他们的新指标“张量相似性”正是做到了这一点,但目前它仅适用于特定类型的人工智能架构(基于张量的模型)。它将“这两个大脑是否相同?”这一混乱的问题,转化为一个清晰、可解的数学问题。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →