Everything, Everywhere, All at Once: Is Mechanistic Interpretability Identifiable?
本文通过对布尔函数和小型神经网络的实验,证明了由于系统性的不可识别性,唯一的解释往往是无法实现的,从而通过研究机械可解释性的可识别性,促使人们重新评估严格的唯一性对于有效的 AI 解释是否必要。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你拥有一个非常聪明、黑盒化的机器人,它能完美地解决一个特定的谜题。你想知道它是如何做到的。你不仅想知道它能做到,还想揭开幕布,看到让这种魔力发生的微小齿轮、杠杆和开关。这就是**机械解释性(Mechanistic Interpretability)**的目标:试图对神经网络(机器人的大脑)进行逆向工程,寻找一个简单的、人类可读的故事,来描述它是如何思考的。
这篇论文提出了一个非常简单却又深奥的问题:如果我们观察这个机器人以寻找它运作的故事,我们所有人都会找到完全相同的故事吗? 或者,两个不同的人观察同一个机器人,使用相同的规则进行调查,是否会得出两个完全不同但同样有效的故事?
作者说:不,我们无法保证有一个唯一的故事。 事实上,通常会有数十个、数百个甚至数千个不同的“故事”能完美地契合这些数据。
以下是他们研究结果的拆解,使用了简单的类比:
两种调查方式
论文研究了研究人员尝试寻找这些故事的两种主要方式:
“先找位置,再看内容”(侦探法):
- 核心思想: 首先,你试图在机器人内部找到一小组负责所有重活的神经元(一个“电路”)。一旦找到了这组神经元,你再尝试推测它们正在使用什么样的逻辑(例如:“哦,这三个神经元就像一个‘与’门(AND gate)”)。
- 问题所在: 想象你拥有一个巨大的图书馆。你想找到讲述某个故事的特定页面。你可能会找到一组完美的页面来讲述这个故事。但随后你会发现另一组完全不同的页面,它们也同样完美地讲述了这个故事。论文发现,对于一个简单的任务,有 85 个不同的神经元组合都可以完美地胜任这项工作。并不存在唯一的“正确”齿轮组。
“先看内容,再找位置”(建筑师法):
- 核心思想: 首先,你猜想一个简单的故事或算法(例如:“机器人一定是在使用一个‘或’门(OR gate)”)。然后,你扫描机器人的大脑,看看能否找到该故事正在上演的地方。
- 问题所在: 想象你正在一个庞大的管弦乐队中寻找一段特定的旋律。你可能会发现小提琴正在演奏这段旋律。但随后你意识到,大提琴也在同时演奏着完全相同的旋律,长笛也是如此。论文发现,对于一个单一的简单算法,机器人的大脑中有 159 个不同的地方可以完美地实现该算法。
“异或(XOR)”实验
为了证明这一点,作者训练了一个微小的、简单的机器人来解决一个经典的逻辑谜题——异或(XOR)(这就像一个灯开关,只有当两个按钮中的其中一个被按下时才会开启,但两个都按下时则不会)。
- 结果: 他们不仅仅找到了一个解释。他们发现了 超过 45,000 种不同的解释(电路与故事的组合),它们在数学上都是完美的。
- 类比: 这就像是在问:“面包师是怎么做出这个完美的蛋糕的?”
- 解释 A:“她在 X 号碗里使用了面粉、糖和鸡蛋。”
- 解释 B:“她在 Y 号碗里使用了面粉、糖和鸡蛋。”
- 解释 C:“她在 Z 号碗里使用了不同的混合材料。”
- 这些解释都是正确的。 蛋糕的味道是一样的,但你所指向的“机制”每次都是不同的。
为什么这很重要?
在统计学中,我们有一个概念叫做可识别性(identifiability)。这意味着如果你拥有数据,应该只有一组产生该数据的“真实”数值。这篇论文指出,对于 AI 的解释,可识别性失效了。
- “唯一真理”的迷思: 我们通常假设,如果我们挖掘得足够深,就会找到 AI 思考的那个“唯一真实的方式”。这篇论文说,这种假设很可能是错误的。AI 可能在同时以多种方式思考,或者可能有许多种描述其思考方式的方法,而这些方法都是同样正确的。
- 后果: 如果你请两位专家来解释同一个 AI,他们可能会给你两个完全不同的答案,而根据目前的科学规则,这两个答案都是正确的。
结论:我们该怎么办?
作者并不是说要“放弃”。相反,他们建议我们需要改变心态:
- 停止寻找“唯一的真理”: 我们可能需要接受可能并不存在唯一的解释。
- 关注实用性: 或许解释是否唯一并不重要。也许重要的是,这个解释是否能帮助我们预测 AI 下一步会做什么,或者帮助我们操控它去做我们想要的事。
- 使用多重检查: 如果我们真的需要确定,我们不应该只依赖一种方法。我们应该使用许多不同的测试,来看看一个解释是否能从各个角度都站得住脚。
简而言之: 论文认为,AI 思考的“指纹”并不是唯一的。有许多把不同的钥匙可以打开同一把锁,也有许多不同的地图可以描述同一个领域。我们不应该再期待一张单一且完美的地图,而应该开始接受这样一个事实:关于 AI 如何运作的“真相”,可能是一个由许多有效且重叠的故事组成的集合。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。