All Circuits Lead to Rome: Rethinking Functional Anisotropy in Circuit and Sheaf Discovery for LLMs
本文通过证明多种结构不同且忠实可靠的电路可以共存,挑战了大语言模型功能依赖于独特内部机制的假设,引入了一种感知重叠的方法以揭示这些非规范解释,并提出了一个基于高维叠加的理论框架来解释这种固有的功能各向异性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是论文《所有电路皆通罗马》的解释,采用通俗易懂的语言和富有创意的类比。
核心理念:解决问题没有唯一的“正确”途径
想象一下,你让一个庞大且超级智能的机器人(大型语言模型)去解一道谜题。多年来,科学家们一直认为,在这个机器人的大脑内部,存在一条特定且唯一的线路与齿轮路径,正是这条路径促成了答案的产生。他们以为,只要找到了这条路径,就找到了机器人思考方式的“秘密配方”。
这篇论文指出,这种信念是错误的。
机器人并非只有一条秘密路径,而是拥有数十条截然不同的路径,它们都能导向完全相同的正确答案。这就像问:“你是怎么到达帝国大厦的?”却得到了三个不同的回答:
- “我坐地铁去的。”
- “我走楼梯上去的。”
- “我坐直升机去的。”
这三种说法都是真的。这三种方式都让人到达了目的地。但这些路径之间几乎没有共同之处。论文将旧有的信念称为“功能各向异性假说”(一种 fancy 的说法,意指“功能位于某个特定位置”)。作者们证明了这是错误的。
实验:寻找“隐藏的道路”
为了证明这一点,研究人员使用了一种名为**电路与层流发现(CSD)**的方法。你可以将其想象成一种关闭机器人大脑部分区域的方法,以此观察究竟哪些部分在真正发挥作用。
通常,科学家们只运行一次测试,找到一个“电路”(一组活跃的线路),然后说:“啊哈!这就是它的工作原理!”
作者们做了不同的尝试。他们在同一任务上运行了该测试20 次,但添加了一条特殊规则:“不要选择上次选过的线路。”他们迫使发现过程去寻找新的解决问题方式。
结果:
- 他们找到了 20 个不同的“电路”(线路组),每一个都完美地解决了任务。
- 这些电路彼此看起来毫无相似之处。它们使用了大脑的不同层级和不同的连接。
- 它们之间的重叠微乎其微(低于 5%)。这就像它们使用了完全不同的地图,却到达了同一个目的地。
“三边”的惊喜
研究人员将这一发现又推进了一步。他们试图找到最小的可能电路。他们发现了一个由仅三条边(连接)组成的“层流”(功能电路)。
起初,这看起来像是这三条边是“核心”——即绝对不可或缺的唯一要素。但当他们进行测试时,意识到:即使这三条边也不是严格必要的。
如果你移除这三条边中的一条,机器人仍然可以找到另一组三条边来完成任务。这就像一座城市,你以为某座特定的桥梁是过河的唯一途径,但当你关闭它时,交通会立即重新路由,完全通过另一组隧道和渡轮,而没有人察觉到任何差异。
为什么会发生这种情况?(“超位置”类比)
论文提出了一个解释这一现象的理论,称为分布密集电路假说。
想象机器人的大脑是一个巨大、拥挤的房间,里面挤满了正在同时交谈的人(神经元)。这被称为超位置。因为有如此多的人,以及如此多的组合声音的方式,所以有数百万种不同的“人群组合”可以说出同一句话。
- 旧观点: 必须有一组特定的人说话才能说出“你好”。
- 新观点: 有数千组不同的人群都可以同时以相同的音量和语调说出“你好”。如果你让其中一组人沉默,另一组人会立即站出来替你来说。
由于机器人如此庞大且复杂,它内置了冗余机制。它不依赖某一条脆弱的路径,而是依赖密集的竞争路径网络。
这对科学家意味着什么
这篇论文并没有说机器人坏了,或者我们无法理解它。它说的是我们需要改变解读发现的方式。
- 不要寻找“那个”电路: 当科学家发现一个电路时,他们不应该说:“这就是模型工作的唯一方式。”
- 寻找“一个”电路: 他们应该说:“这是模型工作的一种有效方式,在众多方式之中。”
总结
论文《所有电路皆通罗马》告诉我们,大型语言模型不像是一台拥有单一、独特引擎的机器。它们更像是一座拥有无限路线的巨大、灵活的城市。如果你封锁了一条道路,交通会找到另一条。不存在一张关于模型如何思考的单一“正确”地图;存在许多有效的地图,而它们都通向同一个目的地。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。