Transformers converge to invariant algorithmic cores
本文通过引入算法核心提取(Algorithmic Core Extraction, ACE)来证明,尽管权重配置各异,独立训练的 Transformer 仍会收敛于支配其行为的紧凑且不变的算法子空间,从而揭示了表象复杂性之下共享的计算结构,并为机械论理解与控制提供了一条新路径。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
核心思想:殊途同归
想象一下,你正试图从家里前往一家特定的咖啡馆。
- 驾驶员 A 走了一条经过郊区、然后是高速公路、最后是小巷的路线。
- 驾驶员 B 走了一条经过市中心、然后是公园、最后是桥梁的路线。
- 驾驶员 C 走了一条涉及渡轮和火车的完全不同的路径。
如果你观察他们的地图(他们行驶的具体道路),这些地图看起来完全不同。它们截然不同。然而,如果你观察他们实际在做的事情(即开车去咖啡馆这一行为),他们做的其实是完全相同的事情。
这篇论文认为,AI 模型(特别是“Transformer”)的工作方式也是如此。当我们训练两个执行相同任务的 AI 模型时,它们最终会拥有完全不同的内部“布线”(权重和参数)。但在深层内部,它们都在使用同一个隐藏的“引擎”来完成工作。
作者将这个隐藏的引擎称为算法核心(Algorithmic Core)。
问题所在:观察错了对象
通常,当科学家试图理解 AI 如何运作时,他们会研究单个模型的具体布线。这篇论文指出,这样做是有风险的。这就像是在研究驾驶员 A 的地图,并得出结论:“啊,所以为了去喝咖啡,你必须走那条小巷。”但这仅仅是驾驶员 A 路线中的一个偶然。驾驶员 B 并没有走那条小巷。
论文建议我们不应该只盯着具体的道路(即某次训练运行中混乱且独特的细节),而应该开始寻找不变性(Invariant)(即所有驾驶员共有的不变真理)。
解决方案:寻找“核心”
作者创建了一个名为 ACE(算法核心提取)的工具。可以将 ACE 想象成一副特殊的 X 光眼镜。
- 它过滤掉噪声: 它忽略了那些使一个 AI 区别于另一个 AI 的数百万个独特细节。
- 它寻找引擎: 它分离出一个位于 AI 内部的微小且紧凑的“核心”,这个核心对于完成任务是绝对必要的。如果你移除这个核心,AI 就会失效;如果你只保留这个核心,AI 仍能完美运行。
- 它证明了它们是相同的: 尽管这些 AI 在外观上看起来不同,但 ACE 表明它们在内部都隐藏着同一个数学“引擎”。
三个实验:从简单到复杂
论文在三种不同的场景下测试了这个想法:
1. 简单的谜题(马尔可夫链)
他们教了三个不同的 AI 一个简单的游戏:预测序列中的下一步。
- 结果: 三个 AI 学习时使用了完全不同的内部地图。它们的“布线”几乎完全不同。
- 核心: 但当 ACE 观察其内部时,它发现这三个 AI 都隐藏着一个微小的、三维的“核心”,执行着完全相同的数学运算。这就像是发现三辆不同的汽车引擎都使用了完全相同的三缸活塞排列方式,即使车辆的其他部分看起来各不相同。
2. “顿悟”(Grokking)之谜(模加法)
“Grokking”(顿悟)是一种奇特的现象,即 AI 在经历了长时间仅仅是记忆答案之后,突然从无法解决某个数学问题转变为完美解决该问题。
- 发现: 作者发现,就在 AI “顿悟”(突然理解)时,其内部形成了一个紧凑的、圆形的“核心”。这个核心就像一个时钟,通过旋转数字来解决数学问题。
- 反转: 如果你在 AI 学习之后继续训练它,这个核心会变得“臃肿”。它开始使用比实际需要更多的空间,充斥着大量冗余的相同数学运算副本。
- 教训: 论文发现,拥有许多冗余的解决问题的方法实际上有助于 AI 更快地学习。这就像是一个团队的人都在大声喊出同一个答案;最终,正确答案会更快地传达出来。
3. 现实世界(语言模型)
最后,他们观察了六个用于文本生成的巨大现实世界 AI 模型(如 GPT-2、LLaMA 等)。这些模型规模巨大且各不相同。
- 任务: 他们专注于主谓一致性(即知道句子需要用 "is" 还是 "are")。
- 发现: 在所有这六个庞大的模型中,都有一个单一的、不可见的“线”(一个一维轴)在控制句子是单数还是复数。
- 魔术技巧: 如果你拿起这条线并将其“翻转”(反转方向),AI 会立即开始犯语法错误。它会将 "The cat is" 变成 "The cat are"。
- 对齐: 尽管这些模型由不同的公司构建、在不同的数据上训练、且规模各异,但它们都使用这条完全相同的线来处理语法。这就像是每个人的大脑,无论文化或语言如何,都使用同一个神经开关来决定使用“我”还是“我们”。
为什么这很重要
论文得出结论:在 AI 混乱、复杂的表面之下,存在着一个更简单、共享的结构。
- 不要看漆面: AI 的特定颜色和形状(其参数)只是其如何被训练的偶然结果。
- 看引擎: “算法核心”才是真正的核心。它是无论谁来构建 AI 或如何构建 AI 都保持不变的部分。
通过寻找这些核心,我们可以更好地理解和控制 AI。与其试图修复一百万根细小的电线,我们只需要找到那个控制我们所关注行为的单一“开关”。
总结类比
想象三位建筑师正在建造房子。
- 建筑师 A 使用木材。
- 建筑师 B 使用砖块。
- 建筑师 C 使用钢材。
如果你观察材料,它们是完全不同的。但如果你观察楼梯的蓝图,你可能会发现,这三位建筑师都使用了完全相同的十级台阶设计,因为这是向上攀爬最高效的方式。
这篇论文说:“别再争论木头、砖块和钢材了。让我们来研究楼梯吧。”
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。