✨ 要点🔬 技术摘要
想象一下,Transformer AI(例如驱动聊天机器人的那些模型)不仅仅是一个将文本转化为答案的“黑盒”,而是一个在广袤无垠、隐形的景观中行走的徒步旅行者 。
这篇论文提出了一种观察这位徒步旅行者的新方法。研究人员并没有在每一步都停下来询问:“你现在正在想哪个具体的词?”(这是大多数研究人员通常的做法),而是决定绘制出徒步旅行者从起点到终点的整个路径 。他们将这条路径称为“轨迹”(trajectory)。
以下是他们利用简单的类比,对这条路径形状的发现:
1. “磁铁”效应(语义收敛)
类比: 想象你把三个不同颜色的球(代表关于“狗”的三种不同句子)丢进一个漏斗。在顶部,它们彼此远离;随着下落,它们被拉向漏斗的中心,直到最后在底部聚集成一堆紧密的球。发现: 研究人员发现,当 AI 处理意义相似的句子时,它们的内部“路径”起初相距甚远,但在网络的中间和后期阶段,会逐渐向中心的一个点弯曲并汇聚。他们称这些点为“吸引子”(attractors)。这就像 AI 内部有一个内置的磁铁,随着思考的深入,它会将相似的想法拉拢在一起。
2. “蜿蜒之路”与“直线”(曲率)
类比: 想象两名驾驶员。
驾驶员 A 只是在改变汽车的颜色(例如,“猫”对比“狗”)。他开着一条完美、单调的直线。
驾驶员 B 正在解决一个复杂的谜题或数学题。他必须绕行、急转弯,并在一条蜿蜒曲折的路上行驶。发现: 论文发现,“蜿蜒之路”(高曲率)出现在 AI 进行复杂推理或类比时。“直线”(低曲率)则出现在 AI 仅进行表层词汇微调时。“路径的扭曲程度”是衡量 AI 思考难度的一个直接指标。
3. “岔路口”(歧义消除)
类比: 想象一名徒步旅行者站在一个岔路口。起初,他只是站在分叉处,不确定该走哪条路。随着走过几步,他开始慢慢向左边的路径靠拢,左边路径与右边路径之间的距离越来越大,直到两者相隔数英里。发现: 当 AI 遇到具有双重含义的词(例如,“bank”指河岸还是“bank”指银行)时,两种可能的含义起始于完全相同的位置。但随着 AI 处理句子的进行,路径开始分裂。在大约 20%–25% 的网络处理过程中,路径开始清晰分离,到最后,它们变得截然不同。AI 并不是瞬间做出决定,而是在旅途中逐渐锁定其中一种含义。
4. 旅程的三个阶段(三阶段结构)
类比: 这段旅程并非随机,无论使用哪种 AI 模型,它总是分为三个清晰的章节:
第一章:地图(编码): 徒步旅行者观察地形并确定自己的位置。路径的方向变化很快。
第二章:跋涉(阐述): 徒步旅行者在森林中部稳步前行。这是发生“磁铁效应”和处理难题时出现“蜿蜒之路”的地方。路径虽然稳定,但正在进行繁重的计算工作。
第三章:目的地(输出准备): 徒步旅行者看到了终点线,并调整步幅以准备停止。路径最后一次改变方向,为最终答案做准备。
他们如何证明这是真实的
作者并没有仅仅凭直觉猜测。他们运行了“对照实验”,以确保他们看到的现象并非幻觉:
如果他们打乱了层的顺序(就像打乱书的章节一样),这些模式就会消失。
如果他们使用一个权重随机、未经训练的模型(就像一个没有地图的徒步旅行者),这些模式也会消失。
如果他们随机分配单词的含义,这种“磁铁效应”也会消失。
核心结论
这篇论文认为,我们可以通过观察其旅程的几何形状 来理解 AI 是如何思考的。我们不需要在每一步都停下来询问 AI 在想什么。相反,我们只需要观察它路径的形状:
直线 = 简单任务。
蜿蜒之路 = 深度思考。
汇聚的路径 = 相似的想法汇合。
分裂的路径 = 在不同含义间做出选择。
这是一种新的视角,让我们能够观察智能的“流动”,而无需安装任何额外的工具或要求 AI 进行自我解释。
技术摘要:Transformer 表征的跨层轨迹几何学
问题陈述
当前对 Transformer 模型的机械解释性(mechanistic interpretability)主要运行在两种范式下:要么追踪特定的计算电路(例如,归纳头、MLP 层),要么针对预设的语言特征探测层级嵌入。这两种范式都将网络层视为独立的快照,忽略了表征在网络深度演进过程中所呈现的连续几何结构。本文旨在解决一个开放性问题:即理解 Transformer 表征是如何随层级演进的,而不仅仅是研究它们在静态点上编码了“什么”。
方法论
作者将 Transformer 的前向传播重新定义为高维表征流形(R d \mathbb{R}^d R d )中的离散种群轨迹(population trajectory)。受计算神经科学中种群轨迹分析的启发,本研究避免了使用降维技术进行度量计算,而是完全在全维度环境空间中进行操作,以避免投影伪影。
核心框架
轨迹提取: 对于输入序列,从每一层 l l l (从输入嵌入 h ( 0 ) h^{(0)} h ( 0 ) 到最终输出 h ( L ) h^{(L)} h ( L ) )提取隐藏状态。通过对非填充(non-padding)标记进行均值池化来获取序列级表征。
几何度量: 直接在 R d \mathbb{R}^d R d 中定义了五种度量指标:
轨迹长度 (L L L ): 跨越各层的总欧几里得位移。
曲率 (κ \kappa κ ): 相邻位移向量之间的转角;平均曲率 (κ ˉ \bar{\kappa} κ ˉ ) 衡量非线性程度。
语义收敛指数 (CI): 衡量语义相关提示词相对于无关提示词的压缩程度(D b e t w e e n − D w i t h i n D_{between} - D_{within} D b e tw ee n − D w i t hin )。
层级余弦相似度 (SIM): 相邻层之间的角度相似性,用于检测相位转换。
表征稳定性: 提示词与其词汇扰动之间的相似性,用以衡量表面形式的抽象程度。
实验设计:
模型: 三种仅解码器(decoder-only)家族(GPT-2 Small, TinyLlama-1.1B, Qwen2.5-1.5B)。
提示词: 150 个受语义控制的提示词,涵盖五个家族:语义类别、词汇变化、类比推理、多步推理以及歧义概念。
对照组: 四个严格的对照实验(随机标签、随机嵌入、打乱层级顺序、多种投影方法),以区分学习到的计算过程与几何伪影。
核心贡献
本文引入了一个轨迹几何框架 ,该框架具有无需探测器(probe-free)且与模型无关的特性。它定义了五种高维度量指标,用以刻画表征动力学,而无需依赖分类器或微调。作者发布了一个开源流水线,支持对任何因果语言模型进行此类分析。
关键结果
在所有三种架构以及针对对照组的验证中,研究报告了四个主要发现:
向吸引子盆地(Attractor Basins)的语义收敛: 语义相关的提示词在中间到后期的层级中经历了显著的收敛。收敛指数从早期接近于零的状态,在后期迅速上升至 0.41–0.58 的峰值(p < 0.001 p < 0.001 p < 0.001 )。这一效应在随机标签对照组中消失,表明这种吸引子式的动力学是由学习到的语义驱动的。
曲率作为复杂度读数: 推理和类比任务产生的轨迹比词汇变化任务具有显著更高的平均曲率。
推理(多步/类比):0.71–0.83 rad 。
词汇变化:0.27–0.31 rad 。
这种差异在不同模型中保持一致(p < 0.001 p < 0.001 p < 0.001 ),表明平均曲率编码了计算复杂度。曲率峰值出现在“计算拐点区”(约占网络深度的 20–45%),这与已知的归纳头和 MLP 检索层相吻合。
歧义作为轨迹分叉: 歧义标记(例如不同语境下的 "bank")表现出可测量的轨迹分叉。不同语境下的表征在第 0 层时几乎完全相同,但随着层级推进逐渐分离,并在最终层达到 5.6 倍的分离比 。这种分叉的起始点在不同架构中一致地出现在 ~20–25% 的网络深度处 ,表明存在一个通用的渐进式消歧时间表,而非瞬时解决。
通用的三阶段计算结构: 层级余弦相似度揭示了所有模型中一致的三阶段结构:
第一阶段(编码): 表征快速变化(低相似度)。
第二阶段(精炼): 相似度趋于稳定,与语义收敛和高曲率相对应。
第三阶段(输出准备): 相似度发生二次下降,表征向输出词表进行重新校准。 该结构在随机嵌入对照组下崩溃,证实了其是训练计算的结果。
意义与主张
本文认为 Transformer 的前向传播并非任意的状态序列,而是一个具有几何结构的流 。这项工作的意义在于:
无需探测器的解释性: 提供了一种无需预设特征或训练分类器的视角来分析模型行为。
连接动力系统: 将计算神经科学的概念(流形、吸引子、曲率)与深度学习联系起来,为表征如何演进提供统一视角。
具操作性的洞察: 研究结果表明,针对消歧或转向(steering)的干预应针对特定的轨迹阶段(例如,在分叉起始之前),而非任意层级。
普遍性: 这种几何模式在不同规模、架构和训练语料库的模型中表现出的高度一致性,表明轨迹的几何结构可能受语言本身结构的驱动。
作者对因果关系保持审慎,指出虽然几何结构与语义及计算属性相关,但本文建立的是相关性而非因果性。他们指出,通过激活补丁(activation patching)进行因果验证是下一步必要的任务。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。