想象一下,大型语言模型(LLM)并非一个神秘的魔法黑箱,而是一座多层工厂:一个原始想法从底层进入,而一个成品(即预测出的单词)从顶层离开。
长期以来,科学家们以两种不同的方式研究这座工厂,但尚未完全达成共识,认为这两种观点如何契合:
- 几何视角:他们观察数据在向上流动时的“形状”,注意到数据随着楼层升高而变得更加有序和抽象。
- 因果视角:他们试图在不同楼层“戳”一下数据,看看会发生什么。他们发现,戳动早期楼层会改变模型对输入的理解,而戳动后期楼层则会改变最终答案。
本文将这两种观点联系起来。它揭示出,这座工厂实际上拥有两个截然不同的工作阶段,由一个清晰的转折点分隔。
第一阶段:“上下文处理”楼层(底部三分之二)
将工厂的底层楼层想象成研究与开发(R&D)团队。
- 他们做什么:当一句话传入(例如,“让我们做一些日历数学……")时,这个团队正忙于收集所有线索。他们审视单词、顺序以及整句话的含义。
- 几何特征:在此阶段,数据是混乱且高维的。这就像一场混乱的头脑风暴,每一个细节都至关重要。
- 测试:如果你尝试在此处“引导”模型(通过更改输入单词),它是有效的。但如果你试图在此处强行指定一个特定的答案,效果则不佳。模型仍在构思故事,而非撰写结局。
转折点:“交接”
在工厂的中间某处(大致是最后三分之一的层),存在一个急剧的切换。模型停止仅仅“思考上下文”,转而开始“决定答案”。
第二阶段:“预测形成”楼层(顶部三分之一)
顶层楼层是装配线。
- 他们做什么:研发团队已将完成的蓝图移交给这个团队。现在,工作纯粹是挑选下一个单词。
- 几何特征(重大发现):这里正是本文有趣之处。科学家发现,这一顶层部分的数据会自我组织成一种非常具体的两部分编码:
- 方向(箭头):想象每一个可能的答案在空间中都有一个特定的方向。在这一顶层部分,数据指向的方向确切地告诉模型该选择哪个单词。如果数据指向“北”,模型就说“一月”。如果指向“南”,它就说“二月”。
- 大小(音量旋钮):数据向量的大小(或长度)承载其他信息——例如模型的置信度或关于特定句子的细节——但它并不决定选择哪个单词。这就像一个音量旋钮,可以让答案变大或变小,但不会改变答案是什么。
“方向盘”实验
为了证明这一点,研究人员尝试了两种类型的“引导”:
- 改变大小(音量):他们试图仅更改顶层数据中的“大小”来强制得出不同的答案。结果:无效。模型继续说出相同的单词,可能只是置信度更高或更低。
- 改变方向(箭头):他们试图仅更改顶层数据中的“方向”。结果:完全成功!他们只需旋转数据的方向,就能立即将模型的答案从“一月”切换到“二月”。
核心结论
本文得出结论:你不能将人工智能视为一个大团块来理解或控制它。
- 早期层关乎上下文。它们对输入单词敏感,但尚未关心最终答案的几何结构。
- 晚期层关乎预测。它们使用特定的“方向编码”来决定输出。
类比:
想象写信。
- 底层是你收集想法、记忆和事实(上下文)。
- 顶层是你手持笔的手。
- 本文表明,要改变你写什么(预测),你不需要改变你的想法(数据的大小);你只需要改变你手移动的方向(角度几何)。
这解释了为什么之前一些控制人工智能的尝试会失败:人们试图改变“音量”(范数),或者观察“想法”(早期层),而他们本应引导的是“手”(晚期层方向)。本文提供了一张地图,精确指出了“方向盘”所在的位置。
技术摘要:大语言模型中跨深度的涌现因果 - 几何动力学
问题陈述
当前对大语言模型(LLM)的研究分裂为两种不同但往往互不关联的方法:几何分析与因果干预。
- 几何分析利用相似度、维度和曲率等指标,刻画令牌(token)表示在网络深度中的演变。虽然这些研究揭示了具有深度依赖性的结构化变化,但它们主要停留在相关性层面。它们描述了上下文是如何被编码的,但未能确定哪些具体的几何特征直接支配输出预测分布。
- 因果干预(机制研究)通过扰动内部状态来观察输出的变化。这些研究揭示了具有深度依赖性的功效分布(例如,某些干预在早期层比在晚期层更有效),但往往缺乏统一的表示框架。目前尚不清楚被操纵的表示在几何上是如何组织的,或者为什么干预在某些层成功而在其他层失败。
核心未决问题是:内部表示的几何结构如何随网络深度重新组织,从而因果性地塑造预测。具体而言,表示结构可以是描述性可访问且线性可解码的,但在生成输出时并不具有因果操作性。本文旨在通过定义“机制几何”来综合这些视角——即其结构直接与预测的因果控制相关的表示几何。
方法论
作者采用了一种集成方法,结合了几何分析与针对三种仅解码器(decoder-only)大语言模型的定向因果干预:Llama V3.1 8B、Mistral 0.3 7B 和 Qwen 2.5 7B。
1. 干预分析
该研究利用三个具有明确输入 - 输出空间的模块化任务:“月份”、“星期”和“时钟数学”。应用了两种主要的干预类型:
- 以输入为中心的干预:基于特定输入令牌表示之间的质心差异计算导向向量(VL)(例如,将“一月”的表示向“二月”偏移)。这些向量被添加到特定层中输入令牌的隐藏激活中。
- 以输出为中心的干预:基于与不同预测输出相关的最终令牌的隐藏表示之间的质心差异计算导向向量。这些向量被应用于最终令牌的激活。
- 指标:干预的功效通过模型在原始预测与目标预测之间对数几率(logit)偏好变化的程度来量化。
2. 表示分析
为了表征底层几何结构,作者使用WikiText-103数据集分析表示,重点关注:
- 维度:通过隐藏层激活的参与率(Participation Ratio, PR)测量有效维度。比较在“相同令牌”(不同序列中的最终令牌)和“非相同令牌”(序列末尾附近随序列变化的令牌)之间的差异。
- 几何编码:令牌表示之间的成对欧几里得距离和角度距离,与其对应输出预测分布的对称 Kullback-Leibler (KL) 散度进行相关性分析。
- 纯干预:为了隔离几何成分,作者执行“纯角度干预”(在导向前对向量进行归一化以仅保留方向)和“纯范数干预”(重新缩放向量以匹配平均范数)。
主要结果
1. 尖锐的深度方向转变
干预实验揭示了所有测试模型中双相计算结构的存在:
- 早期阶段(以上下文为中心):大约前三分之二的层对以输入为中心的干预具有选择性敏感性。在此处扰动输入令牌能有效改变预测。
- 晚期阶段(以预测为中心):大约最后三分之一的层对以输出为中心的干预具有选择性敏感性。在此处扰动最终令牌的表示能有效改变预测。
- 这种转变代表了从上下文处理计算向预测形成计算的过渡。
2. 表示几何的重组织
几何分析揭示了在过渡点之后表示空间的显著重组织:
- 维度:相同令牌在早期层显示出有效维度的扩张和随后的收缩,并在后期层趋于稳定。非相同令牌表现出更广泛的、多峰的维度分布,由令牌身份和上下文驱动。
- 角度与欧几里得编码:在以预测为中心的相(晚期层)中,出现了一种双分量几何编码:
- 角度结构:令牌表示之间的角度距离与其输出预测分布的相似性呈现强正相关。
- 范数:欧几里得距离与预测相似性基本解耦。欧几里得距离与角度距离之间的差异表明,向量范数编码了与预测机制正交的信息(令牌特定和上下文特定的变化)。
3. 角度编码的因果验证
通过纯干预证实了晚期层中预测由角度几何控制的假设:
- 角度干预:对最终令牌的纯方向性干预在以预测为中心的晚期阶段非常有效,但在早期阶段无效。
- 范数干预:纯基于范数的干预在所有层和所有干预类型中基本无效。
- 机制:作者提出,在最终层中,输出分布 p∝Softmax(WouthL) 依赖于 hL 的方向以决定相对对数几率值,而范数仅作为全局缩放因子(逆温度)起作用。因此,修改角度结构会直接改变预测身份。
主要贡献
- 视角的综合:本文统一了几何和因果方法,证明了虽然几何结构存在于整个网络中,但只有特定方面(晚期层中的角度组织)对预测具有因果相关性。
- 双相架构的识别:确立了明确的功能分离,即早期层处理上下文,晚期层形成预测,并以干预功效的尖锐转变为标志。
- 预测的机制几何:识别了晚期层中一种特定的几何编码,其中角度结构参数化了下一个令牌的分布相似性,而表示范数携带与预测解耦的信息。
- 驳斥可解码性即因果性:这项工作表明,可解码语义结构(线性可分性)的单纯存在并不意味着对预测具有因果相关性,这对以往干预文献中的假设提出了挑战。
意义与主张
作者声称,他们的发现提供了 LLM 如何将上下文转化为预测的机制性解释。其意义在于:
- 调和令人困惑的发现:解释了为什么干预具有深度依赖性,以及为什么角度相似性仅在特定上下文(晚期层)中与语义相关性相关。
- 对控制的启示:本文认为,不能孤立地理解或有效地干预逐层功能。有效的控制需要针对涌现的全局动力学结构,特别是晚期层的角度几何。针对易于解码特征(可能是基于范数的或早期层的)的干预可能无法泛化,或仅产生间接控制。
- 架构见解:结果表明,归一化方案(如 RMSNorm)可能为角度编码创造有利条件,其中方向比幅度成为预测更可靠的信号。
作者保持谦逊,指出这些发现基于特定的模块化任务和模型家族,早期层上下文几何与晚期层角度编码涌现之间的关系仍然是一个未解之谜。他们并未提出新的安全干预措施或部署策略,而是专注于提高对 LLM 计算的科学研究理解。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。