在人工智能的广袤领域中,研究人员通过向语言模型喂入海量的文本库来构建庞大的计算机程序。这些程序通过阅读数十亿个句子进行学习,通过一点一滴地调整其内部设置来预测序列中的下一个词。多年来,科学家们一直想知道一个单独的句子或一个特定的事实对模型的最终智能贡献了多少。这是一个关于因果关系的问题:如果你从训练库中移除一个微小的片段,最终的模型会发生变化吗?回答这个问题极其困难,因为标准的探测方法需要从头开始训练两次模型——一次包含该句子,另一次不包含——同时保持所有其他细节完全一致。由于训练这些模型需要耗费巨大的时间和金钱,研究人员通常依赖数学上的捷径来推测答案,而不是直接进行测量。
一个研究小组决定停止猜测,开始测量。他们设计了一个精确的实验,旨在观察将一段特定的文本插入语言模型的训练过程时会发生什么。他们构建了三十二个独立的模型,它们都从完全相同的随机起点开始。他们将每个模型都在大规模的互联网文本集上进行训练,但在过程中的一个特定时刻,他们进行了干预。对于其中的二十四个模型,他们用一段新的、由194个单词组成的段落替换了训练数据中的一行文本。他们以三种不同的方式进行了这种替换:一组接收了一段关于出现在其训练数据中的真实人物的精彩段落;另一组接收了一段关于并不出现在数据中的虚构人物的精彩段落;第三组则接收了一行随机的键盘字符。其余的八个模型作为对照组,没有接收任何替换,从而让研究人员能够将其结果与一个完美的孪生体进行比较。
研究人员正在寻找一种特定类型的模型内部结构变化。他们想看看模型对那单个句子的“记忆”是否会在其最终形态上留下永久的印记。他们追踪了这些模型在注入信息后继续学习数千步的过程。结果显示出一种迷人的学习与遗忘模式。就在模型看到新段落后的仅仅五十步之后,它预测该段落中单词的能力显著高于那些从未见过该段落的模型。这证明了模型确实从单次暴露中学习到了信息。然而,随着训练的继续,这种优势逐渐消退了。当模型完成训练时,预测该特定段落的能力已经消失,且那些见过该文本的模型与那些未见过的模型已无法区分。
当研究人员观察模型的最终状态时,他们发现这单个句子并未改变模型的根本行为或其理解通用语言的能力。他们测量了看到文本的模型与其孪生体之间最终设置的距离,虽然模型的内部设置发生了轻微移动,但并未进入新的领域。它们仍处于同一个“盆地”解空间内,这意味着它们在功能上仍然是相同的。研究人员还测试了段落内容是关于真实人物还是虚构人物是否会产生差异。他们发现没有可测量的差异;模型对待事实性故事和虚构故事的方式完全一样。甚至连造成较大初始扰动的随机字符,最终也稳定到了与其他模型功能上完全一致的状态。
这项研究强调了模型的内部数值变化与其实际行为变化之间的关键区别。研究人员发现,虽然单个句子引起了模型内部坐标的显著偏移——其移动幅度约为两个完全不同的模型之间相互移动幅度的百分之四十四——但它几乎没有改变模型的实际功能表现。模型在处理新的、未见过的文本时预测下一个词的能力保持不变。这表明这些模型的内部设置具有灵活性;它们可以在不改变最终输出的情况下进行显著的偏移。实验还揭示了测量时机的重要性。如果你在模型刚刚学习到一个事实后进行检查,你会看到一个强烈的效应;如果你等到训练完成后再检查,这种效应已经衰减。研究人员得出结论,对于单个样本而言,模型学习了它,使用了它,然后又将其释放,使得最终产物在很大程度上并未受到那孤立的数据片段的影响。
技术摘要:“学而复失:预训练中一个样本的实测反事实研究”
1. 问题陈述
在大规模预训练中,确定单个训练样本对最终模型的具体贡献通常是通过数学估计(例如影响函数)而非直接测量来完成的。直接测量在成本上是难以承受的,因为这需要两次全量预训练过程,且除了其中一个 batch 中的一行数据外,其余所有方面都必须完全一致。本文旨在解决这一挑战,通过执行一次“真实的”单样本反事实实验,来测量特定的数据扰动如何影响最终模型的几何结构与功能,特别是测试一个流畅段落中的主体(subject)之“证实性”(即在语料库中的存在性)是否会改变模型的轨迹,并将其与具有匹配梯度影响的虚构主体进行对比。
2. 方法论
作者进行了一项受控实验,涉及 32 个从头开始在 OpenWebText 上训练的 GPT-2 模型(124M 参数)。实验设计采用了种子匹配的双生模型(seed-matched twin)方法,以隔离注入数据的影响。
实验设置:
- 规模: 4 种条件 × 8 个种子 = 32 次运行。
- 注入点: 总计 9,536 个步骤中的第 200 步,正处于峰值学习率(6×10−4)阶段。
- 干预: 将一个 256 行 batch 中的一行替换为一段固定的 194 个 token 的段落。
- 条件:
- 流畅-虚构(Fluent-Fabricated): 流畅的散文,其主体在训练语料库中不存在(Gizmo Harrington)。
- 流畅-证实(Fluent-Attested): 流畅的散文,其主体存在于语料库中(Jimmie Nicol,出现了 4 次)。
- 随机字符(Random-Chars): 随机键盘字符。
- 双生模型(Twin/Baseline): 未写入任何文本(标准的 batch 行)。
- 梯度匹配: 构造了使“流畅-虚构”和“流畅-证实”段落具有近乎相同的全量 batch 梯度增量(差值为 0.14%)的文本,以确保观察到的任何屏障或功能的差异不能归因于梯度更新的大小。
- 确定性: 在第 199 步之前,运行过程是位一致的(通过权重张量的 SHA-256 哈希值验证),并且在此之后是确定性的,从而确保注入后的差异完全归因于注入的那一行。
因变量:
- 主要变量(已注册): 插值损失屏障(Interpolation Loss Barrier,即运行结果与其双生模型最终权重之间线性弦的最大偏差)。
- 次要变量(已注册): 留出集交叉熵(Held-out Cross-Entropy,针对训练期间未见过的文本)。
- 探索性变量: 权重向量之间的欧几里得距离、每层中心化核对齐(CKA)以及注入段落本身的交叉熵。
3. 关键结果
即时学习与衰减:
- 注入的段落通过单次暴露即可被学习。在注入 50 步后(第 249 步),看到该段落的分支比未看到的双生分支预测效果显著更好(流畅-虚构提升了 0.0389 nats,流畅-证实提升了 0.0437 nats,p<10−4)。
- 到达最终步骤(第 9,535 步)时,这种预测优势衰减至不显著水平(p=0.25 且 p=0.71)。这种现象是“学而复失”。
插值损失屏障(功能分离):
- 研究发现,在“流畅-虚构”和“流畅-证实”条件下,插值损失屏障没有统计学上的显著差异。
- 结果: 平均差异 = +0.00680 屏障单位(p=0.509)。
- 敏感度: 可检测最小效应量(MDE)为 0.032。观察到的差异仅为 MDE 的 0.21,表明该设计具有检测 ≥0.032 效应的 80% 功效,但并未发现此类效应。
- 注入导致的屏障位移仅为种子间方差导致的屏障位移的 3.0%。
欧几里得距离(参数空间位移):
- 与屏障相比,注入运行与其双生模型之间的欧几里得距离非常显著。
- 结果: 注入运行位于种子间欧几里得距离的 44.1% 处。
- 这种位移在训练中期(第 5,049 步)基本稳定,达到了其最终值的 92%,而屏障在整个过程中保持较小。
- 作者指出,44.1% 这个数字是一个下限,因为种子间的欧几里得距离由于“规范自由度”(计算相同函数的旋转基底)而被夸大了,而注入并未引起此类旋转。
证实性 vs. 虚构性:
- 在任何指标(屏障、留出集交叉熵或欧几里得距离)上,均未发现“流畅-虚构”与“流畅-证实”条件之间存在可检测的差异。该设计无法将“证实性”与“真实性”区分开来,因为被证实的受体同时也是真实的主体,但梯度匹配确保了输入量级得到了控制。
时间动态:
- 注入运行与双生模型之间的逐步损失差异在第 300 步左右达到峰值(比注入后的即时低谷高出两个数量级),然后随剩余的 9,000 步缓慢衰减。
- 三种条件(虚构、证实、随机)追踪到了几乎相同的发散曲线,这表明在当前的设置下,内容的类型(流畅文本 vs. 噪声)并不会显著改变几何扰动的幅度。
4. 主张与意义
本文声称提供了一个直接、可测量的单样本反事实,超越了该领域通用的估计方法(如影响函数)。
- 位移 vs. 功能: 其主要贡献在于证明了:单个数据扰动可以引起参数空间巨大的位移(达到种子方差的 44%),同时引起微乎其微的功能分离(仅为种子方差的 3%)。注入操作是将模型在 其自身的损失盆地内 进行重新定位,而不是将其移动到新的盆地。
- 操作化方式至关重要: 作者认为,选择何种指标(欧几里得距离 vs. 损失屏障)会极大地改变对数据归因的解释。使用欧几里得距离作为影响力的代理可能会产生误导,因为它捕捉的是盆地内的任意运动和基底选择,而非行为变化。
- 影响力的衰减: 研究强调了归因是具有时间依赖性的。在注入后 50 步进行的测量能检测到强烈的效应,而在训练结束时进行的测量则检测不到。这表明针对已完成模型的估计器可能会错过虽然短暂但却显著的学习事件。
- 现有方法的局限性: 结果暗示,现有的归因工具(它们估计功能变化)可能会报告较小的数值,因为功能变化确实很小,即使参数变化很大。相反,依赖于权重位移的工具可能会高估一个样本的“重要性”,如果它们没有考虑到模型仍处于同一功能盆地内的这一事实。
论文结论较为谦逊,指出虽然特定的刺激对(一个被证实的受体 vs. 一个虚构的受体)不能推广到所有内容的真实性,但其核心发现——即参数空间位移与功能分离在单样本情况下可以相差一个数量级——是该规模训练动态的一个稳健特征。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。