← 最新论文
💻 computer science

Learned, Then Lost: A Measured Single-Example Counterfactual in Pre-training

本研究通过实证表明,尽管单个训练样本会被快速学习并对模型的即时预测产生可测量的影响,但其特定贡献会在预训练过程中完全衰减,使得在排除由不同随机种子引起的自然方差之外,该样本对最终模型的损失、权重或几何结构不再产生任何可检测到的长期影响。

原作者: Zachary Speck, Asa Shepard

发布于 2026-08-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Zachary Speck, Asa Shepard

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在人工智能的广袤领域中,研究人员通过向语言模型喂入海量的文本库来构建庞大的计算机程序。这些程序通过阅读数十亿个句子进行学习,通过一点一滴地调整其内部设置来预测序列中的下一个词。多年来,科学家们一直想知道一个单独的句子或一个特定的事实对模型的最终智能贡献了多少。这是一个关于因果关系的问题:如果你从训练库中移除一个微小的片段,最终的模型会发生变化吗?回答这个问题极其困难,因为标准的探测方法需要从头开始训练两次模型——一次包含该句子,另一次不包含——同时保持所有其他细节完全一致。由于训练这些模型需要耗费巨大的时间和金钱,研究人员通常依赖数学上的捷径来推测答案,而不是直接进行测量。

一个研究小组决定停止猜测,开始测量。他们设计了一个精确的实验,旨在观察将一段特定的文本插入语言模型的训练过程时会发生什么。他们构建了三十二个独立的模型,它们都从完全相同的随机起点开始。他们将每个模型都在大规模的互联网文本集上进行训练,但在过程中的一个特定时刻,他们进行了干预。对于其中的二十四个模型,他们用一段新的、由194个单词组成的段落替换了训练数据中的一行文本。他们以三种不同的方式进行了这种替换:一组接收了一段关于出现在其训练数据中的真实人物的精彩段落;另一组接收了一段关于并不出现在数据中的虚构人物的精彩段落;第三组则接收了一行随机的键盘字符。其余的八个模型作为对照组,没有接收任何替换,从而让研究人员能够将其结果与一个完美的孪生体进行比较。

研究人员正在寻找一种特定类型的模型内部结构变化。他们想看看模型对那单个句子的“记忆”是否会在其最终形态上留下永久的印记。他们追踪了这些模型在注入信息后继续学习数千步的过程。结果显示出一种迷人的学习与遗忘模式。就在模型看到新段落后的仅仅五十步之后,它预测该段落中单词的能力显著高于那些从未见过该段落的模型。这证明了模型确实从单次暴露中学习到了信息。然而,随着训练的继续,这种优势逐渐消退了。当模型完成训练时,预测该特定段落的能力已经消失,且那些见过该文本的模型与那些未见过的模型已无法区分。

当研究人员观察模型的最终状态时,他们发现这单个句子并未改变模型的根本行为或其理解通用语言的能力。他们测量了看到文本的模型与其孪生体之间最终设置的距离,虽然模型的内部设置发生了轻微移动,但并未进入新的领域。它们仍处于同一个“盆地”解空间内,这意味着它们在功能上仍然是相同的。研究人员还测试了段落内容是关于真实人物还是虚构人物是否会产生差异。他们发现没有可测量的差异;模型对待事实性故事和虚构故事的方式完全一样。甚至连造成较大初始扰动的随机字符,最终也稳定到了与其他模型功能上完全一致的状态。

这项研究强调了模型的内部数值变化与其实际行为变化之间的关键区别。研究人员发现,虽然单个句子引起了模型内部坐标的显著偏移——其移动幅度约为两个完全不同的模型之间相互移动幅度的百分之四十四——但它几乎没有改变模型的实际功能表现。模型在处理新的、未见过的文本时预测下一个词的能力保持不变。这表明这些模型的内部设置具有灵活性;它们可以在不改变最终输出的情况下进行显著的偏移。实验还揭示了测量时机的重要性。如果你在模型刚刚学习到一个事实后进行检查,你会看到一个强烈的效应;如果你等到训练完成后再检查,这种效应已经衰减。研究人员得出结论,对于单个样本而言,模型学习了它,使用了它,然后又将其释放,使得最终产物在很大程度上并未受到那孤立的数据片段的影响。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →