Natural Ungrokking: Asymmetric Control of Which Rules Survive Pretraining
本文介绍了“自然去解构化”(natural ungrokking)现象,即语言模型在预训练过程中,由于训练语料库中支持规则的证据频率决定了规则的存续,从而自发地学习并随后突然遗忘特定规则,这一过程的特征是具有不对称控制性,即破坏规则很容易但恢复规则是不可能的。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
核心理念:学会规则,然后遗忘它
想象一下,你正在通过给一个非常年幼的孩子(AI 模型)读大量的书(训练数据)来教他说话。
在这个过程中间,这个孩子突然领悟了一个特定的语法规则:“如果句子提到了一个女孩的名字(比如‘苏’/Sue),那么接下来的代词应该是‘她’/she。” 孩子很快就掌握了这个规则。如果你问他:“苏哭了,因为……”他会自信地回答“她”。
但随后,奇怪的事情发生了。随着孩子继续读书,他完全忘记了这个规则。到训练结束时,如果你问同样的问题,他会猜“他”(这是大众通常会说的,即使对于女孩来说是错误的)。
这篇论文称之为**“自然性退化”(Natural Ungrokking)**。它是“顿悟”(Grokking,指模型突然理解了某物)的反面。在这里,模型学会了一个规则,使用了一段时间,然后默默地丢弃了它,尽管它所阅读的书籍中仍然包含这个规则。
谜团:为什么它会忘记?
通常情况下,当一个计算机模型忘记某事时,是因为数据发生了变化或数据消失了。但在这次实验中,数据从未改变。规则一直都在书里。
研究人员发现,决定因素是频率(某件事发生的次数)。
- 规则: “苏” “她”。
- 竞争者: 语言中的一种普遍习惯,即人们经常默认使用“他”作为猜测。
在模型阅读的特定图书馆中,“他”这种习惯出现的频率远高于“苏 她”这个规则。尽管规则仍然存在,但“他”这种习惯声量太大、太频繁,以至于淹没了规则。模型并没有“抹除”规则;它只是不再倾听规则,因为它在竞争中输给了“他”这个习惯。
实验:单行道
研究人员想看看他们是否可以控制这一点。他们把训练数据看作是一个可以调节的旋钮。
1. “关闭”开关(易于破坏)
他们拿了一个规则很强的图书馆,并开始翻转数据。他们把每一个“苏……她”的实例都改成了“苏……他”。
- 结果: 他们翻转的数据越多,模型忘记规则的速度就越快。这是一个从“完美”到“零”的平滑且可预测的下滑过程。
- 类比: 如果你不断告诉学生:“不,答案是 X”,即使书上写的是“Y”,学生最终也会不再相信书本,而开始相信你。
2. “救援”开关(无法恢复)
然后,他们尝试了反向操作。他们拿了一个已经忘记了规则的模型(因为正在阅读“他”占比很高的图书馆),并尝试“拯救”它。他们在数据中注入了海量的“苏……她”示例——其数量是维持该规则生存所需量的 300 倍。
- 结果: 什么也没发生。 模型仍然忘记了那个规则。
- 类比: 想象一个学生,因为老师教了一年,已经学会了“2+2=5”。如果你突然递给他一叠 1,000 本说“2+2=4”的教科书,他可能会感到困惑,但他不会改掉“2+2=5”的习惯。伤害已经造成;他们大脑中的“路径”已被铺设成了另一条路。
“为什么”:是位移,而非抹除
研究人员观察了模型的“大脑”(其内部数学逻辑)以查看发生了什么。
- 他们发现模型并没有失去理解句子结构的能力。它仍然知道如何处理单词。
- 相反,内部置信度发生了转移。模型对“她”的内部“投票”被更强大的“他”的投票所压倒。
- 这就像一个法庭。虽然“她”的证据还在那里,但“他”的证据变得如此响亮,以至于法官(模型)不再听取“她”这位证人的陈述。
总结
这篇论文教会了我们关于 AI 如何学习的三件主要事情:
- 训练中期的技能是脆弱的: 仅仅因为模型在训练过程中间学会了一个规则,并不意味着它会一直保留这个规则。
- 频率决定一切: 如果一个规则在数据中很罕见,它很可能会被更常见的竞争模式所碾压,即使该规则仍然存在。
- 容易破坏,难以修复: 一旦模型因为数据混合而“退化”忘记了一个规则,仅仅在后期重新加入该规则往往是无效的。“遗忘”对于那次特定的训练运行来说是永久性的。
简而言之: AI 模型就像是那些听从房间里最大声音的学生。如果“错误”的声音比“正确”的规则更响亮,学生就会学到错误的东西。一旦他们学会了错误的东西,事后对着他们大声重复正确的规则通常也无济于事。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。