Memorization Dynamics of Fill-in-the-Middle Pretraining
本文研究了填中(FIM)预训练与标准从左到右目标在记忆动态方面的差异,揭示出尽管 FIM 在恢复短跨度或部分跨度方面表现优异,但其逐字回忆仍严重依赖前缀上下文,且随着数据重复次数的增加,记忆能力呈线性增长。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一名学生背诵一本长篇故事书。你想看看他们能多么准确地逐字复述故事的特定部分。通常,你是从头到尾、一个词接一个词地给他们读故事。这被称为**从左到右(LTR)**训练。
但还有另一种教学方法,常用于编程或填空练习。你给出段落的开头和结尾,让他们猜测中间的内容。这被称为**填中(FIM)**训练。
这篇论文提出了一个简单的问题:教学生“填补中间”是否会使他们背诵书籍的方式与教他们从头到尾阅读的方式不同?
研究人员设计了一项受控实验。他们选取了两个完全相同的 AI 模型(如同双胞胎),并教它们完全相同的书籍摘录。其中一个双胞胎学习“从头到尾阅读”的方式(LTR),另一个学习“填空”的方式(FIM)。它们将这些特定的书籍摘录重复 1 到 128 次不等,以观察重复次数如何影响记忆。
以下是他们的发现,辅以一些日常类比进行解释:
1. “长尾”与“稳步攀登者”
当研究人员要求模型仅从开头(前缀)开始复述一段文本时:
- LTR 双胞胎(从头到尾阅读者): 这个双胞胎就像一个人,只要听到足够多次,就能完美地背诵演讲。一旦跨越某个重复阈值,他们就能以极高的置信度复述长而精确的句子。他们拥有记忆的“长尾”——擅长长篇幅的完美复述。
- FIM 双胞胎(填空者): 这个双胞胎则有些不同。他们不太可能完美复述整个长句。相反,他们更擅长记忆较短的片段或部分匹配。随着听到文本的次数增加,他们的记忆增长得更加稳定和线性,但他们很少像从头到尾阅读者那样轻易达到“完美长句复述”的峰值。
类比: 想象试图记住一首歌。
- LTR 学生一旦听过足够多次,就能完美地唱出整个副歌,但如果你让他们从中间开始,他们可能会卡住。
- FIM 学生擅长哼唱几个小节,或者如果你给他们开头或结尾的提示,他们能认出旋律,但他们可能无法像 LTR 学生那样完美地唱出整整 30 秒的副歌。
2. 前缀的“锚点”作用
随后,研究人员在自然环境中测试了 FIM 模型:给它句子的开头(前缀)和结尾(后缀),让它填补中间部分。
他们发现了一个令人惊讶的现象:句子的结尾(后缀)帮助不大。
- 尽管 FIM 模型能看到句子的结尾,但它几乎完全依赖**句子的开头(前缀)**来记忆中间部分。
- 如果你将句子的真实开头替换为随机的、无关的句子,模型几乎会立刻忘记中间部分。
- 如果你将句子的结尾替换为随机的句子,只要开头是正确的,模型仍然能很好地记住中间部分。
类比: 把 FIM 模型想象成一名试图破案侦探。
- 前缀是犯罪现场的照片。
- 后缀是关于犯罪发生后情况的证人证词。
- 研究发现,侦探(模型)几乎完全依据犯罪现场照片来破案(记忆文本)。证人证词(后缀)虽然有帮助,但如果你拿走了照片,即使证人还在说话,侦探也会陷入迷茫。
3. 为何存在差异?
为什么“填中”学生会有这样的表现?
- LTR 训练: 每次学生听到故事时,视角都是一样的:开头 中间 结尾。这强化了一条特定的路径,使得对整个链条的记忆非常牢固。
- FIM 训练: 每次学生听到故事时,“中间”部分被切分的方式都不同。有时中间是前 10 个词,有时是接下来的 10 个词。这使得记忆变得分散。学生学会了从许多不同的角度识别故事的片段,但他们没有像 LTR 那样紧紧锁定单一、漫长且完美的链条。
结论
该论文得出结论:训练模型的方式会改变其记忆的方式。
- 如果你想要一个能复述长篇幅、精确文本的模型,从左到右训练更为强大。
- 如果你使用填中训练,模型在记忆短片段或部分匹配方面会变得更好,但它仍然高度依赖文本的开头来触发记忆。
研究人员还指出,如果你只通过一种特定的方式测试模型(例如只测试长句或只测试短片段),你可能会错过这些重要的差异。这就像仅通过鱼跳出水面时的表现来评判其游泳能力;你需要通过不同的方式测试它,才能了解其真正的本质。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。