Understanding the Emergence of Seemingly Useless Features in Next-Token Predictors
该论文提出了一种通过分析梯度信号来解释 Transformer 中看似冗余的抽象特征(如世界模型和语法特征)如何从下一词预测目标中涌现的方法,并发现这些特征在预训练大语言模型中往往与代码等正式推理领域密切相关。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
这篇论文探讨了一个非常有趣的问题:为什么那些为了“预测下一个词”而训练的人工智能(大语言模型),会学会一些看起来对预测下一个词完全没用的“奇怪技能”?
想象一下,你正在教一个学生(AI 模型)做填空题。规则很简单:老师给出一句话的前半部分,学生必须猜出下一个字是什么。
1. 核心谜题:为什么学生要学“无用”的东西?
按理说,为了猜对下一个字,学生只需要记住“刚才说了什么”和“接下来最可能说什么”就够了。
但研究人员发现,这些学生(AI)不仅学会了猜字,还学会了:
- 下棋的局势(比如 Othello 棋盘的完整状态,哪怕有些棋子位置根本不影响下一步怎么走)。
- 语法的深层结构(比如句子的主谓宾关系)。
- 代码的逻辑(比如编程语言的缩进和结构)。
有些东西明明对“猜下一个字”毫无帮助,为什么模型还要费劲去学?这就好比一个为了猜谜而训练的学生,突然开始背诵整本字典的索引,或者在脑海里构建整个城市的地图,尽管猜谜只需要知道下一个词。
2. 揭秘:三种“学习动力”
论文提出,模型之所以学会这些“无用”的技能,是因为在训练过程中,有三种不同的“老师”在通过不同的方式给学生打分(梯度信号):
🟢 第一种动力:直接老师(Direct Learning)
- 比喻:这是最严格的老师。他只看你当下猜得对不对。
- 作用:如果你猜对了下一个字,他就给你加分。这是模型学习的基础。
- 局限:如果某个信息对猜下一个字没用,这位老师就不会给你任何反馈,模型也就学不到它。
🔵 第二种动力:预缓存老师(Pre-caching)
- 比喻:这位老师很有远见,他不仅看你现在,还看未来。
- 作用:想象你在写故事。虽然第 10 个字还没写,但如果你在第 2 个字时就埋下了伏笔(比如“他手里拿着一把红色的钥匙”),第 50 个字时就能顺利写出“他打开了红色的门”。
- 原理:为了把信息传递到未来(比如第 50 个字),模型必须在第 2 个字时就“预存”(Pre-cache)这个信息。哪怕第 3 个字不需要它,但为了第 50 个字,模型被迫在第 2 个字时就学会它。
- 结论:这就是模型学会“无用”技能的主要原因之一。它为了未来的任务,提前把信息存好了。
🟠 第三种动力:共享电路(Circuit Sharing)
- 比喻:这就像是一个共用的大脑皮层。
- 作用:模型的所有位置(第 1 个字、第 2 个字……)都使用同一套参数(大脑神经元)。如果模型在第 50 个字时学会了“红色钥匙”很重要,那么这套“大脑”在第 2 个字时也会顺便学会它,因为大家用的是同一套脑子。
- 结论:即使第 2 个字本身不需要这个知识,但因为第 50 个字需要,整个模型就“顺带”学会了。
3. 实验验证:把“老师”关掉
为了证明这一点,研究人员做了一些有趣的实验:
实验一:切断“预缓存”
他们训练了一个“短视”的模型,禁止它把信息传给未来的位置。- 结果:模型变得很笨,不仅猜字不准,而且完全学不会那些“无用”的技能(比如 Othello 棋盘的全局状态)。这证明了预缓存是模型学会复杂世界模型的关键。
实验二:切断“共享”
他们让模型的前半部分和后半部分使用不同的参数(就像把大脑分成两半,互不干扰)。- 结果:模型依然能学会一些技能,但那些需要跨位置协作的复杂技能(比如长距离的依赖关系)就学不好了。
4. 大模型的发现:代码是“预缓存”的产物
研究人员把这套理论应用到了真正的大模型(Gemma 2)上。他们发现了一个惊人的规律:
- 高“预缓存”度的特征:那些对“未来”影响很大的特征,往往与编程、数学、逻辑结构有关。
- 比喻:写代码就像下棋,每一步都严格依赖前一步,并且必须为后面的步骤做准备。模型为了处理代码,必须学会“预存”大量的逻辑结构。
- 低“预缓存”度的特征:那些只影响“当下”的特征,通常是简单的语法或日常词汇。
结论:大模型之所以能写代码、做逻辑推理,很大程度上是因为它在训练过程中,为了预测未来的词,被迫学会了“预存”复杂的逻辑结构。
总结
这篇论文告诉我们,大模型并不是一个只会机械预测下一个词的机器。
- 它像一个为了长远目标而提前布局的棋手。
- 它学会的那些看似“无用”的复杂技能(如世界模型、代码逻辑),其实是为了把信息传递给未来,或者是因为大脑的共享机制而顺带学会的。
这就解释了为什么 AI 有时候会表现出惊人的推理能力——因为它在训练时,为了“走得更远”,不得不先学会“看得更远”。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。