← 最新论文
💻 computer science

Decomposing Prediction Mechanisms for In-Context Recall

本文引入了一个结合了连续上下文学习与离散联想记忆的新颖玩具问题,旨在证明 Transformer 模型采用了两种具有不同学习动态的不同机制:一种是早期出现的、与标签无关的用于延续序列的“贝叶斯式”预测器,以及另一种是后期出现的、依赖于标签的用于检索并恢复特定先前状态的机制。

原作者: Sultan Daniels, Dylan Davis, Dhruv Gautam, Wentinn Liao, Gireeja Ranade, Anant Sahai

发布于 2026-06-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Sultan Daniels, Dylan Davis, Dhruv Gautam, Wentinn Liao, Gireeja Ranade, Anant Sahai

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心思想:一个模型中的两个不同大脑

想象你有一个非常聪明的机器人助手。你给了它一个笔记本,里面记录了关于不同人物(我们称之为“系统”)的故事。有时故事是关于**爱丽丝(Alice)的,有时是关于鲍勃(Bob)的,有时又是关于查理(Charlie)**的。这个笔记本使用特殊的彩色括号来告诉机器人故事何时从爱丽丝切换到了鲍勃。

机器人的任务是阅读故事并预测接下来的发展。研究人员想要观察机器人是如何学习做到这一点的。他们发现了一些令人惊讶的事实:机器人并不是使用单一的思考方式。它会根据它正在尝试预测下一个词的情况,使用两种完全不同的“模式”或“大脑”。

实验设置:“草堆”游戏

为了测试这一点,研究人员创建了一个名为“草堆寻针”(Needle in a Haystack)的游戏。

  • 草堆: 一长串混合在一起的故事片段。一会儿是爱丽丝的故事,一会儿是鲍勃的,然后又回到爱丽丝,接着是查理。
  • 标签: 每个故事片段都以一个独特的“开启”标签(比如红色括号 [)开始,并以一个“结束”标签(比如红色括号 ])结束。
  • 测试: 机器人阅读整个草堆。然后,研究人员展示一个特定的“开启”标签(例如“鲍勃的括号”)并问道:“鲍勃的故事接下来会发生什么?”

两个“大脑”(机制)

研究发现,机器人通过两种截然不同的方法来解决这个谜题,这两种方法在训练期间的不同阶段被激活。

1. “标签阅读器”(第一个大脑)

  • 何时启动: 这个大脑在机器人的训练后期苏醒。
  • 工作原理: 它观察“开启”标签(红色括号)并说:“啊,这是鲍勃的故事!我记得笔记本前面提到的关于鲍勃的规则。”然后它利用这些特定的规则来预测新片段的第一个词
  • 类比: 想象你在参加一个派对。你看到一个名牌写着“鲍勃”。你瞬间想起:“噢,鲍勃总是讲笑话。”你利用这个记忆来预测鲍勃的第一句话。这就是联想召回(Associative Recall)

2. “模式跟随者”(第二个大脑)

  • 何时启动: 这个大脑在训练早期就已苏醒。
  • 工作原理: 它几乎完全忽略了名牌(标签)。相反,它观察刚刚读到的最后几个词并说:“基于刚才最后几个词的模式,下一个词应该是 X。”它使用一种“贝叶斯”风格的猜测(根据最近的历史进行概率预测)。
  • 类比: 你正在街上行走。你不需要知道那个人的名字就能猜出他下一步会做什么;你只需要观察他的脚步。如果他走得很快,你就猜他会继续快走。这就是模式预测(Pattern Prediction)

令人惊讶的发现:它们并不同时启动

最重要的发现是,这两个大脑的发展速度不同,并且使用机器人“电路”中不同的部分。

  • 模式跟随者(大脑 2)先学会。 机器人很早就变得擅长预测故事的第二、第三和第四个词。它之所以能做到这一点,是因为它仅仅观察前文的词,忽略了标签。
  • 标签阅读器(大脑 1)后学会。 机器人需要很长时间才能明白“开启”标签是解锁新故事第一个词的关键。

“相变”(Phase Transition):
想象一个电灯开关。在很长一段时间内,机器人很难预测标签后的第一个词。然后,在训练的某个特定点,它突然“啪”地一下拨动了开关,变得完美地能够预测第一个词。但预测第二个词的能力在此之前早已已经平稳运行了很久。

他们是如何证明的(实验)

研究人员对机器人进行了“恶作剧”,以观察它正在使用哪个大脑:

  1. “错误标签”恶作剧: 他们给机器人展示了一个属于“鲍勃”的标签,但实际内容却是“查理”的故事。

    • 结果: 机器人无法预测第一个词(因为它信任了错误的标签)。但它仍然能很好地预测第二个词(因为它只是在遵循单词的模式)。
    • 结论: 第一个词依赖于标签;第二个词依赖于模式。
  2. “混乱标签”恶作剧: 他们展示了一个笔记本中并不存在的故事标签。

    • 结果: 起初,机器人忽略了虚假标签,继续预测它正在进行的那个故事。但在训练后期,一旦“标签阅读器”大脑苏醒,机器人就会感到困惑,并试图根据那个错误的标签开始一个新的故事,尽管它是错的。
    • 结论: 机器人学会了过度信任标签,即使这些标签是胡言乱语。
  3. “电路断路器”测试: 他们物理性地“修剪”(切断)了机器人神经网络的部分。

    • 结果: 他们发现,用于预测第一个词的导线与用于预测第二个词的导线是完全不同的。它们是同一个身体里运行的两个独立的机器。

这在现实中的 AI 中存在吗?

研究人员检查了这种“双大脑”现象是否也会发生在真实的语言模型(如用于翻译的模型)中。他们发现了同样的情况:

  • 模型在擅长“继续”翻译(预测第二个词)之前,会先擅长根据提示“开始”一段新的翻译(预测第一个词)。
  • 这表明,即使是我们最先进的 AI 模型,也在通过多种不同的、独立的策略来完成同一个任务。

总结

这篇论文表明,当 AI 学习如何从上下文中召回信息时,它不仅仅是在“记忆”事物。它使用一种基于标签的策略来开始一个新任务(这需要很长时间学习),以及一种基于模式的策略来延续一个任务(它学得很快)。这两种策略如此不同,以至于它们生活在 AI 大脑的不同部分,并在不同的时间启动。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →