← 最新论文
💬 NLP

Information Abundance Paradox: Long-Context Training Undermines Parametric Knowledge

本文提出了“信息丰盈悖论”,证明了使用过长的上下文训练大型语言模型会削弱其将知识参数化内化的能力,导致其过度依赖上下文线索,并最终降低在需要无支持知识检索的任务中的表现。

原作者: Arda Uzunoglu, Benjamin van Durme, Daniel Khashabi

发布于 2026-08-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Arda Uzunoglu, Benjamin van Durme, Daniel Khashabi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个超级聪明的机器人如何写故事或解谜题。长期以来,科学家们一直认为最好的方法是给机器人喂食海量的书籍、代码和对话,希望通过阅读得越多,它就会变得越聪明。这就是大语言模型(LLM)的世界,也是当今驱动聊天机器人和写作助手的 AI 技术。大家一直在追求的一个核心理念是“上下文”(context):给机器人一个巨大的观察窗口。与其一次只读一句话,不如让机器人同时观察整页、整本书,甚至整个对话历史。人们的假设很简单:如果你在学习时给机器人提供更多的信息去观察,它以后使用这些信息的能力就会变得更好。这就像是在想,如果你学习时用一本更大的教科书,你自然就会成为一名更好的学生。

但如果那本教科书“太好用”了呢?如果因为答案就在你眼前,你在学习时,你的大脑决定不再需要记忆任何东西了呢?你可能会变得非常擅长在书中寻找答案,但如果有人在考试时把书拿走,你可能会完全不知所措。这正是约翰斯·霍普金斯大学的一个研究小组决定调查的棘手问题。他们想看看,在训练过程中给 AI 模型一个“超大尺寸”的阅读窗口,究竟是能帮助它们更好地学习,还是会无意中教会它们完全依赖眼前的即时信息,而不是构建自身的内部知识。

信息丰盈悖论

研究人员发现了一个他们称之为**“信息丰盈悖论”(Information Abundance Paradox)**的现象。这个名字听起来很高级,但其背后的理念其实很有趣,甚至有些反直觉。他们发现,当你用大量相关的丰富信息来训练 AI,并将其置于其“上下文窗口”(即它在学习时能看到的文本)中时,模型会停止尝试记忆事实。相反,它学会了仅仅去观察给定的文本并复制答案。

把这想象成一个学生在参加数学考试:

  • 旧方式(参数化知识): 学生努力学习,背诵公式并理解规则。当看到题目时,他们利用大脑中的知识进行解题。
  • 新方式(上下文处理): 学生被允许在学习时把教科书开在桌子上。他们意识到自己不需要背诵公式;他们可以瞬间翻到那一页并找到答案。他们成为了使用书籍方面的专家。

悖论在于,虽然这个“开卷考试”的学生在有书的情况下能拿到满分,但如果你把书拿走,他们就会表现得一塌糊涂。研究人员指出,通过在训练中向 AI 灌输过多的辅助性上下文,我们实际上是在无意中训练它产生“上下文成瘾”。它停止了构建强大的内在头脑,转而完全依赖外部文本。

证据:并非越大越好

为了证明这一点,该团队进行了一系列感觉像是科学魔术表演的实验。

1. 预训练实验(从零开始学习)
他们采用了小型 AI 模型,并在大量的书籍(Project Gutenberg)上对其进行训练。他们改变了模型在一次处理中能看到的“窗口”大小,范围从短短的 512 个单词到庞大的 32,000 个单词。

  • 结果: 起初,随着窗口变大,模型变得越来越聪明。但随后,奇怪的事情发生了。当窗口达到一定规模(根据任务不同,大约在 2,000 到 8,000 个单词之间)后,模型的表现反而开始变差了。
  • 类比: 想象一个学生起初使用一个小笔记本。他们必须记住所有内容才能做得好。然后他们得到了一个更大的笔记本,表现更出色了。但接着,他们得到了一卷巨大的、无限长的纸卷。突然间,他们不再记录任何东西了,只是盯着那卷纸看。当考试到来且纸卷被收走时,他们什么也记不住了。学习的“甜点位”(最佳平衡点)是在中间位置,而不是在最大尺寸处。

2. 微调实验(学习特定任务)
接下来,他们利用现有的 AI 模型来教授特定的学科,如法律、医疗和经济学。他们精确控制了在训练期间模型看到的“有帮助”文本的数量。

  • 结果: 当模型在拥有大量有益文档的训练下,如果再次提供这些文档,它们在回答问题方面表现得极其出色。但如果移除这些文档,或者如果文档包含误导性信息,模型就会崩溃。
  • 它们看到的辅助性上下文越多,它们的鲁棒性(稳健性)就越差。它们变得就像一个只有在有信号时才能完美工作的 GPS,一旦信号中断,它们就不知道如何通过观察地图或太阳来进行导航。

为什么会这样?“高效”的大脑

研究人员深入挖掘了 AI 的“大脑”,以观察底层发生了什么。他们发现了导致这种行为的两个主要原因:

1. 最省力的路径
学习是一项艰苦的工作。记忆一条规则并将其存储在你的大脑(模型的“权重”)中是需要消耗能量的。但如果答案就在文本中,那么直接查找就要容易得多。研究人员发现,当上下文丰富且有帮助时,AI 找到了一个“复杂度更低的解决方案”。这就像是找到了捷径。AI 意识到:“为什么要费劲去记忆‘取反位’的规则,我可以直接看这里的例子呢?”于是,它停止了记忆,转而开始观察。

2. 脑力分配的转移
他们还观察了 AI 的大脑中哪些部分在发挥作用。

  • FFNs(前馈网络): 可以将它们视为模型的“记忆库”,用于存储事实和规则。
  • 注意力模块(Attention Modules): 可以将它们视为模型的“眼睛”,用于扫描文本以寻找信息。
  • 发现: 当 AI 在长而有益的上下文中进行训练时,学习的“压力”发生了转移。更新过程不再进入记忆库(FFNs),而是完全进入了“眼睛”(注意力机制)。模型实际上是在重新改造自身,使其变得更擅长扫描文本,却变得更不擅长存储事实。

启示

论文指出,构建“无限上下文”模型(即能够一眼阅读整个图书馆的 AI)的竞赛,可能正在撞上一堵隐形的墙。这不仅仅是拥有更多数据或更大计算能力的问题。如果我们用摆在面前的过多信息来训练这些模型,我们可能会创造出一种极擅长阅读但极不擅长独立思考的模型。

研究人员并不是说长上下文模型不好。他们只是在提醒我们,这并不是一个简单的“越多越好”的问题。其中存在权衡。如果你想要一个在没有书本的情况下也能回答问题的模型,你可能实际上需要用较少的上下文来训练它,从而迫使它建立自己的内在知识。如果你只关心能够阅读文档并进行总结的模型,那么长上下文是非常棒的。但如果你想要一个即使在没有提供信息的情况下也能进行推理的真正智能助手,那么“信息丰盈悖论”提示我们,我们需要谨慎,不要让我们的 AI 对那本书产生过度依赖。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →