← 最新论文
💬 NLP

How Do Large Language Models Learn Concepts During Continual Pre-Training?

本文通过分析大语言模型的内部概念电路,研究了它们在持续预训练过程中如何获取、保留和遗忘概念,揭示了独特的时序学习模式、干扰效应以及迁移性动态,从而为开发旨在缓解遗忘现象的新型电路感知训练策略提供了动机。

原作者: Barry Menglong Yao (UC Davis), Sha Li (Virginia Tech), Yunzhi Yao (UCLA), Minqian Liu (Virginia Tech), Zaishuo Xia (UC Davis), Qifan Wang (Meta AI), Lifu Huang (UC Davis)

发布于 2026-08-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Barry Menglong Yao (UC Davis), Sha Li (Virginia Tech), Yunzhi Yao (UCLA), Minqian Liu (Virginia Tech), Zaishuo Xia (UC Davis), Qifan Wang (Meta AI), Lifu Huang (UC Davis)

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

人类通过将事物归类到心理范畴中来理解世界。我们看到一只长着毛发、有四条腿的动物,会立刻将其识别为“狗”,这个概念自带了一系列共同特征:它会吠叫、有尾巴,并且会奔跑。这种将具体的观察抽象为一般概念的能力是人类推理的基石。大型语言模型——那些能够写故事和回答问题的强大计算机程序——也试图进行类似的操作。它们在浩如烟海的文本中接受训练,被要求从中提取这些抽象概念并将其存储在内部系统中。然而,尽管我们知道这些模型可以学习,但我们一直难以准确理解它们是如何随着时间的推移保留这些知识的,或者为什么在面对新信息时,它们有时似乎会丢失这些知识。

多年来,研究人员一直试图窥探这些数字大脑的内部运作机制。有些人通过提问来测试它们是否记得事实,而另一些人则试图绘制计算机处理信息的特定路径。然而,这些方法往往只关注孤立的事实或静态的时刻。它们忽略了模型学习一个新概念、强化该概念,以及在被迫学习其他内容时可能遗忘该概念的动态过程。这种理解上的差距至关重要,因为当我们使用新数据更新这些模型时,我们需要知道它们是在真正构建对世界的稳定理解,还是仅仅在记忆那些会在下次更新时消失的模式。

一组研究人员致力于通过观察人工智能如何实时学习和遗忘特定概念来解开这个谜团。他们利用一个由虚构概念组成的数据集创建了一个受控环境。想象一下,正在教一个孩子关于一种叫做“Olre”的生物,它具有奔跑的能力,或者一种叫做“Foo”的生物,它有四条腿。因为这些生物在现实世界中并不存在,所以计算机没有任何先验知识。这使得科学家们能够从零开始观察学习过程,不受任何预设偏见的影响。他们用这些虚构的事实训练模型,然后向其引入大量的无关文本,以观察会对“Olre”和“Foo”的记忆产生什么影响。

他们的发现揭示了模型内部结构变化的清晰且可衡量的模式。研究人员发现,计算机并不仅仅是将一个事实存储在某个单一地点;相反,它会构建一个复杂的连接网络,即一个“电路”,来表示那个想法。通过分析这些网络的形状和密度,他们可以预测模型对一个概念的学习程度,以及它遗忘该概念的可能性。他们发现了一个令人惊讶的权衡关系:模型学习得最快、最牢固的概念,往往在有新信息到来时最容易被遗忘。似乎最初学习的强度本身反而让记忆在系统被迫重组时变得更加脆弱。

研究还揭示了不同想法之间是如何相互干扰的。当模型试图同时学习两个意义非常接近的概念时,它面临的困难比学习不相关的概念要大得多。这些相似想法的内部网络会发生重叠,从而造成一种类似于“交通拥堵”的情况,导致计算机无法轻易区分它们。相反,研究人员发现,学习一种类型的知识实际上可以帮助模型学习另一种知识。例如,教导模型关于事物的属性和功能,会使其随后更容易学习关于相似词与反义词之间的关系。这表明,信息的呈现顺序至关重要;某些课程可以作为其他课程的基础。

或许最重要的一点是,研究人员展示了这些内部模式不仅是抽象的观察结果,还可以用于改进模型本身。通过观察学习电路的形状,他们可以识别出哪些概念最容易被遗忘。随后,他们利用这一洞察力创建了一种简单的训练策略:每当模型学习新事物时,他们会偶尔暂停并复习那些最脆弱的具体概念。这种由内部结构引导的针对性复习,显著帮助了计算机保留其知识。这项工作表明,通过关注这些模型学习的内部架构,我们可以更有效地教导它们,帮助它们建立起一个更稳定、更可靠的世界理解,就像一个知道在考试前应该复习哪些笔记的学生一样。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →