← 最新论文
💻 computer science

When Do Concepts Become Functionally Sufficient During Language-Model Training?

本文引入了一个功能性框架,用于通过测试稀疏掩码激活是否能在跨层和跨检查点的干预中保留目标信息,来确定语言模型训练过程中内部概念何时变得充分,并揭示了尽管预测分布变化极小,下游掩码保留的软质量仍显著少于重构掩码。

原作者: Raphael Bernas, Paul G. Chevalier, Fanny Jourdan, Céline Hudelot

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Raphael Bernas, Paul G. Chevalier, Fanny Jourdan, Céline Hudelot

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

现代计算机通过将单词转化为庞大的数字云来理解语言。随着这些机器的学习,它们构建出内部结构,即组织信息以进行预测的数学路径层。多年来,科学家们一直试图窥视这些云团内部,以观察计算机究竟在思考什么。他们寻找可能代表诸如“礼貌”或“数学”等概念的具体模式。然而,发现一种模式并不等同于理解其用途。机器内部可能存在某种结构,但从未被用于做出决策,就像工具箱里放着一件从未被拿起来使用的工具一样。关键问题不仅在于模型内部出现了什么,而在于这些内部结构何时才真正对当前任务变得有用。

一个研究小组致力于通过观察这些内部结构从训练开始到结束的变化来回答这个问题。他们没有仅仅观察计算机模型的最终状态,而是将学习过程视为一部电影,在不同的时刻暂停,以测试机器的能力。他们提取了模型大脑的一个特定层,并试图分离出似乎携带重要信息的微小数字组。为了做到这一点,他们创建了一种“掩蔽”方法,就像在机器的内部活动上放置了一个半透明的屏幕。这个屏幕可以调暗或隐藏某些数字,同时让其他数字通过。随后,研究人员提出了一个简单而严谨的问题:如果我们遮蔽大部分活动,只保留由我们的屏幕选中的数字,计算机是否仍能做出与之前相同的预测?

该团队在七个不同的语言模型(从较小的系统到较大的系统)上测试了这个想法,并观察了随着模型学习,答案是如何变化的。他们比较了四种判断“有用性”的方法。首先,他们检查剩余的数字是否能简单地重建原始的数据云。其次,他们测试了一个简单的、固定的转换器是否仍能从剩余的数字中读取含义。第三,也是最重要的一点,他们检查了计算机的实际行为——即它对新文本的最终预测——是否保持不变。最后,他们测试了在训练早期阶段学到的概念是否仍能在训练的后期阶段被模型识别并使用。

结果揭示了一个关于这些机器如何学习的惊人真相。当研究人员试图让计算机的行为保持完全一致时,他们发现自己只需要保留极少的信息。事实上,为了保持模型实际的预测能力,他们只需要保留大约 6.6% 的内部活动。与仅仅重建原始数字所需的超过 70% 的活动量相比,这是一个极小的比例。这表明计算机存储了海量的信息,但只有其中非常特定的一小部分在进行决策时承担了主要的重任。其余的活动虽然存在,但似乎处于模型决策过程很大程度上忽略的方向。

研究还表明,这种“有用”的信息切片并非随机的。研究人员发现,模型依赖于进行预测的特定数字对它正在学习的任务高度敏感。这些数字集中在模型内部几何结构最弯曲的区域,这意味着在这些方向上,微小的变化会对最终答案产生最大的影响。研究人员还发现,这些有用结构出现的时机在很大程度上取决于特定类型的模型。对于某些模型,有用信息随着训练的进行变得稳定且清晰;而对于另一些模型,这些信息的位置会在网络的层级之间发生显著偏移。

或许最重要的一点是,研究人员发现模型学习使用这些概念的方式并非一条简单的直线。对最终预测有用的信息,往往与那些最容易观察或测量的信息不同。一个结构可能非常容易检测和描述,却对最终决策几乎没有任何贡献。相反,驱动模型行为的那极小部分信息,往往隐藏在复杂的模式之中,如果不使用这种特定的测试方法,很难将其分离出来。该研究得出结论:我们不能仅通过观察语言模型的内部结构来判断其成熟度。相反,我们必须衡量这些结构实际上做了什么。机器可能充满了噪声和未被利用的潜力,但它通过专注于一个极其微小、高效的核心活动来学习运作,而正是这个核心承载了其理解的重量。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →