← 最新论文
🤖 AI

Gathered, Not Admitted: How Attention Brings a Latent Variable into Verbalizable Form

本文挑战了语言模型中潜变量访问的“准入门槛”假设,转而证明需求驱动的注意力机制是在特定的中层深度窗口内收集信息,以使变量变得可进行言语报告,而这一过程与该变量对最终答案的实际效用是截然不同的。

原作者: Parsa Mazaheri

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Parsa Mazaheri

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在现代语言模型那宏大而寂静的架构内部,存在着一个隐藏的信息世界,早在机器说出第一个词之前,这个世界便已存在。这些模型在海量的文本中进行训练,通过将语言、逻辑和事实的模式交织在一起,学习如何预测接下来的内容。当模型被问到一个问题时,它并不只是搜索数据库;它构建了答案的一个内部表示,即一个持有完成任务所需特定含义的潜变量。多年来,研究人员一直想知道这种隐藏信息是如何变得可见的。普遍的直觉曾暗示了一种简单的机制:信息始终在那里,停留在模型的内部记忆中,等待着一道门开启并将其释放。在这种观点下,模型就像一位图书管理员,书已经在书架上了,只需在被询问时决定递出来即可。

加州大学圣克鲁兹分校的一位研究人员着手测试使用名为 Qwen3.6 的大型语言模型来验证这种“门”的概念。他们设计了一系列实验,给模型提供完全相同的故事,但针对该故事提出不同的问题。在某些情况下,模型需要利用故事中的特定信息来解决谜题;在另一些情况下,它需要直接报告该信息;而在一个对照组案例中,它被问及一个不需要故事知识的问题。通过仔细测量模型在处理每一步时的内部状态,他们能够精确观察到隐藏信息是在何时以及如何变得对最终答案可见的。

他们的发现推翻了简单的“门”理论。隐藏信息并非静止在模型的记忆中等待被解锁。相反,模型主动从其内部流动的遥远部分收集信息,并将其传输到形成答案的具体位置。这种收集过程并非在所有地方或所有时间都会发生。它发生在模型处理层中一个非常特定的窗口内,大约在 64 层中的第 36 层到第 42 层之间。在该窗口之下,信息虽然存在,但无法在通往终点的旅程中幸存;而在该窗口之上,信息已经消失或被破坏。模型仅在任务确实需要时才会执行这种收集过程。当模型被问及一个不需要故事知识的问题时,收集过程几乎没有发生,其投入的精力比需要信息时少了七倍。

他们发现,这种传输几乎完全是由模型的注意力机制完成的,即系统中决定关注输入部分的那个部分。另一个主要组件——充当局部处理器的前馈网络——并没有帮助移动信息;事实上,在发生收集行为的中层,它反而积极地阻碍了传输。信息并非是从一个静态位置被揭开面纱,而是正在被物理性地移动,就像一名信使将包裹从仓库运送到送货卡车一样。这种移动是如此精准,以至于模型可以在中层将信息的集中度提高到其他任何地方的十七倍。

至关重要的是,他们表明模型内部状态中可见的信息量并不总是与其对最终答案的有用程度相匹配。他们发现,模型的三个不同部分可以使内部信号发生几乎相同的偏移,然而它们对最终答案的实际影响却相差七倍。这意味着,仅仅看到模型内部状态中存在强烈的信号,并不足以判断模型是否正在正确地使用该信息。信号的大小并不能完整说明模型的思考方式。

这项研究还揭示了这种收集窗口是模型设计的基本特征,它在包括一个具有 62 层的稠密架构在内的不同类型的模型中,都出现在相同的相对深度。他们证实了信息不仅是存在的,而且是因果必要的;如果他们阻断了中层的传输,模型就会无法正确回答。然而,他们也指出,这种收集虽然是必要的,但仅凭其本身并不充分;模型仍需进行其他计算才能产生最终答案。这项工作表明,模型并不拥有一个让信息坐等准入的静态工作空间。相反,它动态地组装所需的部件,仅在任务需要时才将它们移至到位,这一过程比此前想象的要活跃且具有选择性得多。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →