← 最新论文
💬 NLP

One mechanism for many mental spaces: a shared router over a value slot in language models

本文表明,Transformer 语言模型通过一个共享的低秩路由器(该路由器从单个可重用的插槽中选择数值),实现了一种用于多种心理空间(如信念、虚构和反事实)的统一机制,而非为每种上下文类型采用不同的逻辑结构。

原作者: Oliver Steele, Jiangtao Wen, Yuxing Han

发布于 2026-07-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Oliver Steele, Jiangtao Wen, Yuxing Han

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,将语言模型视为一位超级组织有序的图书管理员,他不仅存储书籍,还在单座图书馆内存储着整个“世界”。在这个图书馆里,一朵花在“现实世界”部分可以是红色的,在“肖像画”部分可以是紫色的,而在“爱丽丝的梦境”部分则可以是绿色的。核心问题在于:这位管理员是将这些世界存储在规则各异、完全独立的魔法房间里吗?还是使用一套聪明且可复用的系统来处理所有这些世界?

这篇论文表明,管理员使用的是一套共享的系统来处理一切。

魔法标签与路由

将花的颜色想象成放在书架上的一条数据。论文发现,模型使用一个特殊的低秩“标签”(称为路由空间索引)来选择读取哪个世界。这个标签与数据本身是分离的。数据存放在一个被称为**数值槽(value slot)**的中性存储区,它持有颜色信息,但并不关心这个颜色属于现实还是梦境。

但是,当你问“肖像画里的花是什么颜色?”时,模型是如何知道该选哪种颜色的呢?它使用了路由。你可以将这个路由理解为一个智能的、具有因果可操纵性的索引。当你询问关于肖像的问题时,路由选择了“肖像画”设置,模型便从共享的数值槽中读取了紫色的花。当你询问关于现实的问题时,路由选择了“现实”,模型便读取了红色的花。

论文显示,这个路由并不是为每种类型的世界都准备了一台不同的机器。无论这个世界是信念(爱丽丝认为)、记忆(昨天)、假设(如果……)还是虚构(电影中的情节),模型使用的都是同一种类型的路由

一把钥匙开万把锁

研究人员通过这种方式进行了测试:训练模型仅控制一种类型的世界,比如“假设”(可能发生的事情)。然后,他们尝试将同样的控制机制应用于其他世界,如“信念”或“电影”。

结果如何?这个开关对所有情况都有效。

  • 当他们训练模型改变一个假设场景中的颜色时,同样的训练在处理关于“信念”的场景时,成功率达到了 71% 到 89%(取决于模型家族)。
  • 这表明模型并没有一个专门的、秘密的“信念机器”,其机制也与“电影机器”完全不同。相反,它拥有一个共享的路由来处理所有这些不同的语境。

它“不是”什么(被排除的想法)

论文非常谨慎地说明了这个系统不是什么:

  • 它不仅仅是记住单词: 模型并非只是记住了“红色”出现在“现实”附近,或者“紫色”出现在“肖像”附近。该系统实际上携带了一个关于语境本身的代码。
  • 它不是信念的独立房间: 形式逻辑通常将“信念”视为一个完全不同的、不透明的类别,其规则也会随之改变。但本文指出,从机械层面来看,模型将信念视为与其他空间相同的空间。在模型的电路中,“信念”标签并不特殊,也没有与“假设”标签分离。
  • 它不是静态的便利贴: 模型并不会把颜色写在永久的纸条上并留在那儿。相反,它更像是一个检索系统。当你提问时,模型会根据当前的“空间”设置回到源文本并重新读取颜色。这是一种“即时”读取,而非永久存储。

“报告”与“推理”的分离

这里有一个论文发现的有趣转折。模型拥有两条处理同一信息的路径:

  1. 报告路径(The Report Path): 这是模型大声说出来的内容。
  2. 推理路径(The Reasoning Path): 这是模型用于解决谜题的内容。

研究人员发现,他们可以分别控制这两条路径。他们可以训练模型说出“花是绿色的”(改变报告内容),同时仍让模型像处理“蓝色”的花一样去解决逻辑谜题(保持推理不变)。这证明了模型将“说什么”和“怎么想”存储在略微不同的部分,尽管它们都源自同一个源头。

构建新世界

当模型遇到像“爱丽丝过去相信杯子是蓝色的”这样复杂的句子时,它正在构建一个新的空间(结合了“过去”和“信念”)。论文显示,模型并没有为此构建一个全新的图书馆。相反,它复用了相同的数值槽(杯子的颜色),但铸造了一个全新的路由(一个新的索引设置),专门针对这个组合而成的新世界。这就像是拿出一本现有的书,为它贴上一个新的、临时的封面标签,而无需重写整个故事。

我们有多确定?

论文对其发现相当自信,但也提出了具体的限制:

  • 实验室验证: 结果基于对三个不同模型家族(Qwen、Pythia 和 Falcon3)内部“激活值”(即电信号)的直接测量。研究人员并非仅仅靠猜测,而是通过干预模型的代码来证明路由确实导致了行为的变化。
  • 并非万能药: 论文承认,虽然路由是共享的,但它并非对每种类型的世界都完全一致。例如,“绘画”或“电影”语境的行为有时与“信念”语境略有不同。此外,模型处理这些世界的能力是“检索型”的,这意味着它依赖于重新阅读文本,而不是持有静态记忆,这使得它在某些测试中表现出一定的“泄漏性”。
  • 规模效应: 这些机械细节是在较小的模型(30 亿参数)中发现的。然而,这种行为(处理这些世界的能力)在大型前沿模型(如 GPT-4o 和 72B 模型)中也被证实存在,这表明即使我们无法如此轻易地窥探这些巨型模型的内部,这种机制也会随着规模扩大而持续存在。

简而言之,论文表明语言模型拥有一个统一且可复用的“空间路由”,这使得它们能够利用相同的机械工具来驾驭现实、梦境、信念和电影,而不是为每一种想象力都准备一种不同的工具。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →