← 最新论文
💬 NLP

Belief-reality separation lives in routing over a shared value slot in language models

本文指出,语言模型通过两种截然不同的机制将信念与现实分离:一个存储归属信息的共享价值槽(shared value slot),以及一个决定是从角色的信念还是客观现实中读取信息的查询-位置路由(query-position router),这种能力在多种架构中于 3B 到 7B 参数量之间涌现。

原作者: Oliver Steele, Jiangtao Wen, Yuxing Han

发布于 2026-07-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Oliver Steele, Jiangtao Wen, Yuxing Han

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,一个超级智能的语言模型就像一座繁忙的大型图书馆,故事正在其中实时地被书写和阅读。长期以来,我们一直好奇这座图书馆是如何将一个角色的“信念”与“现实”区分开来的。如果故事说:“安娜认为杯子是蓝色的,但实际上它是红色的,”那么当被问及安娜认为是什么颜色时,模型需要回答“蓝色”;而当被问及实际情况时,它需要回答“红色”。

这篇论文揭开了帷幕,展示了模型的“大脑”究竟是如何实现这一点的。事实证明,模型并没有使用两个不同的存储室来存放“真相”或“谎言”,而是使用了一个巧妙的两部分系统:一个通用文件槽和一个智能开关

通用文件槽

首先,模型记忆中有一个特定的位置,被称为“数值槽(value slot)”。你可以把它想象成桌子上的一张通用的便利贴。这张纸条并不关心是谁在看它,也不关心他们相信什么;它只是承载着“蓝色”这个信息。

研究表明,这个槽位通过两种不同的方式填充:

  1. 直接写入: 如果文本明确说“安娜相信杯子是蓝色的”,模型就会直接将“蓝色”写在这张便利贴上。
  2. 侦探式回溯: 如果文本说“安娜看到本把杯子涂成了蓝色”,模型就必须进行一些侦探式的推理。它需要回溯故事,看看安娜实际看到了什么,确定颜色是蓝色,然后将“蓝色”写在同一张便利贴上。

关键在于,便利贴本身没有任何标签说明“这是安娜的信念”或“这是事实”。它只是一个中性的容器,用来存放颜色。如果你更换了这张纸条上的颜色,它对“信念问题”和“现实问题”的答案改变程度是完全一样的。这张纸条只代表“是什么”,而不代表“是谁”或“何时”。

智能开关(路由器)

既然纸条是中性的,那么模型是如何知道该读取哪个版本的呢?这就是第二个机制发挥作用的地方:在提出问题的一瞬间,一个位于右侧的**路由器(router)**起到了作用。

想象一下,有一名交通警察站在图书馆的出门口。当有人问“安娜认为是什么?”时,警察会将开关拨向“信念”车道。当有人问“实际上是什么?”时,警察会将开关拨向“现实”车道。

论文证明,这两条车道是完全独立的。“信念”开关和“现实”开关就像两把不同的钥匙,可以打开不同的门。它们互不混淆。如果你尝试用“信念”钥匙去开“现实”之门,它几乎不起作用。这种分离专门发生在提问的那一刻,而不是在存放颜色的存储室里。

这种超能力何时出现?

研究人员测试了不同规模的模型,以观察这种能力何时产生。

  • 小型模型(30亿参数): 这些模型会感到困惑。它们通常只是重复最后听到的颜色(一种被称为“近因效应”的技巧),而不是追踪谁看到了什么。
  • 中型模型(70亿参数): 突然之间,这种能力便跃然而出。在30亿到70亿参数之间,模型学会了清晰地分离信念与现实。当达到70亿参数时,无论故事以何种顺序讲述,它们都能近乎完美地解决这些谜题。

这不是什么

这篇论文非常谨慎地排除了一些常见的猜测:

  • 它不是“真相”对“谎言”的标签: 模型并没有在颜色上盖上特殊的“信念”印章。无论是在表达信念还是表达事实,颜色“蓝色”的存储方式都是一样的。区别完全在于模型如何选择去“读取”它。
  • 它不仅仅是复制: 测试过程经过精心设计,使得仅仅通过复制最后提到的单词是无法完成任务的。模型实际上必须追踪谁看到了什么。
  • 它不仅仅是一个巨大的“信念大脑”: 研究表明,存储数值的部分与决定使用哪种视角的决策部分是不同的。

核心结论

简而言之,模型并没有一个“信念机器”和一个“现实机器”。它拥有一个用于存放数值的共享文件柜,以及一个根据问题决定打开哪个抽屉的智能开关。这种系统适用于不同类型的模型(如 Qwen、Mistral 和 OLMo),并且一旦模型规模足够大(约70亿参数),这种能力就会显著显现。

研究人员是通过交换模型内部代码的微小部分(例如交换便利贴或开关)并观察答案的变化来发现这一点的。他们确信这就是模型的工作方式,因为他们在三种不同的模型架构上进行了测试,并发现了相同的模式。虽然他们怀疑这种“槽位与开关”系统可能也适用于其他复杂的场景(如时空旅行故事或“假设”情景),但这篇特定的论文完全专注于“信念与现实”的分离。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →