← 最新论文
💬 NLP

Stories in Space: In-Context Learning Trajectories in Conceptual Belief Space

本文提出,大型语言模型通过在低维、结构化的“概念信念空间”中进行导航来实现上下文学习,其中信念更新表现为几何轨迹,这些轨迹在模型行为与内部表征中均有一致体现,并可通过线性干预进行因果操控。

原作者: Eric Bigelow, Raphaël Sarfati, Daniel Wurgaft, Owen Lewis, Thomas McGrath, Jack Merullo, Atticus Geiger, Ekdeep Singh Lubana

发布于 2026-05-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Eric Bigelow, Raphaël Sarfati, Daniel Wurgaft, Owen Lewis, Thomas McGrath, Jack Merullo, Atticus Geiger, Ekdeep Singh Lubana

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个大语言模型(LLM),不要把它看作仅仅死记硬背事实的机器人,而要把它想象成一位正在大声朗读书籍的说书人。当说书人读到每一句新句子时,他们对情节、角色情感和场景氛围的理解都在发生变化。他们不仅仅是“知道”故事;他们还在不断更新自己关于“正在发生什么”的内在“信念”。

这篇题为《空间中的故事》的论文,试图精确描绘这位说书人如何更新他们的信念。作者提出了一个迷人的观点:模型不断变化的信念沿着一个特定的、低维的地图行进,这个地图被称为“概念信念空间”。

以下是他们发现的简要说明,使用了简单的类比:

1. 信念的地图(概念空间)

想象一个巨大的、看不见的三维房间,其中每一种可能的“感觉”或“想法”都有一个特定的位置。

  • 快乐可能位于右上角。
  • 悲伤可能位于左下角。
  • 愤怒可能位于两者之间的某个地方。

论文指出,当大语言模型阅读故事时,它的内在状态并不是随机地在各种想法之间跳跃。相反,它的内在状态沿着这张地图上的**平滑路径(轨迹)**移动。

  • 类比:把故事想象成一条徒步小径。当主角掉进一个坑里时,模型的“信念标记”会沿着地图滑向“悲伤”区域。当英雄救出生物时,标记又会滑回“快乐”区域。论文发现,这些路径并非混乱无序;它们遵循着结构化的、可预测的几何规律,就像河流流经山谷一样。

2. 硬币的两面(行为与大脑)

研究人员从两个角度观察了模型:

  1. 行为:当被问及“这个故事现在有多快乐?”时,模型了什么(例如,给出 7/10 的分数)。
  2. 内部表征:模型在处理文本时,其“大脑”内部实际发生的数学运算(即神经激活)。

发现:模型在“行为地图”(它所说的话)上走过的路径,与它在“大脑地图”(它的所思所想)上走过的路径几乎完全一致。

  • 类比:这就像观察一个木偶。论文发现,拉动木偶的线(内部数学运算)与木偶的实际动作(输出)是完美同步的。如果你能看到那些线,你就能准确预测木偶下一步会移动到哪里,反之亦然。

3. 用线性探针读取思想

作者使用了一种称为“线性探针”的工具。你可以把它想象成一个简单的翻译器

  • 他们表明,你可以查看模型“大脑”中任何时刻复杂且混乱的数学运算,并使用一个简单的线性方程(一条直线)将其翻译成对模型关于故事情感信念的预测。
  • 结果:这个翻译器效果极佳。这意味着模型的“信念”并非隐藏在某个不可穿透的黑箱中;它们清晰地写在模型的内部代码里,只待被读取。

4. 驾驭故事(遥控器)

这篇论文最激动人心的部分是,研究人员不仅观察了模型,还驾驭了它。

  • 类比:想象模型信念的路径是一辆在公路上行驶的汽车。研究人员发现,他们可以握住方向盘(通过调整内部数学运算),迫使汽车转向特定目的地,比如“快乐”,即使故事文本原本正朝着“悲伤”的方向发展。
  • 限制(驾驭的几何学):当他们把模型导向“悲伤”时,模型不仅变得更悲伤,还变得稍微更愤怒,且不那么快乐。
  • 为什么?因为在他们的“信念地图”上,悲伤和愤怒是邻居。如果你把模型推向悲伤,你不可避免地也会把它推向愤怒。论文发现,模型因这种驾驭而变得“困惑”的程度,完全取决于这些概念在地图上的距离。如果两个概念在地图上相距甚远,驾驭其中一个不会影响另一个。如果它们靠得很近,它们就会纠缠在一起。

主要主张总结

  1. 信念具有形状:当大语言模型阅读故事时,它们不断变化的信念沿着低维几何空间中的平滑、结构化路径移动。
  2. 思想与行动一致:模型的内部数学运算与其外部回答在这张地图上遵循完全相同的路径。
  3. 我们可以读取和书写信念:我们只需查看模型的内部数学运算,就能预测它相信什么,并且可以通过微调这些数学运算来改变它的信念。
  4. 几何法则:模型对变化(驾驭)的反应方式由概念在这张地图上的距离决定。在地图上“相邻”的概念会相互影响;而相距甚远的概念则不会。

简而言之,这篇论文认为,大语言模型不仅仅是在猜测;它们正在导航一个结构化的、几何化的概念景观,而我们现在可以看到这张地图,读取坐标,甚至驾驶这辆车。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →