← 最新论文
🤖 machine learning

Emergent Causal-Geometric Dynamics Across Depth in Large Language Models

本文综合了几何与因果视角,揭示了仅解码器大型语言模型中存在一种深度依赖的动态机制,其中从上下文处理到预测形成的急剧转变伴随着渐进的几何重组,表明晚期层中的角度结构编码了预测相似性而范数保持解耦,从而确立了有效干预需要理解网络涌现的全局动力学结构而非孤立层。

原作者: Shahar Haim, Daniel C McNamee

发布于 2026-05-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Shahar Haim, Daniel C McNamee

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,大型语言模型(LLM)并非一个神秘的魔法黑箱,而是一座多层工厂:一个原始想法从底层进入,而一个成品(即预测出的单词)从顶层离开。

长期以来,科学家们以两种不同的方式研究这座工厂,但尚未完全达成共识,认为这两种观点如何契合:

  1. 几何视角:他们观察数据在向上流动时的“形状”,注意到数据随着楼层升高而变得更加有序和抽象。
  2. 因果视角:他们试图在不同楼层“戳”一下数据,看看会发生什么。他们发现,戳动早期楼层会改变模型对输入的理解,而戳动后期楼层则会改变最终答案

本文将这两种观点联系起来。它揭示出,这座工厂实际上拥有两个截然不同的工作阶段,由一个清晰的转折点分隔。

第一阶段:“上下文处理”楼层(底部三分之二)

将工厂的底层楼层想象成研究与开发(R&D)团队

  • 他们做什么:当一句话传入(例如,“让我们做一些日历数学……")时,这个团队正忙于收集所有线索。他们审视单词、顺序以及整句话的含义。
  • 几何特征:在此阶段,数据是混乱且高维的。这就像一场混乱的头脑风暴,每一个细节都至关重要。
  • 测试:如果你尝试在此处“引导”模型(通过更改输入单词),它是有效的。但如果你试图在此处强行指定一个特定的答案,效果则不佳。模型仍在构思故事,而非撰写结局。

转折点:“交接”

在工厂的中间某处(大致是最后三分之一的层),存在一个急剧的切换。模型停止仅仅“思考上下文”,转而开始“决定答案”。

第二阶段:“预测形成”楼层(顶部三分之一)

顶层楼层是装配线

  • 他们做什么:研发团队已将完成的蓝图移交给这个团队。现在,工作纯粹是挑选下一个单词。
  • 几何特征(重大发现):这里正是本文有趣之处。科学家发现,这一顶层部分的数据会自我组织成一种非常具体的两部分编码:
    1. 方向(箭头):想象每一个可能的答案在空间中都有一个特定的方向。在这一顶层部分,数据指向的方向确切地告诉模型该选择哪个单词。如果数据指向“北”,模型就说“一月”。如果指向“南”,它就说“二月”。
    2. 大小(音量旋钮):数据向量的大小(或长度)承载其他信息——例如模型的置信度或关于特定句子的细节——但它并不决定选择哪个单词。这就像一个音量旋钮,可以让答案变大或变小,但不会改变答案是什么

“方向盘”实验

为了证明这一点,研究人员尝试了两种类型的“引导”:

  • 改变大小(音量):他们试图仅更改顶层数据中的“大小”来强制得出不同的答案。结果:无效。模型继续说出相同的单词,可能只是置信度更高或更低。
  • 改变方向(箭头):他们试图仅更改顶层数据中的“方向”。结果:完全成功!他们只需旋转数据的方向,就能立即将模型的答案从“一月”切换到“二月”。

核心结论

本文得出结论:你不能将人工智能视为一个大团块来理解或控制它。

  • 早期层关乎上下文。它们对输入单词敏感,但尚未关心最终答案的几何结构。
  • 晚期层关乎预测。它们使用特定的“方向编码”来决定输出。

类比
想象写信。

  • 底层是你收集想法、记忆和事实(上下文)。
  • 顶层是你手持笔的手。
  • 本文表明,要改变你写什么(预测),你不需要改变你的想法(数据的大小);你只需要改变你手移动的方向(角度几何)。

这解释了为什么之前一些控制人工智能的尝试会失败:人们试图改变“音量”(范数),或者观察“想法”(早期层),而他们本应引导的是“手”(晚期层方向)。本文提供了一张地图,精确指出了“方向盘”所在的位置。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →