← 最新论文
🤖 machine learning

A Geometric Perspective on Next-Token Prediction in Large Language Models: Three Emerging Phases

本研究通过将表征透镜重新用作几何诊断工具,以追踪跨层预测读出子空间的演变,揭示了大型语言模型通过三个不同的几何阶段处理下一个词元预测——即“种子复用”、“提升覆盖”和“焦点汇聚”——其中模型深度的增加主要增强了候选项的消歧能力,而非扩展表征容量。

原作者: Gianfranco Lombardo, Giuseppe Trimigno, Stefano Cagnoni

发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Gianfranco Lombardo, Giuseppe Trimigno, Stefano Cagnoni

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个大型语言模型(LLM)是一座巨大的多层工厂,一条信息(一个词)从底层一路传送到顶层。在每一层,一组工人在将包裹向上递送之前,都会往里面添加一点新信息。这篇论文解决的核心谜题是:工厂如何决定下一个输出哪个词,以及这个决定究竟发生在哪里?

作者们不仅询问模型在每一层“预测了什么”,他们还探究了预测结果在工厂机器内部的“位置”以及它是如何随着层级上升而移动的。

以下是他们发现的故事,被拆解为简单的概念和类比。

工具:“表征透镜”

通常,如果你窥视工厂的中间楼层,工人们似乎很困惑。他们手中握着一团混乱的可能性,如果你试图根据他们手中的东西来猜测最终的词,你会猜错。这是因为工人们以“叠加态”持有信息——就像魔术师手里拿着一副面朝下的扑克牌,所有牌都混在一起。

研究人员使用了一种名为表征透镜的特殊工具。你可以把它想象成一副魔法眼镜,能够旋转并聚焦工人的视野。这副透镜不再只是盯着那堆杂乱的牌,而是找到了一个特定的角度,让“获胜的牌”(正确的下一个词)变得可见,即使它被其他牌埋在下面。

发现:三幕剧

通过利用这些眼镜追踪“获胜的牌”如何在工厂中移动,作者们发现这一过程并非随机。它遵循一种严格的、三阶段的几何舞蹈,在他们测试的几乎每一个模型中都会发生(从 10 亿参数的小模型到 320 亿参数的大模型)。

第一阶段:“种子多路复用”(人群聚集)

  • 发生什么: 当信息进入工厂时,工人们开始同时抛出许多可能的下一个词。他们还没有选出获胜者。
  • 类比: 想象一个拥挤的房间,每个人都在喊出不同的想法。房间里充满了噪音,但“正确”的想法已经存在,只是混杂在数百个其他想法之中。
  • 几何特征: 工厂正在扩展其“秩”(即容纳多种不同想法的能力)。正确的词已经存在,但它只是合唱团中的一个声音。魔法透镜可以看到它,但它还不是最响亮的声音。

第二阶段:“提升覆盖”(静默过滤器)

  • 发生什么: 这是旅程中最长的部分(约占工厂高度的 60%)。工人们停止添加类型的想法。相反,他们开始悄悄调低错误想法的音量,同时调高正确想法的音量。
  • 类比: 想象控制室里的一位音响工程师。他们并没有引入新的歌手,而只是慢慢淡出背景噪音,并提升主唱的声音。主唱仍然被人群包围,但正逐渐成为清晰的焦点。
  • 几何特征: “秩”(活跃想法的数量)保持稳定。工人们的操作非常精确,进行着微小、几乎不可见的调整,这些调整不会改变房间的形状,但确实改变了被听到。这就是模型进行繁重工作的地方:消歧(确定众多候选项中哪一个是真正正确的)。

第三阶段:“焦点汇聚”(聚光灯)

  • 发生什么: 在最后阶段,工厂做出一个巨大而果断的动作。它将所有能量倾泻到一个单一方向上。
  • 类比: 音响工程师突然切断了房间里其他人的电源。聚光灯瞬间锁定在主唱身上。人群安静下来,歌手现在成了唯一重要的事情。
  • 几何特征: 工人们不再温和。他们做出巨大而有力的更新,这些更新与最终输出方向完美对齐。“秩”缩小了,因为他们将所有能量集中在唯一的获胜者身上。魔法透镜现在可以清晰地看到答案,无需任何帮助。

核心结论:更大的模型 = 更好的过滤器,而非更好的启动者

最惊人的发现是关于模型规模如何影响这一过程。

作者们发现,当你把工厂建得更大(增加更多楼层/层)时:

  1. 第一阶段(人群) 的大小大致保持不变。
  2. 第三阶段(聚光灯) 的大小大致保持不变。
  3. 第二阶段(静默过滤器) 变得长得多

隐喻: 如果你有一个小工厂,“过滤”房间很小。如果你有一个巨大的工厂,“过滤”房间就非常大。

这意味着,当我们构建更大、更智能的 AI 模型时,我们并不一定是在让它们更擅长开始拥有正确的想法或完成工作。我们是在给它们一个更大、更详细的房间,用来梳理混乱,并找出众多可能性中哪一个是正确的。大模型的额外能力主要用于候选项消歧——将一堆杂乱的“可能是这个,可能是那个”转化为一个单一的、自信的“是”。

总结

这篇论文揭示,下一个词元的预测并非在结束时突然闪现的顿悟。它是一个几何旅程:

  1. 种子: 将所有东西扔进混合体中。
  2. 提升: 悄悄过滤掉噪音(这就是模型变大的地方)。
  3. 汇聚: 以高能量锁定获胜者。

大型语言模型的“魔力”在于中间阶段,在那里,它们拥有足够的空间和时间,仔细地将信号与噪音分离开来。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →