← 最新论文
💬 NLP

Inside the LLM Word Factory

本文通过激活补丁(activation patching)技术揭示了大型语言模型执行着一个两阶段的反分词(detokenization)过程——即注意力机制传输特定于 token 的信号,而 MLP 则将其与局部嵌入进行组合——该过程随位置编码的不同而在不同深度发生变化,从而使得基于早期层激活状态的探测能够高度准确地判断反分词是否成功。

原作者: Benzi Busigin, Yuval Pinter

发布于 2026-06-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Benzi Busigin, Yuval Pinter

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个庞大、超级聪明的工厂,名叫 LLM 单词工厂。它的工作是接收句子并理解它们,以便能够编写新的句子。但有一个限制:这个工厂不使用像“table(桌子)”或“error(错误)”这样的“人类词汇”。相反,它只理解子词片段(subword fragments),就像一个个小小的拼图碎片:_table

当你输入单词“table”时,工厂可能会将其视为一个整体(_table),或者将其拆分为两个部分(_ta + ble)。如果被拆分了,工厂就会遇到一个问题:它需要在大脑中将这些碎片重新粘合在一起,才能理解“桌子”这个完整的概念,否则它就无法进行后续有用的工作。这个粘合过程被称为去标记化(detokenization)

如果工厂未能成功粘合这些碎片,它就会感到困惑。它可能会认为“table”只是独立的“ta”和“ble”,从而导致奇怪的错误。

这篇论文就像是一群侦探,使用一种特殊的“时空显微镜”(称为激活修补/activation patching)来窥视工厂内部,观察这种粘合过程究竟是如何以及在哪里发生的。以下是他们的发现:

1. 两步走的组装线

侦探们发现,工厂并不是一次性把碎片粘合在一起的。这个过程是在组装线的起始阶段(在计算机模型的最初几层)以一种非常特定的两步舞步完成的:

  • 第一步:信使(注意力机制/Attention)
    想象第一个拼图碎片(_ta)上附带着一张小纸条。一个特殊的信使(称为注意力机制)捡起这张纸条,并把它飞送到第二个碎片(_ble)那里。

    • 限制: 这张纸条并不是一张完整的图像。它只是一个微小的、微弱的“推力”或暗示,说:“嘿,我是某个特定单词的一部分。”这就像邮递员投递了一封只写着“包裹即将送达”的单字信件。
  • 第二步:建筑师(MLP)
    一旦第二个碎片(_ble)收到了那张小纸条,一位建筑师(称为 MLP)就会介入。建筑师会将局部碎片(_ble)与来自信使的微弱提示结合起来。

    • 魔力所在: 建筑师不仅仅是把它们卡在一起;他们会将它们平滑地融合,从而创造出“table”这个完整且统一的概念。

2. 组装线需要多长?

论文发现,这种两步走的舞步发生得非常快,通常发生在前 1 到 10 层

  • “RoPE”工厂: 一些工厂使用一种特定的地址系统(称为 RoPE)。在这些工厂中,粘合发生得极快,通常仅在最初的 1 或 2 层。这就像是一个拥有超高效传送带的工厂,碎片几乎瞬间就能相遇。
  • “学习型”工厂: 其他工厂使用不同的地址系统(Learned Absolute)。在这里,粘合过程会持续更久,延伸到 5 到 10 层。这就像是一个较慢的传送带,碎片在完成粘合之前需要走得更远。

3. 那么更长的单词呢?

如果一个单词被拆分为三个或四个碎片(例如 _an + ti + ci + pa + tion)会怎样?
论文发现,工厂使用了一种接力赛策略。

  • 第一块碎片将接力棒传给第二块。
  • 第二块传给第三块。
  • 第三块传给最后一块。
    每一个中间碎片都充当了一个接力站,将“推力”向下传递,直到到达终点,在那里完成最后的粘合。单词越长,需要的接力站就越多,但过程依然相同。

4. 我们能预测失败吗?

最令人兴奋的发现是,工厂在过程的极早期就会留下“烟雾信号”。

  • 如果粘合将会成功,早期的层级看起来会有某种特定的样子。
  • 如果粘合将会失败,它们看起来则不同。

研究人员构建了一个简单的检测器(一个探针),它可以观察工厂最初的几层,并以 94% 到 97% 的准确率预测该单词会被正确理解还是理解失败。这就像是一位质量控制检查员,仅仅通过观察引擎在汽车还没完全造好之前,就能判断出这辆车是否会发生故障。

总结

简单来说,这篇论文解释了当 AI 模型尝试理解被拆分的单词时,它们会在开始阶段使用一个两步过程

  1. **注意力机制(Attention)**将一个微小的提示从第一个碎片传递给最后一个碎片。
  2. MLP 利用那个提示来完成整个单词的构建。

这个过程很快,发生在早期,并且模型在早期层级留下了清晰的“特征签名”,告诉我们它是会成功还是失败。这个过程的速度完全取决于工厂是如何建造的(具体来说,是如何处理位置信息的),而不是取决于工厂有多大或多聪明。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →