← 最新论文
💬 NLP

PaTH Attention: Position Encoding via Accumulating Householder Transformations

本文介绍了 PaTH,一种基于累积豪斯霍尔德变换(Householder transformations)的灵活且数据依赖的位置编码方案,该方案在语言模型任务中优于标准的旋转位置编码(RoPE),同时提供了高效的并行训练能力以及转换预训练 RoPE 模型的能力。

原作者: Songlin Yang, Yikang Shen, Kaiyue Wen, Shawn Tan, Mayank Mishra, Liliang Ren, Rameswar Panda, Yoon Kim

发布于 2026-02-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Songlin Yang, Yikang Shen, Kaiyue Wen, Shawn Tan, Mayank Mishra, Liliang Ren, Rameswar Panda, Yoon Kim

原始论文根据 CC0 1.0(http://creativecommons.org/publicdomain/zero/1.0/)发布到公有领域。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是对“PaTH Attention”论文的解释,采用了简单易懂的语言和日常类比。

核心问题:“盲目”的记忆

想象一下,大型语言模型(比如你正在与之交谈的这个模型)就像一位非常聪明的图书管理员,通过阅读一本长篇著作来回答你的问题。为了理解故事,图书管理员不仅需要知道单词是什么,还需要知道它们出现在书中的什么位置。

目前的模型使用一种叫做 RoPE(旋转位置编码)的系统来记忆单词的位置。把 RoPE 想象成一把固定的、预先印好的尺子

  • 如果你把一个单词从第 1 页移动到第 2 页,这把尺子就会按固定的量进行偏移。
  • 缺陷: 这把尺子对内容是“盲目”的。它对待单词“苹果”和单词“火箭”的方式完全一样,仅仅因为它们处于相同的位置。它并不关心故事是在讲水果还是在讲宇宙飞船。正因如此,当故事需要复杂的、循序渐进的逻辑时(比如追踪长列表中谁拥有哪个物品),图书管理员有时会感到困惑。

解决方案:PaTH(“聪明”的尺子)

作者引入了 PaTH,一种新的记忆位置的方式。PaTH 不再是一把固定的尺子,而是一把动态的、可以根据故事改变形状的尺子

  • 工作原理: 当图书管理员阅读每个单词时,PaTH 会对之前单词的记忆应用一种特殊的数学“扭转”(称为 Householder 变换)。
  • 类比: 想象你正走过一条铺满镜子的走廊。
    • RoPE: 镜子是固定的。无论你穿什么,你的倒影看起来都一样。
    • PaTH: 镜子是聪明的。如果你戴着一顶红帽子,镜子会让你的倒影向一个方向扭转;如果你戴着一顶蓝帽子,它会向另一个方向扭转。这种“扭转”取决于你所持有的实际内容(帽子)。

这使得模型能够构建一条随其处理的数据而变化的记忆“路径”,从而更擅长解决需要追踪状态的谜题(例如在计算机代码中追踪变量的值)。

魔法技巧:如何快速实现

通常情况下,为每一个单词都制作一把改变形状的尺子会极其缓慢且计算成本极高。这就像是每走一步都要重新计算整个走廊镜子的角度一样。

论文的第二个主要贡献是一个加速算法(类似于所谓的 FlashAttention)。

  • 类比: 作者没有重新计算整个走廊,而是发现了一个聪明的捷径。他们意识到,如果将镜子分组成小的区块,就可以使用一个紧凑的数学公式一次性计算出整个区块的“扭转”。
  • 结果: 他们构建了一个运行速度几乎与旧的固定尺子系统(RoPE)一样快的系统,同时保留了新系统的“智能、变化”的优势。

他们证明了什么?

作者通过两种方式测试了这一新系统:

  1. 合成谜题(“辅助轮”测试):
    他们给了模型一些简单的逻辑游戏,比如一个需要记住开关最后一次被拨动的“翻转器(Flip-Flop)”游戏,或者涉及复杂数学规则的“文字题”游戏。

    • 结果: 旧模型(RoPE)经常在这些谜题中失败,会被序列搞混。而新的 PaTH 模型几乎完美地解决了这些问题,即使其“大脑”层数比其他模型更少。
  2. 真实语言任务:
    他们在真实文本(书籍、代码、对话)上训练了模型。

    • 结果: PaTH 模型在理解长上下文(阅读长篇著作而不忘记开头)方面表现更好,并且在推理任务(尤其是编程和数学)中表现更优。
    • 加分项: 他们展示了你可以将一个用旧有的“固定尺子”(RoPE)训练的模型,通过少量的额外训练,直接转换为使用“聪明尺子”(PaTH)的模型,而无需从头开始。

总结

PaTH 是 AI 记忆单词顺序的一种新方式。它不再使用僵化、一刀切的系统,而是使用一种基于单词本身进行变化的灵活系统。作者找到了让这种灵活系统运行得足够快以投入实际应用的方法,从而造就了在逻辑、长距离信息追踪以及理解复杂序列方面表现更出色的 AI 模型。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →