← 最新论文
🤖 machine learning

Why Do Accumulated Transformations Extrapolate?

本文证明了在注意力机制中,用累积的、依赖于标记的正交变换(例如 Householder 反射或 SO(2) 旋转)取代位置索引旋转,能够通过创建一个有限的混合窗口并利用不相干性来抑制远距离标记,从而本质上提升长度外推能力,尽管在没有类似 ALiBi 的显式远端质量控制机制的情况下,性能最终会在极端长度下发生退化。

原作者: Mahesh Godavarti

发布于 2026-06-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Mahesh Godavarti

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

大局观:为什么 AI 模型在长篇故事中会迷失?

想象你正在读一本非常长的书。在标准的 AI 模型(例如使用 RoPE 的模型)中,模型通过绝对位置(例如“第 500 个词”)来记忆一个词的位置。如果你突然给它一本比它训练时长两倍的书,它会感到困惑,因为它从未见过“第 1000 个词”。

一种被称为 PaTH 的新方法(以及本文测试的简化版本)试图解决这个问题。它不再说“我在位置 500”,而是说:“我通过一个特定的‘扭转’与前一个词相连。”它构建了一个从句子开头到当前词的连接链。

这篇论文探讨的是:为什么这种“连接链”在长篇故事中表现得如此出色,但如果故事变得过长,它最终又会失效?

作者发现,这种神奇之处不仅仅在于 PaTH 使用的具体数学方法,而在于这些连接是累积的(逐步相加)并且依赖于单词内容的。


三个核心机制

论文通过三个主要概念解释了这种行为,我们可以将其想象成在一座巨大的宴会厅里参加聚会。

1. “混合窗口”(为什么起初有效)

类比: 想象你在参加一个派对。你想和身边的朋友说话,你可以清晰地听到他们的声音。
现在,想象你想和巨大宴会厅另一端的某人说话。在标准模型中,距离只是一个数字。但在这种新模型中,为了触及那个遥远的人,你的声音必须经过数百个其他人的传递,每个人都会为你的信息增加一点微小的、随机的“扭转”或“回声”。

科学原理:

  • 近处: 如果人很近,信息被扭转得并不多,依然清晰。
  • 远处: 如果人很远,信息经过了太多的“扭转”,已经变成了完全混乱的噪声(不连贯)。
  • 结果: 模型学会了忽略来自远处的“噪声”,因为那听起来就像静电干扰。这创造了一个有限的注意力窗口。无论故事变得多长,“近处”区域的大小保持不变,而“远处”区域只会变成更多的静电噪声。这使得模型能够处理更长的故事,而不会被“距离”本身搞混。

2. “人群问题”(为什么最终会失效)

类比: 尽管远处的人听起来像是静电噪声,但想象一下,如果大厅变得如此巨大,以至于在“远处区域”有数百万人在那里。
即使每个人都只是在低声发出一点点静电声,但如果你有的一百万个低语的人,这些静电的总音量会变得震耳欲聋。它会淹没你朋友的声音,即便你的朋友就在你身边。

科学原理:

  • 模型擅长忽略单个远处的 Token(词元)。
  • 然而,随着上下文长度的增长,远处的 Token 数量也会随之增长。
  • 最终,这些被“忽略”的 Token 的总和会产生巨大的干扰。模型的注意力会被稀释。
  • 解决方法: 论文指出,像 ALiBi(使用简单的距离惩罚)这样的方法在极长长度下表现更好,因为它们明确地告诉模型,“完全忽略远处的物体”,而不是仅仅寄希望于数学让它听起来像噪声。

3. “数值旋转”(秘密武器)

类比: 到目前为止,我们只讨论了模型如何决定听谁的(“分数/Score”)。但实际的信息(“数值/Value”)又是怎样的呢?
想象你在听一个合唱团。指挥(模型)决定忽略后排。但如果后排仍在齐声唱着一首统一且响亮的歌,那首歌仍可能渗透出来。
然而,如果指挥也要求后排唱出随机且不同的调子,他们的声音就会互相抵消。即使模型不小心听到了他们,他们的信息也只是一团混乱的噪声,不会干扰主唱。

科学原理:

  • 论文表明,如果你只旋转“查询”(Query)和“Key”(决定谁被关注),你会得到不错的结果。
  • 但如果你同时也旋转“数值”(Value)(即传递的实际信息),那么那些从缝隙中溜进来的“远处”信息会变得更加混乱。
  • 这一额外的步骤显著延长了模型在开始退化之前可以阅读的长度。

实验展示了什么

作者构建了小型 AI 模型来测试这些想法,就像科学家在风洞中测试新引擎一样。

  1. 随机扭转也有效: 即使他们使用的是随机扭转(而不是学习到的扭转),模型处理长上下文的能力也比标准模型强得多。这证明了“混合”机制才是关键,而不是某种复杂的学习技巧。
  2. 旋转数值有帮助: 与仅旋转“查询/键”(决策部分)的模型相比,旋转“数值”(信息部分)的模型在长长度下的表现明显更好。
  3. 极限: 即便有了这些改进,模型在面对极长长度(如 65,000 个词)时确实会变差。这证实了“人群问题”:如果没有一个明确的规则来驱逐远处的 Token(如 ALiBi 所做的那样),大量存在的 Token 最终会压倒整个系统。

总结

  • 为什么有效: 累积的、依赖内容的扭转将远处的信息转化为“噪声”,从而创造了一个稳定的“近处区域”,这个区域的大小不会随着故事变长而改变。
  • 为什么最终会失效: 如果故事足够长,来自数百万个远处 Token 的“噪声”会汇聚成一声咆哮,淹没重要的信号。
  • 改进方法: 旋转实际的数据(数值/Value)会让这种噪声变得更加混乱,从而将失效点推向更远的地方。

论文得出结论:虽然累积变换是实现长度外推的强大工具,但它们需要一个“保安”(如距离偏差)来防止远处的 Token 人群淹没这场派对。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →