← 最新论文
🤖 AI

Positional Encoding via Token-Aware Phase Attention

本文介绍了 Token 感知相位注意力(TAPA),这是一种新颖的位置编码方法,它通过引入可学习的相位函数克服了 RoPE 在长程建模方面的固有局限,从而在长上下文场景中以最少的额外训练实现了更优的困惑度和检索性能。

原作者: Yu Wang, Sheng Shen, Rémi Munos, Hongyuan Zhan, Yuandong Tian

发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Yu Wang, Sheng Shen, Rémi Munos, Hongyuan Zhan, Yuandong Tian

原始论文根据 CC0 1.0(http://creativecommons.org/publicdomain/zero/1.0/)发布到公有领域。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是关于论文《通过 Token 感知相位注意力(TAPA)进行位置编码》的通俗解释,并辅以生动的类比。

问题:AI 记忆中的“距离陷阱”

想象一位大型语言模型(就像一位超级聪明的图书管理员)正在尝试阅读一本非常长的书。为了理解故事,这位管理员需要知道每个单词相对于其他单词的位置

长期以来,行业的标准做法是一种称为RoPE(旋转位置嵌入)的方法。可以将 RoPE 想象成一种包裹在单词周围的特殊尺子。它在处理短篇故事(几千字)时效果极佳。然而,本文的作者发现,当书籍变得非常长(例如 64,000 字)时,这种尺子的运作方式存在一个隐藏的缺陷。

缺陷所在
作者证明了 RoPE 存在一种“内在的距离偏差”。

  • 类比:想象这位管理员戴着降噪耳机,耳机音量会随着单词距离的变远而增大。即使远处的某个单词是解开谜题的最重要线索,管理员的“距离耳机”也会让那个单词听起来微弱且不重要。
  • 结果:模型开始忽略远处的单词,并非因为它们无关紧要,仅仅因为它们距离遥远。这导致模型在尝试阅读非常长的文本时会“崩溃”或失效。

目前的解决方案试图通过在模型训练完成后手动调整尺子来修复这个问题(就像拉伸橡皮筋或调节音量旋钮)。作者认为这是一种“创可贴”式的解决方案,因为它需要不断的微调,且未能解决根本原因。

解决方案:TAPA(Token 感知相位注意力)

作者引入了一种名为TAPA的新方法。TAPA 不再使用那种对所有距离一视同仁的刚性尺子,而是赋予模型一个“智能指南针”,使其能够根据单词的内容而非仅仅是距离来学习如何分配注意力。

工作原理(隐喻)

  • 旧方法(RoPE)想象一座旋转的灯塔光束。无论外面有什么船,光束都会随着船只距离的增加而变暗。船只的重要性完全取决于它离岸边有多远。
  • 新方法(TAPA)想象一座装有“智能传感器”的灯塔。如果远处有一艘船载着巨大的宝箱(重要内容),灯塔光束会自动变亮以聚焦于它,无论距离多远。如果一艘船很近但是空的,光束可能会变暗。
  • 机制:TAPA 添加了一个“可学习的相位函数”。简单来说,它允许模型为每个单词学习一种特殊的“相位”或节奏。这种节奏抵消了对远处单词的不公平偏差,使模型能够像处理附近信息一样清晰地听到来自远方的重要信息。

结果:马拉松选手与短跑运动员

研究人员将他们的新技术与旧标准(RoPE)及其他流行的修复方案进行了测试。他们训练了一个拥有 70 亿参数的模型(一个中等规模的 AI 大脑),并在长度不断增加的书籍上进行了测试。

  1. 短距离(1k–16k 字)旧方法和 TAPA 的表现几乎完全相同。它们都是优秀的短跑运动员。
  2. 中等距离(32k 字)旧方法开始踉跄。它们的困惑度(perplexity)上升了。TAPA 则保持平稳运行,甚至表现略有提升。
  3. 长距离(64k 字)这是其他人退赛的地方。
    • RoPE 及其修复方案:模型完全崩溃。它们的困惑度得分飙升(就像跑步者绊倒摔了一跤)。它们再也无法理解文本。
    • TAPA:模型保持稳定。它保持了较低的困惑度,即使在 64,000 字时也能完美地理解故事。

“大海捞针”测试
为了证明 TAPA 实际上能够找到信息,他们玩了一个游戏:“将特定数字隐藏在海量文本中,让模型将其找出来。”

  • 在 64,000 字时,旧方法0% 的时间能找到那根针。它们视而不见。
  • TAPA 96% 的时间找到了那根针。

为什么这很重要(根据论文观点)

论文声称 TAPA 是一项根本性的改进,因为:

  1. 无需微调:与其他需要在训练后进行手动调整的方法不同,TAPA 只需训练一次,然后即可简单地“继续”学习更长的上下文,而无需更改任何设置。
  2. 稳定性:它不仅仅是表现稍好一些;它防止了模型在文本变得巨大时完全崩溃。
  3. 效率:它的运行速度几乎与旧方法一样快(仅慢约 20%),这是为获得巨大的长期记忆提升所付出的微小代价。

总结
论文认为,当前 AI 模型处理“距离”的方式在处理长故事时是失效的。他们构建了一个新系统(TAPA),让 AI 能够无论单词距离多远都能听到重要的内容,使其能够阅读海量书籍而不会感到困惑或迷失方向。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →