← 最新论文
⚡ electrical engineering

Beyond Sinusoids: A Morlet Wavelet Framework for Transformer Positional Encoding

本文介绍了 Morlet 位置编码(MoPE),这是一种将正弦位置编码和旋转位置编码统一为可学习小波方法的全新框架,通过在收敛至小波容许边界的同时,实现对位置与局部性的同步编码,证明了其在 Transformer 模型中性能的提升。

原作者: Athanasios Zeris

发布于 2026-06-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Athanasios Zeris

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心问题:“在哪里” vs “有多远”

想象你正在读一本书。标准的 AI 模型(Transformer)内置了一种知道一个词在句子中处于什么位置的方法。它们使用一种叫做“位置编码”(Positional Encoding)的系统。

目前,两种最流行的系统(正弦波 Sinusoidal 和 ROPE)就像一把完美的、无限长的尺子。它们告诉 AI:“这个词是第 5 个词”,“那个词是第 100 个词”。但它们对每个位置的处理方式完全一样:它们假设一个词的影响力会无限延伸。

作者认为这并不符合语言的逻辑。在故事中,“他”可能指的是两句话前提到的角色,但它不太可能指的是两个章节前提到的角色。标准的尺子不知道一个词的影响力应该延伸多远;它们只负责说“它在这里”。

解决方案:“手电筒” (MOPE)

作者提出了一种名为 Morlet 位置编码 (MOPE) 的新系统。

MOPE 不再是一把无限长的尺子,而更像是一个手电筒

  • 光束(相位/Phase): 像旧系统一样,它告诉 AI 单词的确切角度或“相位”(例如:“你正处于这场舞蹈的第 5 步”)。这部分与流行的 ROPE 系统完全一致。
  • 光晕(振幅/Amplitude): 这是全新的部分。手电筒的光束会随着远离中心而逐渐变暗。在 MO MOPE 中,位置信号的“亮度”会随着远离序列起始点而逐渐减弱。

类比:

  • 旧系统 (ROPE/Sin-cos): 想象一个体育场,每个座位都被明亮且恒定的灯光照亮。1 号座位的观众对解说员来说,和 10,000 号座位的观众一样“清晰可见”。
  • 新系统 (MOPE): 想象一个聚光灯。中心的人非常明亮。当你向后排移动时,光线会变得柔和,并最终消失。这告诉 AI:“密切关注附近的词;远离的词目前相关性较低。”

“神奇”的联系

论文证明了一个令人着迷的事实:旧系统(Sin-cos 和 ROPE)实际上是这个新“手电筒”系统的残缺版本

  • 如果你把手电筒的光束变得无限宽(以至于永远不会变暗),你就得到了旧的 ROPE 系统。
  • 如果你把光束变得无限宽并移除旋转效果,你就得到了旧的 Sin-cos 系统。

因此,MOPE 不仅仅是一个新想法;它是旧思想的“父级”。它能从数据中学习如何为 AI 大脑的每个部分调整手电筒的光束宽度。

实验结果如何?

作者在一个微型数据集(来自莎士比亚的几千个单词)上进行了测试。以下是他们的发现:

  1. 组合才是王道: 当他们将这种新的“手电筒”(MOPE)与另一种被称为“能量门控注意力”(Energy-Gated Attention,类似于决定哪些词重要的保安)的工具结合使用时,AI 预测下一个词的能力显著提升。它击败了单独使用其中任何一种工具的效果。
  2. “甜点位”的发现: AI 必须学习如何调整手电筒的光束宽度。令人惊讶的是,AI 大脑中的 128 个“手电筒”中的每一个都调整了自己,以达到一个特定的数学极限。它们都稳定在了一个既不太窄也不太宽、而是恰到好处的波束宽度,正好符合“角色对单词”的尺度。
    • 这就像是在调谐 128 台收音机: 它们并没有调到不同的频道,而是全部锁定在了信号最清晰的同一个频率上。
  3. “起始”偏差: 当前版本的 MOPE 有一个特性。它假设手电筒的“中心”始终在文本的开头(第 1 个词)。这意味着即使故事即将开始,第 5 个词也天然比第 200 个词更“亮”。作者承认这是一个局限性,并建议未来的版本应该允许 AI 学习如何确定“中心”的位置。

总结

论文表明,与其使用一把僵硬的、无限长的尺子来追踪单词位置,我们应该使用一个智能的、逐渐消退的聚光灯。这个聚光灯会学习其影响力能延伸多远。

  • 旧方法: “我在这里,而且我永远很重要。”
  • 新方法 (MOPE): “我在这里,我的影响力仅持续一小段距离,然后就会消退。”

实验表明,这种“消退”方法在与其他的智能注意力工具配合使用时,能让 AI 比起旧方法更好地理解语言的局部结构(如句子和短语)。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →