← 最新论文
🤖 machine learning

Parallax: Parameterized Local Linear Attention for Language Modeling

本文介绍了 Parallax,这是一种可扩展且数值稳定的参数化局部线性注意力机制,它通过消除局部线性注意力的计算瓶颈、优化硬件效率并展示与 Muon 优化器的新颖协同效应,在语言建模中实现了帕累托改进。

原作者: Yifei Zuo, Dhruv Pai, Zhichen Zeng, Alec Dewulf, Shuming Hu, Zhaoran Wang

发布于 2026-05-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Yifei Zuo, Dhruv Pai, Zhichen Zeng, Alec Dewulf, Shuming Hu, Zhaoran Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试回忆刚刚听到的一段故事。在大语言模型(LLM)的世界里,负责这种记忆的大脑部分被称为注意力(Attention)。多年来,这种注意力工作的标准方式就像查看一个单词列表,并根据每个单词的突出程度给予一个“相关性分数”。如果一个单词非常独特,它就得高分;如果它很平淡,就得低分。这被称为Softmax 注意力

然而,这种方法有一个缺陷:它就像在看地图时只看到平坦、平均的地形,而忽略了坡度和曲线。一个名为**局部线性注意力(Local Linear Attention, LLA)**的新想法试图通过观察数据的“坡度”而不仅仅是平坦的平均值来解决这个问题。这就像意识到要预测球会滚向哪里,你不仅需要知道它在哪里,还需要知道山坡有多陡。

问题出在哪里?这种“坡度”方法的数学计算对于巨型 AI 模型在现实生活中的应用来说过于沉重且不稳定。这就像试图在土路上驾驶一级方程式赛车;引擎过于强大,无法适应这种地形。

于是,Parallax登场了。

什么是 Parallax?

Parallax 是那种“坡度”方法的一个全新、精简的版本。作者们将原始想法中复杂、沉重的数学部分进行了替换,用一种巧妙的、可学习的捷径取代了困难的部分。

可以这样理解:

  • 旧方法(Softmax): 你问图书管理员:“哪本书最相关?”图书管理员查看标题,挑出那个听起来最不同的。
  • “坡度”方法(LLA): 图书管理员意识到,相关性不仅仅关乎标题本身,还关乎你正在寻找的那个标题周围的标题是如何变化的。但计算这种变化需要为每个单词配备一台超级计算机。
  • Parallax: 图书管理员学会了一种特殊技巧。他们不再每次都进行繁重的数学计算,而是随身携带一个小型、智能的记事本(一个可学习的项目器),能够根据上下文瞬间猜出“坡度”。它快速、稳定,且出奇地准确。

“魔法”成分:优化器

该论文最令人惊讶的发现之一是,Parallax 与用于训练 AI 模型的标准“引擎”(称为AdamW)配合效果不佳。这就像给汽车装上了高性能赛车引擎,却使用了错误类型的燃料;汽车会发出嘶嘶声并熄火。

论文发现,Parallax 需要一种特定的、更新型的燃料,称为Muon。当你使用 Muon 时,Parallax 运行完美,释放其全部潜力。如果没有 Muon,Parallax 仅仅比旧方法略好一点点。而有了 Muon,它就变得显著更聪明。这是一个罕见的案例,其中“引擎”(优化器)和“汽车设计”(架构)必须完美匹配才能赢得比赛。

它有多快?

作者们不仅让它变得更聪明,还让它变得更快。他们专门为现代显卡构建了一个定制的“引擎”(计算机代码内核)。

  • 他们声称,在“解码”阶段(即 AI 正在生成下一个单词时),他们的方法与当前的行业黄金标准(FlashAttention)一样快,甚至更快,尽管它执行了更复杂的数学运算。
  • 他们通过高效地利用内存实现了这一点,复用数据流,这样计算机就不必不断停下来获取新信息。

结果

团队在两种规模的 AI 模型(06 亿和 17 亿参数)上测试了 Parallax。

  • 更聪明: 在测试中,Parallax 模型始终比同等规模的标准模型犯更少的错误(更低的“困惑度”),并且回答问题更好。
  • 更好的记忆: 在旨在测试模型能否从长列表中回忆特定事实的合成测试中,Parallax 在茫茫大海中找出正确针头的能力要强得多。
  • 效率: 即使他们调整模型以使用完全相同的计算能力或完全相同的参数数量,Parallax 仍然胜出。

结论

这篇论文介绍了Parallax,一种 AI 关注信息的新方式。它将旧的“平坦”思维方式升级为“感知坡度”的方式,但简化了数学计算,使其能够在真实的计算机上运行。关键在于,当它与一种名为Muon的特定训练工具配对时效果最佳,这种强大的组合在速度和智能方面都超越了当前的最先进模型。

作者强调,这是首次证明特定架构(Parallax)与特定优化器(Muon)之间的这种强关联能够创造出“帕累托改进”——意味着模型变得更好,而无需变得更大或更慢。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →