← 最新论文
💻 computer science

Exclusive Self-Attention Beyond AdamW: Stability and Generalization under Muon Optimization

本文证明了旨在减少自我指涉行为的排他性自注意力(Exclusive Self-Attention, XSA)机制在 Muon 优化下保持稳定,并能带来适度的语言模型泛化性能提升,且随着模型规模从 12 层增加到 24 层,其性能增益变得更加一致。

原作者: Chandana Dayapule

发布于 2026-08-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Chandana Dayapule

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教一个机器人如何阅读故事。这个机器人使用一种叫做“Transformer”的特殊工具来理解文字。把这个工具想象成一位超级聪明的图书管理员,每当他们读到一个新词时,都会回顾之前看过的每一个词,以此来弄清楚这个词的意思。通常情况下,当图书管理员看一个词时,他们也会同时关注这个词本身。这就像是读到“猫”这个词,并立即想到:“哦,这是一只猫,因为我正在看‘猫’这个词。”

这种方法效果很好,但有时它过于依赖词语本身,而没有充分注意到该词如何与故事中的其他部分相契合。一位名叫 Zhai 的研究人员注意到了这一点,并发明了一条规则,叫做“排他性自注意力”(Exclusive Self-Attention,简称 XSA)。这条规则就像是在告诉图书管理员:“当你观察一个词时,你被严格禁止查看该词自身的定义。你必须仅通过观察周围的其他词来理解它的含义。”这迫使机器人更加关注语境——也就是故事本身——而不是仅仅关注单词本身。

最初的研究表明,当机器人使用一种特定的方法进行训练时,这条规则表现得非常出色,这种方法叫做“AdamW”。但当时有一个巨大的问号:如果我们把机器人的训练方法换成一种更新、更强大的方法——叫做“Muon”——这条规则是否仍然有效呢?Muon 就像是一个不同的教练,它以一种略有不同的方式来教导机器人,特别是在处理机器人大脑内部的大型数学表时。如果 XSA 规则在遇到这个新教练时失效了,那么它对于现代机器人来说就没那么有用了。这正是 Chandana Dayapule 的论文试图解决的谜题。

实验:一个新教练,同样的规则

来自佐治亚理工学院的 Chandana Dayapule 决定测试“排他性自注意力”规则能否在更换教练风格的情况下幸存下来。他们使用了一个现代且紧凑的训练系统,名为“nanochat”,该系统使用 Muon 教练来承担繁重的任务,并使用旧的 AdamW 教练来处理其余部分。他们构建了两个版本的语言模型:一个遵循旧规则(基准模型),以及一个遵循新 XSA 规则的版本(“排他性”版本)。

他们在两种不同规模下测试了这些模型:一个拥有 12 层思考能力的较小模型(d12),以及一个拥有 24 层思考能力的较大模型(d24)。目标是观察 XSA 规则是否能在提高模型语言理解能力的同时,不会导致训练崩溃或过度减速。

发现:喜忧参半的结果

结果是一场充满成功与细微差别的奇妙结合。首先是好消息:XSA 规则并没有破坏训练。即使使用了新的 Muon 教练,这些模型的学习过程依然像往常一样平稳且稳定。这证明了该规则与现代训练方法是兼容的。

说到模型对语言的理解能力(通过一种被称为“每字节比特数/bits-per-byte”的指标来衡量,这类似于模型压缩信息效率的分数),XSA 模型在两种规模下都取得了胜利。

  • 在较小规模(d12)下,XSA 模型将其分数从 0.8484 提升到了 0.8457
  • 在较大规模(d24)下,它从 0.7193 提升到了 0.7171

然而,当观察模型在特定下游任务上的表现(通过被称为“Base CORE”和“ChatCORE”的分数来衡量)时,故事变得更有趣了。

  • 对于较大的模型 (d24),XSA 规则是明显的赢家。它将 Base CORE 分数从 0.2593 提升到了 0.2606,并将 ChatCORE 分数从 0.3638 提升到了 0.3682。这表明,对于更大、更复杂的模型,强制让机器人忽略自身的定义确实有助于它更好地理解故事。
  • 对于较小的模型 (d12),结果则有些令人失望。虽然压缩分数提高了,但 Base CORE 分数实际上从 0.1602 下降到了 0.1508

结论:取决于规模

论文得出结论,“排他性自注意力”规则是现代 AI 训练中一种安全且稳定的补充,但它并不是一个在任何地方都能完美运作的“万灵药”。它似乎是一个在大型、深层模型(如 d24 版本)中表现最出色的工具。在较小的模型中,其益处并不明确,甚至可能会损害某些任务的表现。

研究人员还检查了新规则是否会让机器人变慢。他们发现了一个微小的减速,大约在 5% 左右,但指出这种差异非常微小,以至于很难在计算机性能正常的波动中精确测量出来。

简而言之,这项研究表明,你可以配合新的 Muon 教练使用这种“无自注意力”规则,并且它在大型模型中表现良好。但对于较小的模型,你必须保持谨慎,因为其带来的收益可能并不值得那些权衡。这提醒我们,在 AI 的世界里,适用于巨型大脑的东西并不一定适用于较小的脑子,最好的工具取决于任务的大小。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →