← 最新论文
🤖 machine learning

Kaczmarz Linear Attention

本文介绍了 Kaczmarz 线性注意力(KLA),这是一种改进的 Gated DeltaNet,其用理论推导的、基于键范数归一化的 Kaczmarz 步长替代了经验学习的更新系数,从而在不改变模型架构或状态形状的前提下,实现了更优的困惑度、长上下文稳定性及解码效率。

原作者: Jiaxuan Zou, Ruifeng Ren, Yong Liu

发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Jiaxuan Zou, Ruifeng Ren, Yong Liu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试教一个机器人阅读一本非常长的书。机器人需要记住它之前读到的内容,才能理解当前的句子。

问题:“二次方”瓶颈
传统 AI 模型(Transformer)的工作原理就像一个学生:每读到一个新词,都必须翻回整本书,检查之前的每一个词,看看它们之间如何关联。如果书很短,这没问题。但如果书有 10 万页长,学生每读一个词就要做海量的工作。这变得如此缓慢且昂贵,以至于实际上无法扩展。

解决方案:“循环状态”
较新的模型试图通过让机器人像一个带着小尺寸固定笔记本的学生那样运作来解决这个问题。它们不再翻回整本书,而是随着阅读不断更新笔记本。它们写下最重要的部分,遗忘其余部分,然后继续前进。这很快(线性时间),但很难做对:应该写下什么?应该擦除多少?如果再次遇到相同的话题,如何更新笔记?

之前的尝试:门控 DeltaNet(GDN)
一种流行的模型称为门控 DeltaNet(GDN),它采用“笔记本”方法。当它看到新信息时,会计算它认为自己知道的内容与它实际看到的内容之间的差异,然后将该差异写入笔记本。

然而,GDN 有一个缺陷:它使用一个“学习到的猜测”(即它在训练期间计算出的一个数值)来决定变化幅度有多大。这就像一个学生猜测:“嗯,我觉得我应该用 5 号记号笔写下这个。”有时他们用的记号笔太大(弄脏了页面),有时又太小(字迹太淡而丢失)。这种猜测只是模型学到的习惯,而非数学规则。

新想法:Kaczmarz 线性注意力(KLA)
本文作者 Jiaxuan Zou 及其同事问道:“我们能否停止猜测,转而用数学精确地决定变化幅度应该多大?”

他们研究了一种古老的数学方法,称为Kaczmarz 投影

  • 类比:想象你试图在纸上画一条线,使其穿过一个特定点。你有一把尺子(你的当前状态)。如果你的尺子没有对准该点,就需要微调它。
  • 洞察:Kaczmarz 方法指出,微调尺子的最佳方式是测量该点有多“强”或“响亮”。如果该点非常响亮(强信号),你只需要微调一点点就能对准它。如果该点很安静(弱信号),你就需要大幅调整。

用论文的语言来说,他们查看“键”(信号)并测量其强度(其“范数”)。然后,他们计算出一个精确的步长:

步长 = (学习率)/(信号强度)

这就是Kaczmarz 系数

改变了什么?
作者并没有构建新的机器人或新的笔记本。他们没有改变硬件。他们只是将 GDN 模型中的“猜测”数值替换为这个精确的、数学推导出的数值。

  • 旧方法:“我会用 0.5 号记号笔写下这个,因为我的训练数据告诉我这样做。”
  • 新方法(KLA):“我会用 0.5 除以这个信号的响亮程度作为记号笔的大小来写下这个。”

结果
由于这条新规则在数学上完美适用于更新记忆这一特定任务,模型表现更佳:

  1. 更智能:它预测句子中下一个词的准确率更高(“困惑度”更低),优于之前的最佳模型。
  2. 更长的记忆:它能够处理更长的上下文(高达 65,000 个词)而不会混淆或遗忘,而旧模型则开始显得吃力。
  3. 任务表现更好在测试中,当模型需要在一堆巨大的文本“干草堆”中找到特定的“针”时,KLA 达到了 100% 的正确率,而其他模型则未能做到。
  4. 同样快速:由于他们只更改了更新公式的数学部分,而没有改变笔记本的结构,模型的运行速度与旧模型一样快。事实上,在长文本长度下,其解码(生成文本)速度提高了 2.1 倍。

总结
本文介绍了KLA,这是一种模型,它保持了与其前身相同快速、高效的结构,但用精确的、数学推导出的更新规则替换了“猜测”式的更新规则。这就像给一辆原本就行驶良好的汽车,将司机的猜测替换为完美的 GPS 导航系统。车还是那辆车,但它能更准确、更高效地到达目的地。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →