← 最新论文
💬 NLP

OSDN: Improving Delta Rule with Provable Online Preconditioning in Linear Attention

本文介绍了在线缩放 DeltaNet(OSDN),这是一种线性注意力模型,它通过引入在线更新的对角预条件器来实现特征维度的缩放,从而增强了 Delta 规则,在保持硬件高效并行性的同时,实现了可证明的超几何收敛性并显著提升了上下文关联回忆能力。

原作者: Chenyu Zhou, Hongpei Li, Yuerou Liu, Jianghao Lin, Dongdong Ge, Yinyu Ye

发布于 2026-05-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Chenyu Zhou, Hongpei Li, Yuerou Liu, Jianghao Lin, Dongdong Ge, Yinyu Ye

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试记忆一个非常长的故事,以便稍后能回答关于它的问题。在人工智能领域,这被称为“上下文学习”。人工智能阅读这个故事(即上下文),并更新其内部记忆以记住重要细节。

很长一段时间以来,实现这一点的最佳方式就像一个拥有完美索引的巨型图书馆(称为“Softmax 注意力”)。但这个图书馆速度缓慢,且占用巨大的空间。更新、更快的方法(如DeltaNet)则更像是一个人在小笔记本上做笔记。它们快速且高效,但如果故事太长或某些单词重复出现多次,它们有时难以记住具体细节。它们倾向于将笔记“模糊”地混在一起。

本文介绍了一种名为OSDN(在线缩放 DeltaNet)的新方法,旨在解决这种模糊问题。以下是其工作原理,使用简单的类比:

1. 问题:“一刀切”的笔

想象人工智能正在笔记本上书写。每当它看到一个新词(一个“token”),它就会写下一条笔记。

  • 旧方法(DeltaNet): 人工智能使用一支墨水流量固定的单一钢笔。如果它需要书写微小、精细的细节,这支笔太粗,会弄脏细节;如果它需要书写巨大、粗体的标题,这支笔又太细,墨水会耗尽。它对所有信息都使用完全相同的“步长”或强度。
  • 问题所在: 故事中的某些事实很罕见,需要强烈、清晰的笔记;而其他事实很常见,只需轻轻带过。对所有内容使用相同的“笔压”会导致回忆错误。

2. 解决方案:“智能、可调节的笔”(OSDN)

OSDN 为人工智能提供了一支智能、可调节的笔。它不是只有一个固定设置,而是为字母表中的每个字母(或数据的每个特征)都配备了一个旋钮。

  • 如何学习: 随着人工智能阅读故事,它会不断检查:“我那条笔记写对了吗?”如果笔记太淡,下次它会将该特定字母的旋钮调大;如果太深,则将其调小。
  • 魔法技巧: 论文证明,这个“旋钮”不需要复杂、缓慢的计算机来计算。它可以通过直接观察正在书写的单词即时得出。这使得人工智能在保持速度的同时,能更聪明地掌握“如何”书写。

3. “遗忘”机制(APF)

有时,故事会转换话题。开头重要的事实到了结尾可能就不再相关了。

  • 问题: 如果人工智能继续基于旧话题调整其笔,当故事切换到新主题时,它可能会感到困惑。
  • 修复方案(APF): OSDN 包含一个名为自适应预条件器遗忘的功能。这就像一个“新页面”按钮。如果人工智能注意到话题发生了转移,它会温和地重置新话题的笔旋钮,这样它就不会被卡在上一章的设置中。

4. 为什么这很重要(结果)

作者在不同规模(从小型到超大型)的人工智能模型上测试了这种方法。

  • “记忆测试”: 他们给人工智能一个故事,然后让它回忆具体细节,特别是当这些细节出现两次时(例如,一个角色被介绍,随后在稍后再次被提及)。
  • 结果:
    • 在中等规模下,与旧方法相比,OSDN 将回忆重复细节的能力提高了32%
    • 在超大规模下(13 亿参数),它在保持人工智能在通用任务(如写句子或回答一般问题)表现不变的同时,将记忆回忆能力提高了39%
    • 至关重要的是,它没有显著减慢人工智能的速度。这就像升级汽车引擎使其更精准,而不会让汽车变得更重或更慢。

总结

可以将OSDN视为教导人工智能成为一个更好的记笔记者。它不再以相同的压力潦草地记录所有内容,而是学会在重要、罕见的细节上用力按压,而在常见细节上轻轻带过。它也知道何时为新话题擦净白板。这使得人工智能能够更好地记住复杂的故事,而不会失去其速度或效率。

本文并未声称:

  • 它不声称这使人工智能变得“有意识”或能够感受情感。
  • 它不声称这解决了所有人工智能问题(如推理或数学);它专门针对从长文本中记忆和检索信息的能力。
  • 它不暗示这已准备好用于医疗诊断或关键的实际部署;它是人工智能模型处理文本序列方式的一项研究突破。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →