← 最新论文
🤖 machine learning

Kalman Linear Attention: Parallel Bayesian Filtering For Efficient Language Modelling and State Tracking

本文介绍了卡尔曼线性注意力(Kalman Linear Attention, KLA),这是一种可并行化的序列混合层,它通过使用信息形式的卡尔曼滤波器重新构建精确贝叶斯滤波,从而实现具有显式不确定性的非线性、扫描并行状态更新,进而超越了像 Mamba 和 GLA 这样现有的线性复杂度模型的表达能力和状态追踪能力,同时保持了计算效率。

原作者: Vaisakh Shaj, Cameron Barker, Aidan Scannell, Andras Szecsenyi, Elliot J. Crowley, Amos Storkey

发布于 2026-06-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Vaisakh Shaj, Cameron Barker, Aidan Scannell, Andras Szecsenyi, Elliot J. Crowley, Amos Storkey

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心愿景:AI“思考”的新方式

想象一下,你正在尝试阅读一本非常厚的书。

  • 旧版 AI(Transformer): 为了理解一个句子,AI 会查看到目前为止书中的每一个字。这就像一位图书管理员,为了找一本书,竟然把整个图书馆都搬了出来。它非常精准,但随着书的内容变长,速度会变得极其缓慢且成本高昂。
  • 当前的效率型 AI(Mamba, GLA): 这些模型就像一位只保留一本固定大小笔记本的图书管理员。他们只记录最重要的信息,并忘掉其余的部分。他们很快,但因为他们只是简单地将新信息“叠加”到旧信息上,所以有时会错过微妙的联系,或者在故事变得过于复杂时感到困惑。

这篇论文介绍了一位新的图书管理员:卡尔曼线性注意力(Kalman Linear Attention, KLA)。

KLA 是一位同样保留笔记本的图书管理员,但他们不仅仅是记录事实,还会记录自己对每个事实的确定程度。他们会问自己:“我记得这个,但我对此有多大的信心?这条新信息是一个改变局面的关键,还是仅仅是一个微小的细节?”

核心思想:“信心”笔记本

作者们意识到,目前的效率型 AI 模型将它们的记忆视为一个简单的数学方程(将数字相加)。但真正的思考涉及不确定性

  1. “信念状态”(The Belief State): KLA 不仅仅存储一个事实,它还存储一个事实 以及 一个置信度分数(就像天气预报说“有 80% 的降水概率”)。
  2. “守门员”(The Gatekeeper): 当新信息进入时,KLA 不仅仅是将其加入。它会检查自己的信心。
    • 如果 AI 对当前的记忆非常有信心,它就会忽略那些带有噪声的新信息。
    • 如果 AI 不确定,它就会密切关注新信息并更新自己的记忆。
  3. “魔法技巧”(并行化): 通常情况下,逐步检查信心并更新记忆是很慢的(就像人们排队等待盖章一样)。这篇论文的重大突破在于证明了这种“信心检查”可以同时进行,就像一条传送带一样,这使得它能像目前最快的模型一样迅速。

创意类比

1. “怀疑派侦探” vs. “记录员”

  • 现有模型(记录员): 想象一位侦探,他把证人说的每一句话都写在笔记本上。如果证人说“车是红色的”,侦探就写下“红色”。如果证人后来说“其实,也许是枣红色的”,侦探就直接在旁边写下“枣红色”。笔记本变得乱七八糟,侦探可能会对到底发生了什么感到困惑。
  • KLA(怀疑派侦探): 这位侦探有一个“信心计”。
    • 证人: “车是红色的。”
    • 侦探: “好吧,我有 90% 的把握它是红色的。我会把它记下来。”
    • 证人: “等等,我觉得我也看到了一辆蓝色的车。”
    • 侦察: “嗯,我对‘红色’的信心很高,但这个新线索有点不靠谱。我会稍微降低对‘红色’的信心,并记录下蓝色车的信息,但我不会立刻抹去‘红色’。”
    • 结果: 侦探能够维持一个更清晰、更准确的犯罪现场图景,而不会被信息淹没。

2. “交通灯”系统

把 AI 的记忆想象成一条高速公路。

  • 线性模型: 每辆车(新单词)都直接汇入交通流。这是一条平滑的直线。
  • KLA: 每辆车都有一个交通灯。
    • 如果高速公路很空旷(低信心),灯就是绿灯;新车可以轻松汇入。
    • 如果高速公路交通拥堵(高信心),灯就会变红;新车必须等待或非常小心地汇入。
    • 创新之处: 论文研究出如何同时为一条 1000 英里的高速公路计算所有的交通灯,而不是在每一个里程碑处停下来检查灯号。

他们究竟证明了什么?

这篇论文并不声称它能治愈疾病或预测股市。它专注于语言建模(让 AI 更擅长阅读和写作)。以下是他们的演示成果:

  1. 更快且更聪明: KLA 与目前最快的模型(如 Mamba)一样快,但能解决更难的逻辑谜题。
  2. “排列测试”: 他们给 AI 一个名为“A5”的任务,这就像一个复杂的谜题,你需要按特定顺序排列物品。
    • 现有的快速模型(Mamba、标准 Transformer)除非把 AI 做得非常庞大且深层,否则无法通过这个谜题。
    • KLA 用一个极小、极浅的模型就解决了它。 这证明了 KLA 比竞争对手更能追踪复杂的、变化的各种状态。
  3. 处理“长上下文”: 当 AI 需要记住 2000 字之前的剧情时,KLA 在寻找正确细节方面比其他快速模型做得更好。
  4. 规模化能力: 他们用数十亿词的数据训练了一个模型。它运行稳定,没有崩溃。这证明了这种基于“不确定性”的方法可以用于大型、现实世界的 AI 系统。

“秘诀”:OU 过程

论文提到了一个技术术语——“Ornstein-Uhlenbeck (OU) 过程”。

  • 类比: 想象一个连接着球的橡皮筋。如果你把球拉开,橡皮筋会将它拉回中心。
  • 在 AI 中: 这个橡皮筋防止了 AI 的“信心”失控(即爆炸到无穷大或跌落到零)。它保持了 AI 记忆的稳定性,使得模型可以进行多层堆叠而不崩溃。如果没有这个“橡皮筋”,当模型规模变大时,它会变得不稳定。

总结

卡尔曼线性注意力(Kalman Linear Attention) 是一种新型的 AI 记忆机制,它的工作方式就像一位充满信心且具有怀疑精神的侦探。它不仅仅是死记硬背,还会追踪自己对所知事物的确定程度。这使得它能比目前的快速 AI 模型更好地过滤噪声并专注于重要细节,同时运行速度同样之快。作者们证明了它在困难逻辑谜题上的有效性,并且可以在海量数据上进行训练。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →