← 最新论文
🧬 biology

Learning the Koopman Operator using Attention Free Transformers

本文介绍了一种鲁棒的 Koopman 预测器,该预测器结合了用于局部时间上下文的无注意力潜空间记忆模块和用于修正潜空间漂移的动态重编码机制,与现有的自动编码器及基于注意力的模型相比,实现了更优的远期预测精度和更低的推理延迟。

原作者: Mohammed Nagdi, Evangelos-Marios Nikolados, Alexey Yermakov, Mars Gao, Nathan Kutz, Filippo Menolascina

发布于 2026-06-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Mohammed Nagdi, Evangelos-Marios Nikolados, Alexey Yermakov, Mars Gao, Nathan Kutz, Filippo Menolascina

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

核心问题:会“漂移”的 GPS

想象一下,你正试图用计算机来预测过山车或摆钟的运动轨迹。科学家们使用一种叫做**库普曼算子(Koopman Operator)**的数学工具,将这些复杂、扭曲的非线性运动转化为简单的直线预测。这就像是试图通过假设汽车只在一条完美的平直高速公路上行驶,来预测汽车的路径。

对于短途旅行(几秒钟)来说,这种方法效果很好。但如果你试图预测长期的行程(数小时或数天),预测就会开始出现“漂移”。计算机认为汽车仍行驶在平直的高速公路上,但实际上,汽车已经驶离了公路,甚至掉入了悬崖或正在旋转圈圈。数学计算在每一步都会产生微小的误差,这些误差不断累积,直到预测变得完全失效。

论文中将此称为漂移(drift)。之所以发生这种情况,是因为这个“平直的高速公路”(学习到的模型)并不是对真实、崎岖世界的完美映射。

解决方案:两种新工具

来自爱丁堡大学和华盛顿大学的研究团队引入了两种新的“安全特性”来修复这个漂移问题。他们将这些特性添加到标准的库普曼模型中,使其足够鲁棒,能够在不迷失方向的情况下进行数千步的预测。

1. “短期记忆”(AFT 模块)

类比: 想象你正在穿行于一片大雾弥漫的森林。如果你只盯着脚下的地面看,你可能会被没看到的树根绊倒。但如果你回头看一眼刚刚走过的最后几步,你就能感觉到路径的坡度,并在摔倒之前调整平衡。

技术细节: 作者添加了一个名为**无注意力潜空间记忆(Attention-Free Latent Memory, AFT)**的组件。

  • 作用: 在计算机做出下一个预测之前,它会观察刚刚走过的最后几步所形成的短时间“窗口”。它利用这段历史来轻微修正当前的位置,在小误差演变成大误差之前将其修复。
  • 特别之处: 通常,观察过去需要非常沉重且缓慢的计算机处理过程(例如带有“注意力机制”的 Transformer)。而这种新方法是“无注意力”的,这意味着它能完成同样的工作,但速度更快,占用的内存极少(仅增加了约 3 万个参数)。这就像是一个不需要超级计算机来计算,却能记住最后 10 次转弯位置的 GPS。

2. “现实检查”(动态重编码)

类比: 想象你正在驾驶一艘船。即使有好的地图,你也可能因为风力和水流而偏离航线。一位聪明的船长不会只是盲目地操纵舵柄;他们偶尔会停下来,观察星空(真实世界),然后说:“等等,我们并不在地图所示的位置。”接着,他们在继续航行前,将船的位置重新校准到地图上的正确位置。

技术细节: 这被称为动态重编码(Dynamic Re-encoding)

  • 作用: 系统会不断自我监控。它会自问:“我的预测是否开始看起来与模型应该呈现的样子不符了?”它使用简单的、快速的统计报警机制(类似于烟雾探测器)来识别预测何时开始偏离“安全路径”(流形)。
  • 修复方式: 一旦报警触发,系统会瞬间将预测“捕捉”回正确的路径并继续运行。这防止了微小的误差演变成灾难性的失败。

他们是如何测试的

研究团队在三种截然不同的“过山车”系统上测试了这些工具:

  1. 达芬振荡器(Duffing Oscillator): 一个可以在两种不同状态之间切换的系统(就像球在两个山谷之间滚动)。它具有混沌特性,难以预测。
  2. 受阻抑止器(Repressilator): 一种表现得像完美节奏时钟(极限环)的合成基因电路。
  3. IRMA: 一个由五个相互作用的基因组成的复杂网络,就像一个充满反馈回路的纠缠网络。

测试结果

  • 更高的准确性: 在所有三个系统中,这种新方法(库普曼 + AFT + 现实检查)在长时间运行下的错误远少于旧方法。
  • 击败“巨头”: 他们将自己的方法与庞大复杂的 AI 模型(如 Transformer 和 GRU)进行了对比。尽管那些模型规模巨大且运行缓慢,但在预测时长方面,它们的漂移程度仍高于这种轻量级的库普曼方法。
  • 速度: 新方法速度极快。预测未来 1,000 步所需的时间仅为其他模型的一小部分。

总结

论文表明,你并不需要一个庞大、缓慢的 AI 来进行长期的复杂系统预测。相反,你可以采用一个简单、快速的线性模型,并赋予它两样东西:

  1. 一个用于平滑微小颠簸的短期记忆
  2. 一个用于在开始游离时将其拉回现实的自我检查机制

这创造了一个既快速又轻量,且能长时间保持精准轨迹的预测器,使其非常适合那些需要在无需等待超级计算机运算的情况下,就能预知后续发展的系统。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →