← 最新论文
🤖 machine learning

Lag Operator SSMs: A Geometric Framework for Structured State Space Modeling

本文引入了一种用于结构化状态空间模型(SSMs)的新颖几何框架,该框架利用滞后算子通过领域扩张直接推导离散时间递归,从而提供了一种灵活且模块化的方案,作为传统连续到离散建模的替代方案,在统一基函数与时间扭曲方案的同时,恢复了包括 HiPPO 在内的既有模型。

原作者: Sutashu Tomonaga, Kenji Doya, Noboru Murata

发布于 2026-07-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Sutashu Tomonaga, Kenji Doya, Noboru Murata

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图回忆一个很长的故事,但你的大脑有一个严格的规则:你一次只能手里拿着一张极小的、固定大小的便签卡。随着新句子的到来,你必须决定在卡片上写什么,以及擦除什么。如果你擦除得太多,你会忘记情节;如果你写得太多,你就会没有空间。这就是人工智能在试图理解长序列数据(如小说、歌曲或股票市场历史)时每天面临的挣扎。

长期以来,解决这个“记忆卡”问题的最佳方法是使用一种被称为结构化状态空间模型(SSMs)的方法。把这些模型想象成一位超级聪明的图书管理员,他不仅是在阅读故事,还将整本书的历史投影到一面特殊的、不断变化的墙上。随着故事变得越来越长,墙面会拉伸,图书管理员使用一套复杂的数学规则来计算如何将旧页面挤压到角落,从而为新内容腾出空间。其中最著名的版本叫做 HiPPO,它表现得非常出色,但想要弄清楚它的工作原理,就像是试图通过戴着厚重手套并以慢动作观察魔术师表演来理解一个魔术一样。它背后的数学涉及连续时间、微分方程以及一个感觉像乱作一团的电线结的过程。它确实有效,但在一切都太迟之前,没人能完全明白这种魔法是如何发生的。

这正是 Sutashu Tomonaga、Kenji Doya 和 Noboru Murata 的一篇新论文介入的地方。他们决定通过一个完全不同的角度来解开那个结。他们没有从复杂、连续时间的魔法开始并试图将其强行塞入数字计算机,而是从数字计算机本身出发,问道:“如果我们只观察记忆墙在每一秒钟是如何拉伸的呢?”

作者引入了一个名为“滞后算子”(Lag Operator)的新工具。要理解这个,请想象你正在看一部屏幕不断变宽的电影。每当电影向前推进一帧,屏幕就会稍微拉伸一点。滞后算子就像一把尺子,精确地测量屏幕拉伸了多少,以及上面的角色为了适应新尺寸发生了怎样的位移。通过使用这把尺子,作者可以直接计算出新的记忆状态,而不需要那些复杂的“魔法”步骤。他们发现,如果你使用一种特定的拉伸方式(指数级拉伸),你这个简单的新尺子就能得出与著名的、复杂的 HiPPO 图书管理员完全相同的结果。

在模拟实验中,团队证明了他们这种更简单的方法在数学上与旧的、复杂的方法是完全等价的。当他们将一个混沌且不可预测的信号(来自一个被称为 Lorenz63 的系统)输入到他们的模型中时,它构建的记忆与原始 HiPPO 模型如此接近,以至于差异几乎肉眼不可见——误差仅约为 0.000000576。这表明,他们的“滞后算子”不仅仅是一个聪明的技巧,它还是理解这些记忆系统运作方式的一种基本方式。

最棒的部分在于,这个新框架就像一套乐高积木。由于其数学逻辑如此简洁直接,你现在可以更换不同类型的“拉伸规则”(时间扭曲)和不同类型的“投影墙”(基函数),从而创建定制化的记忆系统。例如,你可以构建一个既能缓慢记住遥远的过去,又能保持对刚刚发生的一秒钟内事件敏锐关注的模型,而这一切都在一个统一的系统中完成。作者展示了这种方法如何为设计更聪明、更灵活、能够处理长篇故事而不产生混乱的 AI 打开了大门,同时让幕后的数学原理变得更加清晰易懂。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →