✨ 要点🔬 技术摘要
想象一下,你正试图回忆一个很长的故事,但你的大脑有一个严格的规则:你一次只能手里拿着一张极小的、固定大小的便签卡。随着新句子的到来,你必须决定在卡片上写什么,以及擦除什么。如果你擦除得太多,你会忘记情节;如果你写得太多,你就会没有空间。这就是人工智能在试图理解长序列数据(如小说、歌曲或股票市场历史)时每天面临的挣扎。
长期以来,解决这个“记忆卡”问题的最佳方法是使用一种被称为结构化状态空间模型(SSMs)的方法。把这些模型想象成一位超级聪明的图书管理员,他不仅是在阅读故事,还将整本书的历史投影到一面特殊的、不断变化的墙上。随着故事变得越来越长,墙面会拉伸,图书管理员使用一套复杂的数学规则来计算如何将旧页面挤压到角落,从而为新内容腾出空间。其中最著名的版本叫做 HiPPO,它表现得非常出色,但想要弄清楚它的工作原理,就像是试图通过戴着厚重手套并以慢动作观察魔术师表演来理解一个魔术一样。它背后的数学涉及连续时间、微分方程以及一个感觉像乱作一团的电线结的过程。它确实有效,但在一切都太迟之前,没人能完全明白这种魔法是如何发生的。
这正是 Sutashu Tomonaga、Kenji Doya 和 Noboru Murata 的一篇新论文介入的地方。他们决定通过一个完全不同的角度来解开那个结。他们没有从复杂、连续时间的魔法开始并试图将其强行塞入数字计算机,而是从数字计算机本身出发,问道:“如果我们只观察记忆墙在每一秒钟是如何拉伸的呢?”
作者引入了一个名为“滞后算子”(Lag Operator)的新工具。要理解这个,请想象你正在看一部屏幕不断变宽的电影。每当电影向前推进一帧,屏幕就会稍微拉伸一点。滞后算子就像一把尺子,精确地测量屏幕拉伸了多少,以及上面的角色为了适应新尺寸发生了怎样的位移。通过使用这把尺子,作者可以直接计算出新的记忆状态,而不需要那些复杂的“魔法”步骤。他们发现,如果你使用一种特定的拉伸方式(指数级拉伸),你这个简单的新尺子就能得出与著名的、复杂的 HiPPO 图书管理员完全相同的结果。
在模拟实验中,团队证明了他们这种更简单的方法在数学上与旧的、复杂的方法是完全等价的。当他们将一个混沌且不可预测的信号(来自一个被称为 Lorenz63 的系统)输入到他们的模型中时,它构建的记忆与原始 HiPPO 模型如此接近,以至于差异几乎肉眼不可见——误差仅约为 0.000000576。这表明,他们的“滞后算子”不仅仅是一个聪明的技巧,它还是理解这些记忆系统运作方式的一种基本方式。
最棒的部分在于,这个新框架就像一套乐高积木。由于其数学逻辑如此简洁直接,你现在可以更换不同类型的“拉伸规则”(时间扭曲)和不同类型的“投影墙”(基函数),从而创建定制化的记忆系统。例如,你可以构建一个既能缓慢记住遥远的过去,又能保持对刚刚发生的一秒钟内事件敏锐关注的模型,而这一切都在一个统一的系统中完成。作者展示了这种方法如何为设计更聪明、更灵活、能够处理长篇故事而不产生混乱的 AI 打开了大门,同时让幕后的数学原理变得更加清晰易懂。
技术摘要:滞后算子 SSM:一种用于结构化状态空间建模的几何框架
问题陈述
结构化状态空间模型(SSM),例如支撑 Mamba 架构的模型,已成为处理长程序列建模的强大工具,能够提供线性缩放能力和有效的动力学记忆压缩。然而,现有 SSM(特别是 HiPPO 高阶多项式投影算子框架)的理论基础依赖于一个复杂的、多阶段的推导过程。这一过程包括:
使用随时间变化的测度通过连续时间常微分方程(ODE)来近似信号历史。
从这些连续动力学中导出状态矩阵。
对生成的 ODE 进行离散化,以获得实际的递归形式。
这种复杂的流水线掩盖了状态更新背后的几何直觉,使得原则性的扩展和新型 SSM 的设计变得困难。作者认为,信号历史与最终状态更新之间的直接几何联系被中间步骤(即连续时间建模及其随后的离散化)所隐藏了。
方法论
本文引入了一个滞后算子框架(Lag Operator Framework) ,该框架直接从第一性原理出发构建离散时间 SSM,绕过了中间的连续时间 ODE 阶段。其核心方法是一种新颖的滞后算子 (σ t ∘ σ t + 1 − 1 \sigma_t \circ \sigma^{-1}_{t+1} σ t ∘ σ t + 1 − 1 ),它通过测量系统的基函数在相邻两个时间步之间如何进行“定义域扩张”,从而在几何上推导出离散时间递归。
核心组件:
时间扭曲与基构造:
框架定义了一个时间扭曲函数 σ t \sigma_t σ t ,将无限历史区间 T t = ( − ∞ , t ] T_t = (-\infty, t] T t = ( − ∞ , t ] 映射到规范区间 Z Z Z (例如 ( 0 , 1 ] (0, 1] ( 0 , 1 ] )。
在 Z Z Z 上定义正交归一基 Φ \Phi Φ 。通过对 Φ \Phi Φ 进行 σ t \sigma_t σ t 扭曲,构造出历史区间上的基 Ψ t \Psi_t Ψ t 。
通过特定的测度密度 ω t ( s ) = ∣ σ t ′ ( s ) ∣ \omega_t(s) = |\sigma'_t(s)| ω t ( s ) = ∣ σ t ′ ( s ) ∣ 引入感应内积,以确保扭曲后的基保持正交归一性。
信号近似与在线更新:
通过将信号历史投影到时间扭曲基 Ψ t \Psi_t Ψ t 上,得到系数 c t c_t c t 。
当接收到新输入 u t + 1 u_{t+1} u t + 1 时,历史区间扩展至 T t + 1 T_{t+1} T t + 1 。框架定义了一个中间扩展信号,并将其投影到新基 Ψ t + 1 \Psi_{t+1} Ψ t + 1 上。
滞后算子推导:
状态转移矩阵 A t A_t A t 和输入矩阵 B t B_t B t 直接通过涉及滞后算子的单个内积导出。
具体而言,A t A_t A t 被定义为新基函数 ψ t + 1 , n \psi_{t+1,n} ψ t + 1 , n 与旧基函数 ψ t , m \psi_{t,m} ψ t , m 的内积,这可以简化为 ⟨ ϕ n , ϕ m ∘ ( σ t ∘ σ t + 1 − 1 ) ⟩ \langle \phi_n, \phi_m \circ (\sigma_t \circ \sigma^{-1}_{t+1}) \rangle ⟨ ϕ n , ϕ m ∘ ( σ t ∘ σ t + 1 − 1 )⟩ 。
这种形式化将状态转移解释为投影的“重扭曲(re-warping)”,其中滞后算子 σ t ∘ σ t + 1 − 1 \sigma_t \circ \sigma^{-1}_{t+1} σ t ∘ σ t + 1 − 1 负责处理定义域的扩张。
模块化:
该框架将规范基 Φ \Phi Φ 的选择与时间扭曲函数 σ t \sigma_t σ t 解耦。这允许通过组合不同的扭曲方案和基函数,灵活地构建具有多样化记忆特性(如多分辨率记忆)的 SSM。
主要贡献
直接的离散时间构建: 本文提供了一个基于第一性原理的框架,用于构建离 disrete 时间 SSM,完全绕过了传统 HiPPO 推导中所需的中间连续时间 ODE 和离散化步骤。
几何解释: 引入了滞后算子 作为一种量化定义域扩张的几何映射,为将状态转移视为压缩历史的“重扭曲”提供了清晰的直觉。
对 HiPPO 的理论恢复: 作者证明了其框架的一个特定实例(使用指数时间扭曲和勒让德多项式)可以精确恢复影响力深远的 HiPPO-LegS 的递归关系。这为 HiPPO 本身提供了更基本的几何基础。
模块化设计空间: 该框架通过独立选择扭曲函数和基函数,实现了一个模块化的设计空间。这使得创建诸如多分辨率记忆(同时追踪长期趋势和细粒度细节)以及频率保持振荡模型等新型 SSM 成为可能。
结果
本文通过理论证明和数值模拟验证了该框架:
理论验证:
命题 1 & 2: 作者从其离散滞后算子框架中导出了连续时间生成器(A g e n , B g e n A_{gen}, B_{gen} A g e n , B g e n )。他们证明了对于指数扭曲,这些生成器与已知的 HiPPO-LegS 矩阵一致(在转置和倾斜偏移的意义下),从而确认了框架的有效性。
收敛性: 证明了当时间步长 Δ → 0 \Delta \to 0 Δ → 0 时,离散转移矩阵 A Δ A_\Delta A Δ 收敛于连续生成器的矩阵指数。
数值验证:
矩阵等价性: 使用混沌 Lorenz63 信号进行的模拟证实,通过滞后算子框架导出的矩阵与解析的 HiPSO-LegS 矩阵在数值上是等价的,其 Frobenius 范数差异极小。
记忆动力学: 滞后算子模型重建的信号历史与 HiPPO-LegS 基准几乎完全一致(均方误差 ≈ 5.76 × 10 − 7 \approx 5.76 \times 10^{-7} ≈ 5.76 × 1 0 − 7 )。两种模型都成功捕捉了近期历史,并表现出预期的对远期事件的指数衰减。
意义与主张
本文将这项工作定位为迈向更灵活、更具解释性的结构化状态空间模型理论的基础性一步。
概念清晰度: 该框架将记忆控制统一为一个单一组件——时间扭曲 σ t \sigma_t σ t ,取代了 HiPPO 复杂的、多阶段的推导,实现了直接的几何投影。这简化了对如何设计记忆剖面的理解。
设计灵活性: 通过将基与时间扭曲解耦,该框架开启了一个模块化的设计空间。作者声称,这允许通过原则性的方式构建具有异构记忆衰减率(例如多分辨率记忆)和专门处理振荡信号能力的 SSM,而这些在标准的基于 ODE 的推导中难以实现。
可互换性: 数值结果验证了所提出的框架生成的记忆组件在行为上与原始 HiPPO 递归完全相同,从而确立了其作为未来序列建模架构中鲁棒且可互换的构建模块的地位。
作者明确指出,虽然他们提供了概念验证和新颖设计(如多分辨率滞后-SSM)的理论草图,但完整的实现和下游任务的基准测试将留待未来工作。目前的贡献主要是理论性的,为理解状态空间模型的机制提供了新的视角。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。