← 最新论文
🤖 machine learning

Regularity and Stability Properties of Selective SSMs with Discontinuous Gating

本文利用钝性(passivity)和输入-状态稳定性(Input-to-State Stability)等控制理论工具,为类似 Mamba 的选择性状态空间模型(SSMs)建立了严格的稳定性与正则性保证,并将这些发现转化为一种可微的训练期正则化项,在对预测准确度影响微乎其微的情况下,显著减少了稳定性违规现象。

原作者: Nikola Zubić, Davide Scaramuzza

发布于 2026-07-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Nikola Zubić, Davide Scaramuzza

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心图景: “智能记忆”问题

想象一个机器人在听讲述者讲故事时,试图记住一段很长的故事。现代 AI 模型(如 Mamba)就像这些机器人。它们拥有一个“记忆”(隐藏状态),随着听到的每个新词而更新。

棘手之处在于,这些模型是具有选择性的。它们并不会平等地存储所有信息。它们有一个“守门员”,逐个单词地决定什么该记住,什么该忘记。如果这个守门员过于混乱,机器人可能会感到困惑、忘记故事的开头,或者在讲述者声音变大时变得疯狂。

这篇论文探讨的是:我们如何确保这个守门员是稳定的? 我们如何确保即使在记忆规则瞬间发生变化时,机器人的记忆也不会爆炸或消失?

核心思想:能量与稳定性

作者使用控制理论(用于保持飞机稳定和机器人平衡的数学工具)来分析这些 AI 模型。

他们将 AI 的记忆视为一个电池水箱

  • 输入: 进入的新词汇。
  • 输出: 机器人的理解。
  • 存储: 机器人内部的记忆。

论文认为,为了使系统稳定,这个“电池”不应该凭空产生能量。它应该只存储从输入中获得的东西,并且应该随着时间的推移自然地损失一点能量(就像电池缓慢耗尽一样),这样旧的、无关紧要的记忆就会逐渐消退。这个概念被称为钝性(Passivity)耗散性(Dissipativity)

两种信号:“开关”与“驱动器”

论文中的一个关键洞察是将通常被混淆的两个事物分开:

  1. 驱动器(输入): 推动系统前进的实际数据(词汇)。
  2. 开关(选择): 改变系统如何对数据做出反应的内部决策过程。

类比: 想象一辆汽车。

  • 驱动器是你踩油门(输入)。
  • 开关是变速箱换挡(选择)。
  • 论文指出:“让我们通过观察变速箱如何独立于你踩油门的力度进行换挡,来分析汽车的稳定性。” 这让数学计算变得简洁得多,并揭示了关于变速箱为了防止汽车撞车而必须表现出的隐藏规则。

主要发现

1. “遗忘”规则

如果系统设计得当(具体来说,如果它具有“严格耗散性”属性),那么在没有新输入时,它会自然地以指数级速度遗忘旧信息。

  • 类比: 想象一个漏水的桶。如果你停止注水,桶不会永远是满的;它会排空。这很好!这意味着 AI 不会在处理最后一个词时,还死死记住句子的第一个词。论文从数学上证明了,如果系统构建得当,这种“泄漏”会自动发生。

2. “冻结”测试

作者观察了如果“冻结”选择开关(停止改变规则)并只让输入流动的现象。他们发现,即使在这种冻结设置下,系统也具有一种天然的、内置的“能量结构”(一种被称为二次存储函数的数学形状)。

  • 类比: 即使你把汽车的齿轮拆出来并锁死在原地,发动机和车轮之间仍然存在特定的物理关系。论文表明,Mamba 的记忆也有类似的“自然形状”,这解释了为什么某些初始化模型的方法(如 HiPPO)如此有效——因为它们尊重这种自然形状。

3. “不可逆遗忘”规则

这是一个引人入胜的结构性发现。论文表明,一旦系统判定某条信息是“无用”的(它进入了“核”或零能量区域),无论如何切换闸门都无法将其找回。

  • 类比: 想象一台碎纸机。一旦文件进入碎纸机并被切碎,你不能仅仅通过拨动一个开关就让纸张恢复原样。系统对于某些类型的信息存在一个“无法回头点”。这防止了 AI 因为试图复活旧的、无关的信息而产生混乱。

从理论到实践:“正则化器”

作者并没有止步于数学。他们构建了一个实用的工具,称为正则化器(Regularizer)

  • 问题: 在现实生活中,我们无法检查连续世界中无限的数学过程。我们必须检查计算机实际执行的离散步骤。
  • 解决方案: 他们为训练过程创建了一个“减速带”。在训练期间,模型会计算一个特定的数值(特征值),告诉它是否违反了稳定性规则。如果违反了,训练过程会增加一个微小的惩罚,将其推回趋向稳定的方向。
  • 结果: 他们在七个不同的真实数据集(如天气、交通和电力使用情况)上测试了该工具。
    • 成功: 该工具将“稳定性违规”次数减少了 92%
    • 代价: 预测精度几乎没有变化(差异小于 0.02%)。
    • 鲁棒性: 当他们加入噪声或“突发脉冲”(如突然的故障)时,带有该工具的模型内部表现得更冷静,尽管它并不能神奇地在混沌环境下实现完美的预测。

本论文并未声称的内容

作者非常诚实地说明了其工作的局限性:

  1. 它不是解决所有错误的万能药: 该工具使 Mamba AI 的内部记忆部分更加稳定,但它并不能修复整个 AI 网络(该网络还有归一化和路由等其他部分)。
  2. 它不能保证在混沌环境下的完美预测: 虽然在数据有噪声时内部记忆变得更稳定,但最终的预测准确度并没有显著提高。该工具让引擎运行得更平顺,但不一定能让汽车在暴风雨中开得更快。
  3. 它是一个“软性”规则: 该工具鼓励稳定性,但并不强制要求模型在数学证明意义上达到完美的稳定。它只是让模型变得极不容易崩溃。

总结

这篇论文利用能量与稳定性的物理学原理,对一种复杂的现代 AI 架构(Mamba)进行了分析。他们证明了这些模型具有一种有助于遗忘的自然“泄漏”,以及一个防止复活无用记忆的“碎纸机”。随后,他们构建了一个简单且低成本的工具,帮助这些模型遵循这些规则,在不损害预测未来能力的前提下,使其更加稳定可靠。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →