On Subquadratic Architectures: From Applications to Principles
本文评估了领先的亚二次方架构(xLSTM、Mamba-2 和 Gated DeltaNet)在代码和时间序列任务中的表现,证明了 xLSTM 由于其门控机制能够实现更灵活且稳定的记忆修正与状态追踪,从而取得了卓越的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图构建一个超级智能的助手,它能阅读一本巨著、编写复杂的计算机代码,或者预测下周的天气。多年来,行业的标准一直是一种被称为 Transformer 的特定类型的引擎。它非常强大,但有一个致命缺陷:随着信息量(即“序列”)的增加,这个引擎会变得呈指数级沉重且缓慢。这就像是在背一个背包,你每增加一本书,背包就会比上一本重上一倍。
为了解决这个问题,科学家们发明了 亚二次方架构 (Subquadratic Architectures)。这些是旨在更轻量、更快速的新型引擎设计,它们随信息量的增长仅呈线性增长。但哪种新引擎才是最好的呢?
这篇论文让三位顶尖选手进行了一场比赛:xLSTM、Mamba-2 和 Gated DeltaNet。研究人员在三项非常困难的任务上对它们进行了测试:
- 编写代码: 一个充满严格规则和长链逻辑的任务。
- 向老师学习: 接收一个强大的、聪明的 AI,并教给一个更小、更快的 AI 以模仿其技能。
- 时间序列预测: 预测像股票价格或天气这样的事物,其中过去会对未来产生复杂的影响。
比赛结果
在所有领域中,xLSTM 胜出了。它是最一致且最准确的引擎,尤其是在任务复杂且需要记忆长链事件时。Mamba-2 和 Gated DeltaNet 虽然表现不错,但在处理最难的部分时经常出错。
为什么 xLSTM 会赢?(“记忆”类比)
为了理解原因,作者深入研究了它们的内部机制。他们发现所有这些引擎的工作原理都是通过维持一个“状态”或“记忆”来记录它们所看到的内容。他们对比了每种引擎如何处理两种关键的记忆技能:
- 累积 (Accumulation/计数器): 在长时间内保持运行总计或计数的能力(例如,计算在一份 100 页的文档中某个特定单词出现了多少次)。
- 状态追踪 (State Tracking/追踪器): 记住特定的、有序的细节并正确更新它们,而不丢失线索的能力(例如,记住“如果 A 发生,那么 B 必须发生,除非 C 先发生了”)。
以下是这三种引擎处理这些技能的方式:
- Mamba-2 就像一个被绑住手的严厉图书管理员。 它有一条规则说:“如果我忘记了某些东西,我也必须停止记录新的东西。”因为它的“遗忘”和“写入”开关是绑在一起的,所以它很难灵活地更新记忆。它擅长某些事情,但当故事变得太长时,它经常会丢掉计数或感到困惑。
- Gated DeltaNet 就像一块带有橡皮擦的白板。 它非常擅长用新信息 替换 旧信息。如果新的事实进来了,它会把旧的从板上擦掉。这对于检索(寻找最新的事实)非常有用,但对于计数却很糟糕。如果你需要记住“A + B + C = 10”,而白板为了腾出空间不断擦除旧数字,你就会丢失总数。
- xLSTM 就像一个带有荧光笔和计算器的智能笔记本。 它将记忆分为两部分:
- 其中一部分充当计算器,可以在不擦除任何内容的情况下保持运行总计(累积)。
- 另一部分充当笔记本,可以追踪特定状态并灵活地更新它们(状态追踪)。
- 至关重要的是,xLSTM 有一个特殊的“门控”,它充当了一个软橡皮擦。它不像 DeltaNet 那样直接擦干净整页,也不像 Mamba 那样无法擦除,而是可以根据新信息是否更重要来 减弱 旧信息的影响,或者在旧信息仍然相关时保留它。这种灵活性使其能够同时完美地完成计数和追踪。
证明: “长字符串”测试
为了证明这一理论,作者运行了一些简单的模拟任务测试:
- 计数测试: 要求 AI 统计一个远长于其训练长度的列表中的项目数量。
- 追踪测试: 要求 AI 在一个长序列中记住特定的“奇数”和“偶数”切换模式。
结果如下:
- Mamba-2 几乎立即失败了。随着列表变长,它忘了一切。
- Gated DeltaNet 可以进行一些计数,但在追踪任务中感到困惑。即使经过调整以提高追踪能力,它在处理极长距离的任务时仍然难以计数。
- xLSTM 是唯一一个能同时完成这两项任务的引擎。它既能在长距离内完美计数,也能在不丢失位置的情况下追踪复杂的模式。
核心结论
论文得出结论,xLSTM 是目前处理复杂任务的最优选择,因为它结合了两者的优点:既能保持运行总计(累积)的能力,又能追踪特定且变化的细节(状态追踪),而无需在两者之间做出抉择。虽然其他引擎在其中一项上表现出色,但 xLSTM 灵活的“记忆修正”机制使其能够处理现实世界代码和数据中那些混乱且具有长期依赖性的问题。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。