← 最新论文
🤖 machine learning

On the Expressiveness of State Space Models via Temporal Logics

本文利用时序逻辑分析了状态空间模型(SSMs)的表达能力,揭示了其能力如何根据门控机制和算术精度在正则语言到非正则语言之间变化,并系统地将这些发现与 Transformer 架构进行了比较。

原作者: Eric Alsmann, Lowejatan Noori, Martin Lange

发布于 2026-01-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Eric Alsmann, Lowejatan Noori, Martin Lange

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个机器人阅读一个故事并理解事件的顺序。在人工智能的世界里,有两种主要的“读者”(架构)正在竞争这个职位:著名的 Transformer(驱动当前聊天机器人的那种)和被称为 状态空间模型(SSM) 的后起之秀。

这篇论文是对 SSM “脑力”的一项理论研究。作者们并不是在询问这些模型在特定测试中的表现有多好;他们问的是:“无论我们如何训练,这些模型的理解能力绝对极限在哪里?”

为了回答这个问题,他们使用了一种特殊的“逻辑语言”(时序逻辑)作为衡量标准。以下是使用简单类比对他们发现的详细解读。

1. 两类主要的 SSM

论文根据这些模型处理信息的方式,将 SSM 分为两种主要类型:

  • 对角门控 SSM(“严谨的会计师”): 这些模型的规则是其内部的“门”(控制信息流的开关)可以根据当前正在阅读的词进行变化,但必须保持“对角线”特征。这就像一个计算器,你可以改变相加的数字,但不能把列与列之间混在一起。
  • 时不变 SSM(“稳定的时钟”): 这些模型的门无论在阅读什么词时都不会改变。它们就像节拍器或时钟一样;无论讲述什么故事,它们的滴答频率都是恒定的。

2. 精度的难题:尺子 vs 卷尺

作者还观察了这些模型内部数学运算的“精确度”。

  • 定点精度(Fixed-Precision): 想象使用一把只有 10 个刻度的尺子。无论故事有多长,你都无法测量比这些刻度更小的东西。这就像标准的计算机数学(浮点运算)。
  • 对数精度(Log-Precision): 想象使用一把会随着故事变长而自动变长且变得更精细的卷尺。如果故事长 100 个词,你的尺子就有 100 个刻度;如果故事长 1,000 个词,它就有 1,000 个刻度。这允许进行更精细的计数。

3. 它们究竟能理解什么?

“严谨的会计师”(对角线 SSM)

  • 使用简单的尺子(定点精度): 它们擅长理解事件的顺序。它们可以告诉你“A 发生在 B 之前”或者“A 发生了,然后 B 发生了,然后 C 发生了”。然而,它们有一个严重的盲点:它们无法进行循环计数。
    • 类比: 如果你要求它们识别某种模式,比如“偶数个 'a'”(例如 aa, aaaa, aaaaaa),它们会失败。因为它们的数学是单调的(只会增加或保持不变),它们最终会“卡住”,无法区分 2 个 'a' 和 4 个 'a'。
  • 使用增长的卷尺(对数精度): 如果你赋予它们精确计数的能力,它们会变得聪明得多。它们现在可以精确计算过去发生了多少次。它们可以理解复杂的模式,比如“'a' 的数量等于 'b' 的数量等于 'c' 的数量”。

“稳定的时钟”(时不变 SSM)

  • 使用简单的尺子: 这些模型在追踪复杂的“自从……”关系方面表现较差(例如,“自从上次看到 'b' 以来,是否看到了 'a'?”)。但是,它们有一个超能力:它们可以进行循环计数。
    • 类比: 由于其内部机制是一个恒定的循环,它们非常擅长知道“这是第 2、第 4 还是第 6 个词?”它们可以轻松识别出“会计师”失败的“偶数个 'a'”模式。
  • 使用增长的卷尺: 它们既可以进行循环计数,也可以进行总量计数。

“混合型”(混合 SSM)

如果将这两种类型的层结合起来(一些严谨的会计师,一些稳定的时钟),你就能获得两者的优点。它们可以理解顺序、循环和计数。论文表明,这些混合模型可以识别几乎任何你能想到的“正则”模式,直到达到一定的复杂度限制。

4. 它们如何与 Transformer 进行比较?

作者将他们的发现与我们已知的 Transformer 进行了对比:

  • 对角线 SSM(定点精度) 大致等同于没有位置提示的 Transformer(它们知道词的顺序,但不知道它们的精确位置)。
  • 时不变 SSM 等同于带有位置编码的 Transformer(它们知道自己在句子中的确切位置)。
  • 重大区别: 拥有“全局注意力”(如平均硬注意力类型)的 Transformer 可以查看整个故事,从而向前和向后进行计数。而 SSM 由于其本质,只能看向过去(已经阅读的内容)。因此,在处理计数发生在序列之后的事情时,SSM 的能力严格弱于最先进的 Transformer。

5. “不可能完成的任务”

最重要的启示是这些模型无法做的事情清单,无论你如何训练它们:

  • 一个定点精度的对角线 SSM 永远无法学会区分重复项目的奇数和偶数(如 aaaaa)。这是一个架构上的硬性限制,而不是训练失败。
  • 要打破这个限制,你必须要么改变架构(添加时不变层),要么提高数学精度(使用增长的卷尺)。

总结

把这些模型想象成不同的图书管理员:

  • 对角线(定点): 擅长按顺序读书,但如果被要求计数特定模式,就会感到困惑。
  • 时不变: 擅长数页数(奇偶数),但在处理复杂的“自从那时起”的故事时表现挣扎。
  • 混合型: 终极图书管理员,两者兼顾,但仍然无法通过“预读”下一章来计数。

论文证明了这些局限性是内置于架构的 DNA 之中的。你无法通过训练让一个“定点精度对角线”图书管理员变成一个“计数型”图书管理员;你必须给他们更好的工具(对数精度)或不同的脑结构(混合层)来实现目标。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →