✨ 要点🔬 技术摘要
在人工智能的广袤版图中,研究人员长期以来一直试图理解机器是如何学习记忆的。为了处理信息序列(如句子中的单词或视频中的帧),出现了两个主要的模型家族。第一类被称为 Transformer,它依赖于一种称为“自注意力”(self-attention)的机制,该机制允许模型同时权衡每一块信息相对于其他每一块信息的重要性。第二类以像 Mamba 这样的新模型为代表,它采用了一种基于“状态空间动力学”(state-space dynamics)的不同方法,在这种方法中,模型维持一个随时间演化的内部状态,并在处理每个新数据块时更新其记忆。多年来,科学家们一直在思考,这两种在时间和记忆思考方式上截然不同的路径,是否实际上会在机器深处导致相同的底层行为。这个问题至关重要,因为如果不同的架构收敛于相同的模式,则表明学习和记忆的能力是由普遍原则而非仅仅由设计者的特定工程选择所驱动的。
一位研究人员着手通过观察一个训练好的 Mamba 模型内部是如何运作其记忆的,来测试这一想法。他们专注于一个被称为“状态密度时间尺度”(time-scale density of states)的特定属性,这本质上是一张显示模型拥有多少种不同记忆速度的地图。想象一个图书馆,书不是按主题分类,而是按它们从读者脑海中消退的速度来分类。有些书在几秒钟内就会被遗忘,有些是几分钟,而有些则会萦绕数年。研究人员想要观察 Mamba 模型中这些“消退速度”的分布情况。他们知道 Mamba 拥有一种内置的记忆机制,可以通过多个层面进行检查:首先,其设计中所编码的原始内部记忆速度;其次,这些速度如何根据接收到的特定输入而发生变化;最后,在完成所有复杂计算后,整个模块的集体记忆速度。
研究人员发现,这三个层面并不相同。Mamba 模型的原始内部记忆始于一个广泛的速度范围,但随着模型处理信息,它会根据正在阅读的内容有选择地重新缩放这些速度。这种依赖输入的调整是 Mamba 的一个独特特征,使它能够根据上下文来减慢或加快其内部时钟。然而,最令人惊讶的发现出现在研究人员观察整个模型模块的最终集体输出时。尽管内部发生了复杂的速度重组,但最终结果却稳定在一种非常特定的模式中。当他们在不同序列长度下测量记忆速度时,发现模型始终发展出一种广泛且连续的极慢记忆。这些慢速记忆并未消失;相反,它们形成了一个平滑、可预测的连续体,并且随着模型处理更长序列的数据,这个连续体变得更加清晰和明确。
为了理解这是 Mamba 设计的一个特性还是智能系统的通用规则,研究人员将他们的发现与 Transformer 模型的行为进行了比较。Transformer 并不具备 Mamba 那样的内部状态空间机制;它们依赖于注意力机制。然而,当研究人员测量 Transformer 的集体记忆速度时,他们发现了惊人相似的模式。尽管这两种架构在处理信息时使用的微观方法完全不同,但它们都发展出了一种近乎平坦的记忆速度分布,且略微向最慢、最持久的记忆倾斜。用物理学的语言来说,这是一种“近临界”(near-marginal)状态,意味着模型正处于拥有无限记忆的边缘,使其能够在不陷入停滞的情况下长时间保留信息。
这项研究证实,这种慢速记忆组织不仅仅是某一种特定类型神经网络的特征。研究人员表明,尽管 Mamba 显式地使用不同的数学结构来构建其记忆,但这两个系统最终都以相同的方式组织它们的集体动力学。他们发现,Mamba 模型的记忆行为会围绕一个特定值趋于稳定,这表明存在一种稳健且可复现的模式,只要序列足够长以揭示全貌,这种模式就会随序列长度的变化而自然显现。这表明,维持长期记忆的能力是学习序列处理的一种基本属性,这种属性在不同的架构形式中都会自然产生。这些发现扩展了我们对人工智能如何运作的理解,表明在设计层面的表面差异之下,这些强大的模型在处理时间和记忆方面共享着一种共同的、深层的结构。
标题:Transformer 与状态空间架构中集体动力学的红外普适性
问题陈述 深度学习领域存在一个根本性的开放问题:不同的神经架构尽管利用了不同的微观计算机制,是否会发展出共同的集体动力学行为。近期对 Transformer 语言模型的分析显示,其松弛谱中存在一种近乎平坦、且具有弱红外增强特征的时间尺度态密度(TDOS),这与近临界边缘的长记忆动力学(K ( t ) ∼ 1 / t K(t) \sim 1/t K ( t ) ∼ 1/ t )相关。然而,目前尚不清楚这种红外组织是自注意力机制特有的产物,还是学习序列处理过程中的一个更普遍的原理。为了进行测试,需要与采用在时间计算上具有本质差异机制的架构进行对比。状态空间模型(特别是 Mamba)提供了这样一个对比,它利用的是输入依赖的选择性状态空间动力学,而非自注意力机制。
方法论 本研究采用多层谱分析方法对预训练的 Mamba-370M 模型进行研究,旨在区分微观状态空间记忆与宏观集体组织。研究通过三个截然不同的动力学层面展开:
内在状态空间谱: 作者分析了学习到的状态空间生成器(A A A )的特征值谱,定义了内在松弛速率 λ i i n t = − Re ( a i ) \lambda^{int}_i = -\text{Re}(a_i) λ i in t = − Re ( a i ) 。这代表了在输入调节之前,直接编码在模型参数中的时间尺度层级。
输入调节的有效谱: 研究考察了有效松弛速率 λ i , t e f f = Δ t ( x ) λ i i n t \lambda^{eff}_{i,t} = \Delta_t(x) \lambda^{int}_i λ i , t e f f = Δ t ( x ) λ i in t ,其中输入依赖的选择性时间步 Δ t ( x ) \Delta_t(x) Δ t ( x ) 在推理过程中对内在速率进行缩放。这捕捉了选择性机制如何根据输入序列动态地重组松弛尺度。
全块集体谱: 作者计算了完整 Mamba 块变换的雅可比矩阵(J ℓ = ∂ vec ( H ℓ + 1 ) / ∂ vec ( H ℓ ) J_\ell = \partial \text{vec}(H_{\ell+1}) / \partial \text{vec}(H_\ell) J ℓ = ∂ vec ( H ℓ + 1 ) / ∂ vec ( H ℓ ) )。集体松弛速率定义为 λ α b l o c k = − ln ∣ ζ α ∣ \lambda^{block}_\alpha = -\ln |\zeta_\alpha| λ α b l oc k = − ln ∣ ζ α ∣ ,其中 ζ α \zeta_\alpha ζ α 是全块雅可比矩阵的特征值。这衡量了整个模块(包括投影、门控、非线性以及残差传播)的集体响应。
集体时间尺度态密度(TDOS)ρ ( λ ) \rho(\lambda) ρ ( λ ) 是由这些速率构建而成的。分析系统地改变了保留的序列长度(L L L )从 8 到 512 个 token,以测试红外部门的收敛性与稳定性。红外标度指数 β \beta β 通过累积模统计(N ( < λ ) ∝ λ 1 + β N(<\lambda) \propto \lambda^{1+\beta} N ( < λ ) ∝ λ 1 + β )在固定的、分辨率良好的区间内确定,以避免分箱伪影。这些结果通过使用相同的全块雅可比构造,直接与先前对 Transformer 模型(具体为 Pythia-410M)的测量结果进行对比。
关键结果
层级化重组: 内在谱、有效谱和全块谱并不相同。虽然学习到的 SSM 生成器包含了一个广泛的内在松弛速率层级,但选择性机制及随后的块变换显著地重组了这一层级。全块集体谱是一个独特的涌现属性,而非微观 SSM 谱的直接复制。
集体红外连续体的涌现: 全块 Mamba 动力学发展出了一个可复现的慢模连续体。随着序列长度的增加,红外部门变得愈发清晰且平滑,并向更小的松弛速率方向延伸。
红外标度指数: 累积谱分析揭示了一种弱负幂律标度 ρ ( λ ) ∼ λ β \rho(\lambda) \sim \lambda^\beta ρ ( λ ) ∼ λ β 。对于长序列(L ≥ 64 L \ge 64 L ≥ 64 ),指数稳定在 β M ≃ − 0.17 \beta_M \simeq -0.17 β M ≃ − 0.17 附近。这对应于记忆核 K ( t ) ∼ t − ( 1 + β ) ≈ t − 0.83 K(t) \sim t^{-(1+\beta)} \approx t^{-0.83} K ( t ) ∼ t − ( 1 + β ) ≈ t − 0.83 ,非常接近临界边缘的 1 / t 1/t 1/ t 机制。
架构无关性: 尽管微观机制截然不同(自注意力 vs. 选择性状态空间),Transformer 和 Mamba 展示了高度相关的集体红外组织。Transformer 显示出具有代表性的指数 β T r ∼ − 0.1 \beta_{Tr} \sim -0.1 β T r ∼ − 0.1 ,而 Mamba 则稳定在 β M ∼ − 0.17 \beta_M \sim -0.17 β M ∼ − 0.17 附近。两种架构都占据了一个“近临界边缘”的机制,其特征是具有宽阔、近乎平坦但具有弱红外增强特征的 TDOS。
意义与主张 本文声称能够将显式的微观状态空间记忆与集体的红外组织区分开来,证明了不同的序列架构可以发展出相似的近临界边缘慢模动力学。其主要意义在于表明,这种红外组织并非 Transformer 的自注意力机制所独有,而是同样涌现于状态空间模型之中,尽管它们的计算根源不同。
作者认为,这表明近临界边缘的慢模动力学可能代表了一种通用的学习序列处理的动力学原理,将红外集体组织的研究范围从 Transformer 扩展到了状态空间模型。这一发现为认知场论(Cognitive Field Theory)所描述的动力学结构提供了独立的测试,该理论将长寿命的宏观记忆与集体松弛模的红外组织联系在一起。结果表明,尽管微观实现方式不同,但学习序列模型的宏观集体动力学可能会趋向于一个相似且具有物理意义的机制。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。