The Geometric Wall: Manifold Structure Predicts Layerwise Sparse Autoencoder Scaling Laws
原作者: Eslam Zaher, Maciej Trzaskowski, Quan Nguyen, Fred Roosta
原作者: Eslam Zaher, Maciej Trzaskowski, Quan Nguyen, Fred Roosta
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
技术摘要:几何之墙:流形结构预测逐层稀疏自编码器缩放定律
问题陈述
稀疏自编码器(SAEs)通过将模型激活重构为字典原子的稀疏线性组合,来实现线性表示假设(LRH)。这种方法隐含地假设激活空间可以很好地被全局线性结构近似。然而,现有的 SAE 重构损失缩放定律——特别是将损失与字典宽度(n)和稀疏度(k)联系起来的联合幂律——仅在单层(例如 GPT-4 的第 5/6 层)进行了拟合,并未解释在网络不同层之间观察到的重构误差的剧烈变化。
本文认为,这种变化不仅仅是资源限制,而是几何失配的经验痕迹。虽然 SAE 假设平坦的全局线性基,但大型语言模型的激活流形是弯曲的,且其内在维度随深度系统性地变化。因此,没有任何单一的稀疏线性字典能够均匀地匹配这些流形,导致 SAE 的宽度 - 稀疏度缩放成为流形几何的层依赖函数,而非普适定律。
方法论
作者利用 Gemma Scope 系列的 844 个残流 SAE 检查点,进行了首次跨层缩放研究,涵盖了 Gemma 2 2B 的所有 26 层和 Gemma 2 9B 的所有 42 层。分析分两个阶段进行:
阶段 1:逐层缩放曲面拟合
- 对于每一层,作者针对重构损失(L)作为字典宽度(n)和稀疏度(k)的函数,拟合了一个“无底限”的对数线性缩放曲面。
- 由于大多数层的宽度覆盖有限(仅有两个骨干宽度可用),他们拟合了一个 4 参数曲面:logL=a0+βnlogn+βklogk+γlognlogk。
- 由此,他们推导出了逐层宽度缩放指数 αℓ(k)=−(βn,ℓ+γℓlogk)。
- 在六个具有更丰富宽度网格(≥3 个宽度)的“展示层”上,他们执行了 6 参数“有底限”曲面(L=A(k)n−α(k)+B(k))的联合非线性拟合,以确定渐近重构底限 B(k)。
阶段 2:跨层几何回归
- 作者使用外欧几里得估计量(TWO-NN、多尺度 PCA 等)计算了激活流形的四个逐层几何摘要:
- 内在维度(dint):局部自由度。
- 多尺度曲率(κms):在不同半径下偏离切平面的平均值。
- 切空间变化(κtv):切空间旋转的速率。
- 异质性(ν):内在维度的局部变化。
- 他们使用普通最小二乘法(OLS)将阶段 1 的输出(特别是宽度指数 αℓ(k) 和系数 βn,γ)对这些几何摘要进行回归。
- 假设检验比较了几何不变的零假设(H0)与目标依赖于单一特征、低相关性特征对或所有四个特征的模型。
- 跨模型迁移:在一个模型(例如 2B)上学习到的系数被用于预测另一个模型(9B)的逐层指数,以检验是否存在可迁移的几何定律。
- 作者使用外欧几里得估计量(TWO-NN、多尺度 PCA 等)计算了激活流形的四个逐层几何摘要:
主要贡献
- SAE 残差的几何框架:本文提供了一个拉回信息几何解释,说明为什么激活空间可能无法容纳全局高效的稀疏线性编码。它提出激活空间上的“自然”度量是拉回 Fisher-Rao 度量,而 SAE 优化的是环境欧几里得距离,从而造成了基 - 流形失配。
- 几何条件缩放定律:作者将标准的宽度 - 稀疏度缩放定律扩展为几何条件解释。他们证明,缩放定律的参数(特别是宽度指数)是激活流形几何的逐层函数。
- 跨模型几何定律与底限耦合:
- 他们表明,在一个模型上学习到的回归系数能够成功预测另一个模型的逐层宽度缩放指数,这表明存在一种可迁移的几何定律。
- 在展示层上,渐近重构底限(B)跟踪几何排序:曲率和内在维度较高的层表现出较高的不可约底限。
结果
- 缩放指数的预测:流形几何强烈预测逐层宽度缩放指数 αℓ(k=50)。多尺度曲率(κms)是主导的单一特征,解释了 2B 模型中几乎所有的跨层变化以及 9B 模型中的大部分变化。
- 可迁移性:几何定律是可迁移的。在 Gemma 2 2B 上拟合的回归系数能够高保真地预测 9B 的指数(R2≈0.92−0.93),反之亦然,表明这种关系并非特定模型大小的产物。
- 几何之墙:在渐近底限可识别的层中,底限幅度与几何复杂性相关。较高的曲率和内在维度对应较高的底限。这被解释为不可约的二阶残差:平坦的稀疏线性字典无法完美近似弯曲的流形,留下了即使字典宽度趋于无穷大也不会消失的残差误差。
- 机制解释:“几何之墙”并非有限资源的天花板,而是依赖于几何的极限。较高的曲率增加了切平面的二阶偏离,而较高的内在维度减少了有限原子预算可覆盖的局部切空间份额。
意义与主张
本文主张将 SAE 的极限重新表述为依赖于几何的墙,而非资源天花板。它认为,SAE 忠实度在不同层之间的变化是由激活的几何结构决定的,而当前的单层缩放实践未对此进行建模。
作者并不声称 SAE 不适合可解释性。相反,他们断言逐层缩放行为从根本上受到 SAE 试图重构的流形结构的约束。研究结果表明,“线性表示假设”是一种依赖于度量的近似;“有意义的线性方向”并非度量无关的,SAE 使用的环境欧几里得度量与预测性拉回度量之间的对齐关系随深度系统性地变化。这项工作提供了一个诊断框架,用于理解 SAE 重构在何处以及为何失败,并将其直接关联到神经网络隐藏状态的内在几何结构。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。