← 最新论文
🤖 machine learning

How are linear representations learned? Exact solutions to the dynamics of abstraction

本文提出了一种关于抽象的动力学理论,该理论推导出了线性与非线性神经网络在训练过程中线性概念表示如何涌现的精确解,揭示了抽象受数据几何、网络深度和初始化尺度所支配,并遵循一种使激活值相对于前激活值减弱抽象程度的普遍衰减律。

原作者: William W. Yang, Andrew M. Saxe, Peter E. Latham

发布于 2026-07-13
📖 1 分钟阅读☕ 轻松阅读

原作者: William W. Yang, Andrew M. Saxe, Peter E. Latham

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正试图教一个机器人理解世界。你给它看红色的正方形、蓝色的正方形、红色的圆形和蓝色的圆形。你想让机器人学习到“正方形性”(square-ness)是一个单一且一致的概念,无论它是红色还是蓝色。在机器人的大脑(神经网络)中,这个概念被存储为一个巨大多维地图中的特定方向。如果机器人的理解是“抽象”的,那么在红色世界中“正方形减去圆形”的方向,应该与蓝色世界中“正方形减去圆形”的方向完全一致。它们应该是平行的。

这篇论文深入探讨了在学习过程中,这种完美的对齐是如何发生的,以及是什么阻碍了它的完美实现。

重大发现:“丰富型”与“懒惰型”的学习之舞

作者构建了一个简化且在数学上可解的神经网络版本,来实时观察这种对齐过程。他们发现,通往理解的路径并不是一条直线,而是一场带有意外转折的舞蹈。

把机器人的学习过程想象成一名徒步旅行者,试图到达一个特定的营地(最终完美的理解)。

  • 目的地: 最终营地的位置完全由地形(数据)和地图(目标)决定。如果数据是混乱的,营地就是混乱的。如果数据是干净的,营地就是完美的。
  • 徒步者的装备(初始化): 令人兴奋的部分在于,徒步者如何开始旅程会改变他们走的路径,即使目的地保持不变。
    • “丰富型”徒步者(微小起点): 如果机器人从极小的权重开始(就像一个背着极轻背包的徒步者),它会迅速跳过混乱的中间地带,并在很早阶段就达到一个完美对齐的状态。它会在那里停留很长一段时间,几乎像是陷入了一个完美理解的时间循环。作者称之为“亚稳态”(metastability)。这种状态是如此完美,以至于如果你在训练早期停止,你会认为机器人已经永久掌握了这个概念。
    • “懒惰型”徒步者(巨大起点): 如果机器人从较大的权重开始(背着沉重的背包),它永远无法达到那个高度。它只是缓慢地向最终目的地爬升并停在那里。它从未见过那个完美的时刻。

规则: 最终目的地是由数据固定的,但训练过程中的理解巅峰是由你起始的大小控制的。如果你起始得足够小,机器人甚至可以在数据有噪声的情况下,达到近乎完美的抽象。

深度效应:越深越聪明

论文还研究了当我们堆叠更多神经元层(就像建造更高的塔)时会发生什么。

  • 类比: 想象将信息传递给一排人。如果信息是“红色正方形”,第一个人说话时可能会带一点口音;第二个人会将其清理得更干净;当信息到达高塔顶端时,信息会变得非常清晰。
  • 发现: 作者在数学上证明了,随着你增加层数,最终的表示会变得更加抽象。这是一种平滑的插值:你走得越深,你就越接近“纯粹”的概念,前提是你试图预测的目标本身已经是抽象的。

非线性陷阱:为什么“激活”会削弱概念

真实的神经网络并非仅仅是直线;它们拥有“非线性”(如 ReLU 或 GELU),这些函数就像门控或过滤器。论文测试了将“概念方向”通过这些门控时会发生什么。

  • 发现: 这些门控会削弱对齐。它们就像灯泡上的调光开关。“前激活”(信号经过门控前)比“激活”(信号经过门控后)更明亮,也更具对齐性。
  • 证明: 作者为特定的非线性函数(如 erf 函数和 leaky ReLU)证明了一个“衰减定律”(Attenuation Law):这些非线性函数会降低信号相对于其前一阶段的抽象得分。他们推测这一结论适用于更广泛的非线性函数族,但严格的证明仅适用于这些特定情况。它们并不会神奇地修复糟糕的对齐,只会让情况变得稍微变差。

这对现实中的 AI 意味着什么

作者不仅停留在数学层面;他们还在像 DINOv3(视觉模型)和 Gemma 4(语言模型)这样真实的巨型模型上测试了这些想法。

  • 实验: 他们提取了这些巨型模型,并临时用恒等函数(identity function)替换了其中的 GELU 激活函数(本质上只是在该步骤移除了非线性),以观察会发生什么。
  • 结果: 当他们移除非线性时,概念变得更加抽象,且模型在泛化能力(将知识从一个语境转移到另一个语境)方面表现得更好。这证实了理论:非线性实际上模糊了概念。

这篇论文排除了什么

重要的是要了解这篇论文不是在讨论什么完整的故事:

  • 它不仅仅关于终点: 之前的理论通常只关注训练的最后阶段,假设机器人最终会达到完美。这篇论文表明,旅程本身很重要。机器人可能会达到一个完美的巅峰然后逐渐偏离,或者取决于它的起始方式,它可能永远无法达到那个高度。
  • 它并不总是完美的: 在现实世界中,由于数据的混乱,机器人很少能达到 100% 的完美对齐。论文表明,最终的抽象水平是一个基于输入和目标的“噪声”的数学公式。如果数据有噪声,无论训练多久,抽象都会是不完美的。

他们的可靠程度如何?

  • 数学: 对于简单的线性网络,作者拥有精确且已证实的解。他们不仅仅是在猜测;他们解出了方程。他们确切地知道抽象是如何随时间变化的。
  • 模拟: 对于深层的非线性网络,他们使用了模拟和数学近似(无限宽极限)。结果非常强大且符合理论,但这些结果是从这些特定的数学模型中推导出来的。
  • 现实世界: 当他们将此应用于 DINOv3 和 Gemma 4 时,他们进行了测量。实验表明,他们的理论是成立的:移除非线性确实提高了这些真实模型中的抽象度和泛化能力。

总结

理解概念的学习就像是在行走。目的地由数据决定,但你所走的路径取决于你的起点。如果你从微小处开始,你可能会达到一个持久的纯粹清晰时刻。如果你走得更深,你会变得更清晰。但要警惕途中的门控(非线性);它们往往会调暗你理解的光芒。通过理解这些动态机制,我们可以构建更好的工具来窥探 AI 的大脑,并使其变得更聪明。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →