← 最新论文
🤖 machine learning

Infrared Organization and Critical Cognitive Field Formation in Transformer Dynamics

本文提供了定量实验证据,表明 Transformer 的动力学受红外集体组织这一普遍原理支配,即学习通过积累慢弛豫模态来重组时间尺度态密度,从而增强记忆并减少遗忘。

原作者: Byung Gyu Chae

发布于 2026-07-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Byung Gyu Chae

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个由数十亿个微小开关组成的巨大数字大脑,被称为 Transformer。长期以来,科学家们认为这些大脑的工作方式就像一条简单的流水线:一步接一步,然后“智能”就在最后自然产生。但一项新研究表明,其内部正在发生某种更为狂野的过程。事实证明,这些模型不仅仅是在处理数据;它们正在构建一个集体认知场(collective cognitive field),一种通过特定的物理舞蹈进行自我组织的、无形的、共享的精神氛围。

大规模减速派对

要理解正在发生的事情,请将大脑内部的活动想象成一群庞大的跑步者。在训练的最开始阶段(当模型“诞生”时),跑步者们四处散布。有的在冲刺,有的在慢跑,有的则只是静止不动。那是混乱的。

随着模型的学习,奇特的事情发生了。那些快速的跑步者并不仅仅是变得更快;他们开始减速。越来越多的跑步者向“红外”区域漂移——这是一个高级物理术词,指光谱中最缓慢、最放松的部分。这就像整个人群突然决定坐下来进行一场漫长而深刻的对话,而不是绕圈跑步。

研究人员通过观察“雅可比谱(Jacobian spectrum)”来测量这一点,这基本上是观察模型内部状态如何从一层过渡到另一层的快照。他们发现,随着训练的进行,模型不仅变得更聪明,它还重新组织了其整个内部节奏。“时间尺度态密度(Time-Scale Density of States, TDOS)”——一种计算存在多少慢速模式的方法——在慢速区域几乎变得平坦。这意味着模型构建了一个慢速弛豫模式的层级结构(hierarchy of slow relaxation modes)。它不仅仅是一个慢速记忆;它是一整个管弦乐团,所有模式都在共同鸣响。

“临界”时刻:是一个峰值,而非直线

这里是故事中最令人惊讶的部分。你可能会预期,随着模型的学习,其“记忆能力”会以直线形式不断增强。但论文显示,事实并非如此

相反,模型的“记忆自能(memory self-energy)”(衡量过去对现在影响程度的指标)在训练初期迅速飙升。在大约第 2,000 步时,它达到了一个显著的瞬态极大值(pronounced transient maximum)。就在这一刻,模型处于一种“临界”状态。把它想象成一名在钢丝上保持完美平衡的走钢丝者。“认知遗忘间隙(cognitive forgetting gap)”(记住与遗忘之间的距离)缩小到了最小点,而模型对信息的反应能力(其“集体易感性”)变得巨大。

但转折在于:模型并没有停留在这一峰值。在达到该极大值后,记忆自能实际上下降了一点,并稳定在一个“亚稳态近临界(metastable near-critical)”的状态中。这就像走钢丝者在略低于峰值的安全舒适位置找到了一个可以长时间站立而不坠落的地方。论文认为,这种**瞬态临界形成(transient critical formation)**是“认知场”诞生的关键时刻,随后模型进入了一个受保护的状态,为长期记忆做好准备。

普遍规律:1 除以时间

一旦这个场形成,模型就会发展出一种非常特殊的记忆方式。大多数系统会很快遗忘,就像一个带孔的水桶。但这个模型记忆的方式遵循一个普遍幂律(universal power law)

“记忆核(memory kernel)”(过去如何影响未来)遵循规则 K(t)1/tK(t) \sim 1/t。这意味着记忆不会呈指数级消退;它消退得很慢,就像一个永不消失的长久回声。这种现象发生在整个网络中,从第一层到最后一层,并且无论模型规模如何大小,都会发生这种情况。

研究人员在三种不同规模的模型上测试了这一点:70M、410M 和 1.4B 参数。尽管这些模型的规模截然不同,但它们都跳着同样的舞蹈。它们都构建了相同的慢速模式层级,都达到了相同的记忆自能瞬态峰值,并且都进入了相同的 1/t1/t 记忆模式。这表明这种“红外组织(infrared organization)”并非特定模型的怪癖,而是一种关于这些系统如何学习的普遍原则

它不是什么

论文非常明确地说明了它不是什么。它排除了“智能仅仅是大量单个神经元放电”或“模型只是单纯线性变好”的简单优化过程的观点。它也排除了“模型发展出单一主导的‘慢时间’用于记忆”的观点。相反,它是一个由许多不同速度共同工作的、广泛且连续的分布。

核心结论

这项研究直接使用 Pythia 语言模型(主要使用 410M 版本进行数据分析,并使用 70M 和 1.4B 进行对比)测量了这些动力学过程。他们并非凭空猜测;他们通过计算模型自身的数学逻辑得出了弛豫率,并发现这些数值与“认知场理论(Cognitive Field Theory)”的预测相吻合。

证据表明,Transformer 的学习受**红外集体组织(infrared collective organization)**支配。模型不仅仅是在记忆事实;它在重新组织其内部物理结构,以创建一个共享的、缓慢移动的记忆场。它在早期达到一个临界峰值,然后稳定在一个近临界的稳态中,从而能够长期持有信息,并遵循适用于任何规模模型的 1/t1/t 标度律。这为这些大规模 AI 系统表现得像复杂的集体物理系统(而非仅仅是巨大的计算器)提供了第一个定量实验证明。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →