← 最新论文
🧬 biology

Emergent Generalization by Representation Learning in Artificial Neural Networks

本文表明,通过信息瓶颈迫使人工神经网络学习低维表示对于实现泛化至关重要,这一过程以非单调的因果涌现动力学特征为特征,并镜像了在小鼠学习复杂任务时观察到的海马体活动,从而支持了涌现表示在认知中的功能性与因果性作用。

原作者: Hardik Rajpal, Dan Goodman

发布于 2026-07-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Hardik Rajpal, Dan Goodman

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

想象一下,你正试图教一个机器人预测未来。但这里有个转折:这个机器人正溺于一片噪声的海洋之中。每一秒钟,它都会接收到海量且混乱的数据流——就像是在盯着电视屏幕上漫天飞舞的雪花点时,试图预测天气一样。这就是科学家在面对高维数据(无论是来自计算机还是大脑)时所面临的问题。

核心问题是:一个系统是如何学会从所有这些噪声中看到真实的模式的?它只是在死记硬背噪声,还是找到了一个隐藏的、更简单的地图?

神奇的瓶颈

在这项研究中,研究人员构建了一种特殊的“机器人大脑”(神经网络)来解决一个时间序列预测游戏。他们向其输入由复杂的、旋转的数学形状——即“吸引子”(你可以把它想象成一个看不见的、旋转的舞池,点在其中按照特定模式移动)所生成的数据。

机器人的任务是猜出舞池的下一个动作。但有一个陷阱:数据被打乱了。机器人通过一个随机且不断变化的透镜(“随机正交投影”)观察舞池,这使得即使底层的动作是一致的,舞池看起来每次都完全不同。

研究人员发现,为了让机器人真正学会舞蹈并进行准确预测——即使舞池发生了变化或透镜发生了偏移——它需要一个“瓶颈”。

把这个瓶颈想象成拥挤派对中一条狭窄的走廊。如果所有人都试图同时冲进走廊,场面会变得混乱不堪。但如果走廊很窄,人们就会被迫挤在一起,脱掉沉重的外套(无关的噪声),然后以紧凑、有序的队伍通过。机器人强迫其数据通过这个狭窄的走廊,从而学习到了舞蹈的一个紧凑、低维的“秘密代码”。如果没有这个瓶颈,机器人只会死记硬背训练数据的特定噪声,并在游戏规则改变时彻底失败。有了这个瓶颈,它学习到了舞蹈的“本质”,从而能够预测它从未见过的动作。

“顿悟”的过山车

这里变得非常奇妙且酷炫。你可能会认为,随着机器人变得越来越擅长预测,它的能力会呈直线式地稳步提升。但研究人员发现了一些令人惊讶的事情:机器人的内部“秘密代码”经历了一场过山车式的旅程。

我们测量了所谓的“因果涌现”(causal emergence)。想象一群鸟。如果你只看一只鸟,你无法预测整个鸟群下一步会走向何方。但如果你观察鸟群的中心(“宏观”视角),你对整体路径的预测能力会比仅仅观察所有个体鸟类的总和要强得多。这就是“涌现”:整体的力量大于部分之和。

随着机器人的训练,它的内部代码不仅仅是在变好,而是经历了一个过程:

  1. 记忆阶段: 起初,机器人的内部代码在作为一个统一的、具有预测性的整体方面表现得反而更差了。它正忙于死记硬背训练数据的具体细节。
  2. 低谷期: 它遇到了一个低点,此时“涌现性”处于最低水平。
  3. 上升期: 突然间,在经过某个临界点后,代码转换成了新的形态。它变得高度有序且具有预测性。尽管机器人的误差率一直在平滑下降,但这一现象却发生了。

这种“先降后升”的模式被作者称为非单调轨迹(non-monotonic trajectory)。这表明,为了实现真正的泛化(即学习规则而非仅仅学习例子),系统必须经历一个“忘掉”噪声的过程,然后才能构建出强大的涌现结构。这与一种被称为“顿悟”(grokking)的现象有关,即模型在经历了一段看似困惑的时期后,突然“开窍”了。

与小鼠的联系

最令人兴奋的部分是,研究人员并没有止步于机器人。他们还观察了真实的小鼠。

他们研究了在 W 形迷宫中奔跑、通过交替路径寻找食物的小鼠。他们记录了两个脑区——CA1(海马体的一部分,大脑的 GPS)和内侧前额叶皮层(涉及决策制定)中的神经元电活动。

当研究人员使用相同的“涌现”数学方法分析小鼠的脑活动时,他们看到了完全相同的过山车模式。在 8 次训练课程中,随着小鼠学习迷宫,它们脑活动中的“涌现性”先是下降,然后显著上升。这种上升发生在小鼠表现力发生最终飞跃之前。

这表明,大脑就像机器人一样,可能需要构建这些紧凑的、涌现性的“神经流形”(neural manifolds,即隐藏的地图)来学习复杂任务。这不仅仅是一个副作用;它看起来像是学习过程中一个必要的步骤。

这意味着什么(以及并不意味着什么)

该论文有力地证明了,构建紧凑的、低维的表示对于泛化能力来说是一种功能性的超能力。它表明,如果没有这种压缩,系统会陷入死记硬背噪声的困境。

然而,作者也非常谨慎,没有过度夸大。他们明确指出,他们并未证明压缩总是泛化的必要条件(其他研究表明,神经网络在某些情况下可以在没有压缩的情况下实现泛化)。他们还指出,虽然他们的机器人模型运行完美,但这只是一个模拟,我们目前还不知道实现这一过程的精确“生物可塑性机制”(即物理上的布线变化变化)。

此外,该机器人模型可以预测下一步,但它目前还无法作为一个完整的生成模型来创造新的场景。

底线

这项研究表明,无论是在硅基还是生物基系统中,真正的智能可能都需要某种特定的“顿悟时刻”。这不仅仅是得到正确答案,更是关于如何将你的内在世界重新组织成一个更简单、更强大的地图,使其即使在游戏规则改变时依然有效。大脑(以及聪明的机器人)可能需要经历一段困惑和重组的阶段,才能构建出这些“神经流形”,而这些流形正是理解世界的“秘密配方”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →