← 最新论文
🤖 machine learning

Emergent Sparsity in Frozen Random CNN Feature Extractors for Deep Reinforcement Learning

本文表明,使用冻结的、随机初始化的卷积神经网络特征提取器训练的深度强化学习智能体,会自发地发展出极其稀疏的全连接表示,这些表示随任务复杂度而缩放,并有效地界定了可实现的性能,从而在没有显式稀疏性诱导目标的情况下,揭示了底层问题的内在维度。

原作者: Scott M. Norton

发布于 2026-07-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Scott M. Norton

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个这样的世界:计算机学习玩游戏不是通过阅读说明书,而是通过盯着屏幕并猜测下一步该做什么。这就是*深度强化学习(Deep Reinforcement Learning, DRL)*的领域。把它想象成训练一只狗:你不需要告诉狗如何*去接飞盘,你只需要在它做对时给它零食,在它没做对时说声“不行”。随着时间的推移,狗就会掌握这个技巧。在计算机世界里,这只“狗”是一个神经网络——一个模仿大脑的巨大数学连接网络。通常,为了让这些计算机变得聪明,我们会让它们调整网络中每一个细微的连接,希望它们能找到观察世界最好的方式。但问题在于:这些计算机大脑往往是过度生长*的。它们拥有数百万个连接,就像一片树木过于茂密的森林,让人很难看清哪些连接是在起作用,哪些只是在添乱。科学家们长期以来一直在思考:这些巨大的大脑真的需要这么庞大吗?还是说存在一种更简单、更高效的方法来解决这些问题?

这时,一位名叫 Scott M. Norton 的好奇研究员提出了一个非常奇特的实验。他没有让计算机的“眼睛”(观察屏幕的部分)去学习和改变,而是将其冻结了。他拿了一个随机的、未经训练的摄像镜头并将其固定不动,拒绝让它学习任何新东西。然后,他要求计算机仅使用这个冻结的、随机的镜头来学习玩 Atari 游戏。人们原本预期计算机会表现得极其糟糕,或者至少难以理解那些模糊且随机的图像。但神奇且出人意料的事情发生了。计算机不仅学会了,而且学会得极其高效。在没有任何人告诉它要保持简洁的情况下,它自发地决定忽略掉自己 95% 的脑力。它关闭了几乎所有的神经元,仅靠极少数的神经元就解决了游戏。这就像是一个学生,手里拿着一本页面被随机粘在一起的教科书,却仅凭背诵三句话就考上了名校。

冻结镜头实验

在这项研究中,研究人员利用经典的电子游戏场景——Pong(一种数字网球游戏,玩家通过它将球来回击打)搭建了一个实验环境。他构建了一个标准的 AI 智能体,但加入了一个转折:AI 处理视频图像的部分(卷积神经网络,或称 CNN)是用随机数初始化的,并且被冻结了。它永远不被允许发生改变。AI 中唯一可以学习的部分是最后的决策层,即“全连接”部分,它接收图像数据并决定将挡板向上、向下移动还是保持不动。

通常,当我们训练这些 AI 智能体时,我们会让整个系统协同学习。“眼睛”学习识别球,“大脑”学习移动挡板。但在这次实验中,“眼睛”被困在一个随机且未经训练的世界视角中。研究人员原本预计 AI 会表现得很笨拙。然而,他们发现 AI 的大脑自发地发展出了稀疏表示(sparse representation)

“稀疏性(Sparsity)”是一个高级词汇,意为“使用极少量的东西”。想象一下,你有一个房间,里面有 64 个电灯开关。在正常的、经过充分训练的 AI 中,几乎所有 64 个开关都会随着游戏的进行而不断闪烁,产生复杂且嘈杂的模式。但在这次冻结实验中,AI 只开启了 64 个可用开关中的 1 到 3 个。它完全忽略了其他 61 个开关。它并不需要它们。AI 意识到,那个随机且冻结的镜头恰好拥有足以解决游戏的极少数“通道”信息,因此它关闭了其他一切,以节省能量并集中注意力。

“刚刚好”原则

这项发现最令人着迷的地方在于,AI 使用的开关数量并非随机,而是与游戏的难度相匹配。

  • Pong: 这是一个简单的游戏,只有一个球和两个挡板。AI 只需要 1 到 3 个神经元(大脑中微小的处理单元)就能精通它。
  • Breakout: 这个游戏涉及一个球、一个挡板和一堵砖墙。它更复杂。AI 需要 19 到 26 个神经元
  • Space Invaders(太空侵略者): 这是一个充满外星人、子弹和护盾的混乱游戏。AI 需要大约 42 个神经元

研究人员通过增加 AI 大脑的宽度(给予它更多可选的开关)进行了测试。即使他们给了 AI 128 个开关而不是 64 个,它仍然只使用大约相同的小数量(3 到 14 个)来解决游戏。它并没有因为有了更多选择就使用更多。看起来,AI 似乎感知到了游戏的“真实复杂度”,并且只使用了解决问题所绝对必需的脑力。

这意味着什么(以及它不意味着什么)

你可能会问:“AI 是不是只是运气好?”研究人员对此进行了彻底检查。他们发现,如果他们关掉 AI 正在使用的那几个特定神经元(这个过程被称为消融实验/ablation),AI 会瞬间忘记如何玩游戏并开始表现得完全随机。这证明了那几个神经元承担了所有的重任。其余的大脑对于该特定任务来说确实是无用的。

然而,论文谨慎地指出,这并不意味着这是适用于所有情况的灵丹妙药。研究人员发现,这种“冻结镜头”技巧在游戏具有清晰的、反应式结构(如 Pong 或 Breakout)时效果最好。在某些情况下,比如游戏 Freeway,AI 可以通过每次都向上移动来寻找“捷径”,这并不需要真正的学习。在这些情况下,“稀疏性”并不是智能的表现,而是走捷径的表现。但在那些需要真正技巧的游戏中,冻结的随机镜头迫使 AI 找到了最有效的路径。

大局观:在噪声中寻找信号

这个故事的核心在于效率。我们通常认为,要解决一个难题,你需要一台庞大且复杂的机器。但本文表明,如果你给一台机器一套固定的、随机的工具,它自然会找到使用这些工具最简单的方式。这就像是给某人一个装有百万种随机工具的巨型工具箱。一个聪明的人不会试图使用所有工具,而是会迅速意识到:“噢,我只需要这把螺丝刀和这把锤子就能修好这把椅子。”

研究人员还注意到了一些关于何时发生这一现象的细节。AI 在训练过程的非常早期——有时在最初的 1500 万步之内——就决定了使用哪些神经元。它在真正开始玩得好之前,很久就已经锁定了这些选择。就好像 AI 在第一天就选好了它的队员,然后在接下来的 1 亿步中仅仅是带着这支特定的队伍进行练习。

一个有趣的类比:收音机调谐器

想象一下,冻结的 CNN 就像一台被固定在某个特定随机频率上的收音机。传进来的信号是静电噪声和音乐的混合物。大多数人会想:“这台收音机坏了,我需要修理天线。”但这个 AI 不同。它不去尝试修理天线。相反,它倾听静电,并意识到:“嘿,如果我只调到这一个微小的静电切片上,我就能完美地听到音乐。”它忽略了其余的部分。

在 AI 世界中,我们通常试图制造更好的天线(训练整个网络)。这篇论文表明,有时,如果你只是让 AI 使用一个随机的天线,它自然会找到那个对它有意义的微小信号切片,并忽略其他部分。这提醒我们,有时候,少即是多,而自然(或者在这种情况下,一个冻结的随机网络)只要我们不再阻碍它,就有办法找到最简单的解决方案。

研究人员建议,这种现象可能有助于我们理解未来如何构建更聪明、更小的 AI 系统。与其构建庞大且浪费资源的网络,也许我们可以利用冻结的、随机的特征来帮助 AI 找到问题的“内在维度(intrinsic dimension)”——即真正重要的、微小的变量数量。这是向着构建不仅强大,而且优雅且高效的 AI 迈出的一步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →