← 最新论文
🧬 biology

Dynamic gain neuromodulation attenuates the stability gap under joint training

本文引入了动态增益神经调制(dynamic gain neuromodulation),这是一种受生物机制启发、通过瞬时增加神经元增益来平衡塑性与稳定性,从而有效缓解在各种基准测试中观察到的联合持续学习稳定性差距的双时间尺度优化技术。

原作者: Alejandro Rodriguez-Garcia, Anindya Ghosh, Srikanth Ramaswamy

发布于 2026-08-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Alejandro Rodriguez-Garcia, Anindya Ghosh, Srikanth Ramaswamy

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

想象一下,你正在教一个超级聪明的机器人识别不同的事物,一次学习一项新技能。首先,它学会了识别猫,然后是狗,接着是鸟。在人工智能的世界里,这被称为“持续学习”(continual learning)。伟大的梦想是让机器人能够永远学习下去而不忘记旧知识,就像人类一样。但问题在于:当机器人尝试学习新事物时,它往往会感到困惑,并暂时忘记旧有的技能。科学家们称之为“稳定性差距”(stability gap)。这就像一名学生,就在他开始为新的数学测试而学习时,突然忘记了上周刚掌握的乘法运算。即使机器人在学习所有内容且同时进行学习时拥有所有的旧笔记,这种情况也会发生。研究人员提出的问题是:为什么这种暂时的恐慌会发生?我们能否修复机器人的大脑,让它在学习过程中保持冷静和稳定?

这篇论文介绍了一种训练这些机器人的巧妙新方法,其灵感来源于我们的大脑如何处理“惊喜”。纽卡斯尔大学的作者们注意到,当我们对新事物感到不确定或惊讶时,我们大脑中一种叫做去甲肾上腺素(noradrenaline)的化学物质会给我们的神经元提供一个临时的“增强”(boost)。这就像是在收音机信号微弱时,暂时调大音量以便听清微弱的信号。研究人员构建了一个模仿这种生物特性的计算机算法。他们称之为“动态增益神经调制”(Dynamic Gain Neuromodulation),简称 NGM-SGD。这种方法不仅仅是改变机器人的学习速度,而是暂时改变机器人对所学数据的“感知方式”。通过这样做,机器人可以快速适应新任务,而不会剧烈扰动它对旧知识的记忆。这项研究表明,这种方法有效地平滑了那些通常发生在机器人切换任务时出现的性能大幅下降现象,使学习过程变得更加稳定。

问题所在:机器人的“脑雾”

要理解解决方案,我们首先需要理解这个故障。当人工智能学习新任务时,它通常会变得非常擅长。但在它切换到新任务的那一刻,它在“旧任务”上的表现往往会大幅下滑。这并不是说机器人永久地忘记了所有东西(那被称为“灾难性遗忘”,是一个更严重的永久性问题),而是一种暂时的“脑雾”。机器人因为对新数据感到过于兴奋或困惑,导致其表现“过冲”了目标,在能够恢复稳定之前,不小心破坏了旧有的知识。

即使是目前最优秀的 AI 训练工具,比如流行的 Adam 或 Momentum-SGD 优化器,也难以应对这个问题。它们试图平滑过程,但仍然会导致机器人在一个任务的终点和下一个任务的起点之间出现踉跄。本文的作者意识到,问题不仅在于机器人正在学习“什么”,更在于它“如何”学习。他们想要找到一种让过渡更平滑的方法,就像汽车换挡时不会让乘客感到颠簸一样。

解决方案:大脑的“音量旋钮”

作者们向自然寻求灵感。在我们的大脑中,一种叫做去甲肾上腺素的化学信使充当着神经元的“音量旋钮”。当我们遇到意想不到或不确定的情况时,这种化学物质就会迅速行动,暂时提高神经元的“增益”(或敏感度)。这并不会改变神经元正在“听”的内容,但会让它们对新信息的反应更加强烈。

研究人员将这一生物学理念转化为了 AI 的数学规则。他们创建了一个系统,让 AI 的“神经元”拥有一个动态增益旋钮。当 AI 遇到新任务或感到不确定时(他们通过 AI 对自身预测的困惑程度来衡量),系统会自动调高增益。

这里是神奇之处:调高增益会同时实现两件事:

  1. 加速学习: 就像调大音量能帮你听到耳语一样,增益的提升能帮助 AI 更快地学习新任务。
  2. 平整地形: 想象 AI 正在试图寻找一个山谷的底部(即完美答案)。通常,这个山谷的侧壁是陡峭且崎岖不平的。如果 AI 迈出的步子太大,可能会撞到侧壁并失去平衡。增益的提升实际上在瞬间“平整”了山谷的侧壁。这使得 AI 可以朝着新答案迈出自信的一大步,而不会撞到墙壁并失去对旧答案的掌控。

研究发现:更平滑的过渡

团队使用几个著名的图像识别挑战赛测试了他们的新方法(命名为 NGM-SGD),并将其与标准工具进行了对比。他们使用了如 MNIST(手写数字)、CIFAR-10(小型动物或物体照片)和 mini-ImageNet(更难的一组图像)等数据集。他们设置了测试环境,让 AI 必须一个接一个地学习任务,比如先学习数字 0-1,然后是 2-3,接着是 4-5,以此类推。

结果非常明确。当标准工具(如 Adam 或 Momentum-SGD)切换任务时,AI 在旧任务上的准确率会大幅下降——有时甚至非常严重。这就是所谓的“稳定性差距”。然而,使用 NGM-SGD 方法时,这些下降幅度要小得多,AI 表现得更加稳定。

例如,在 Split MNIST 测试(按组学习数字)中,标准的 Momentum-SGD 方法看到的稳定性差距(即旧任务准确率的下降)约为 0.267。相比之下,NGM-SGD 方法的差距仅为 0.017。这是一个巨大的差异。AI 不仅学会了新任务,而且在切换过程中更好地保护了旧技能。

他们还在 Split CIFAR-10Split mini-ImageNet 上进行了测试。在这些更难的测试中,标准方法分别显示出 0.4250.409 的差距。而 NGM-SGD 方法将这些差距分别降低到了 0.1340.300。虽然差距并未完全消失,但已显著缩小,这意味着机器人不太可能陷入恐慌并遗忘。

为什么有效:“快”与“慢”的大脑

论文解释说,这是因为增益提升创造了一个“双时间尺度”系统,类似于我们大脑可能既有快速学习也有慢速学习的方式。

  • 慢的部分: AI 的主要权重(长期记忆)变化缓慢且稳定。
  • 快的部分: 增益提升充当了一个临时的、快速的层。它让 AI 进行大幅度的、快速的调整以处理新任务,而不会永久性地扰乱缓慢且稳定的记忆。

一旦 AI 熟悉了新任务且不确定性降低,增益就会自然地恢复到正常水平。这确保了 AI 不会永远处于过度敏感的状态,否则会导致不稳定。

结论

作者认为,这种方法为训练 AI 提供了一种全新的思考方式。他们提议的不是仅仅强迫 AI 完美地记住一切,而是改变学习过程本身的“几何结构”。通过使用受生物启发的“增益”旋钮,他们可以让任务之间的路径变得更加平滑。

需要注意的是,这项研究是在一个受控环境中进行的,AI 可以同时看到其所有的旧数据(称为“联合训练”)。这样做是为了证明稳定性差距是由于“学习过程”本身造成的,而不仅仅是缺乏记忆。结果表明,即使拥有完美的记忆,更新 AI 大脑的方式也至关重要。虽然该方法并没有让 AI 变得更聪明(它并没有比最好的标准方法获得更高的最终得分),但它让学习的过程变得平稳得多。

在现实世界中,当机器人和 AI 系统需要在运行中学习新技能,同时又不至于崩溃或忘记重要的安全规则时,这种稳定性是至关重要的。论文指出,通过模仿大脑处理不确定性的方式,我们可以构建出既能学习新技巧,又不会丢掉旧本领的 AI。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →