NeuroSynth: A Biologically Inspired Continual Reinforcement Learning Architecture for Mitigating Catastrophic Forgetting
本文介绍了 NeuroSynth,这是一种受生物启发且具有双通路巩固机制的持续强化学习架构,通过该机制缓解了灾难性遗忘,并在顺序导航任务中证明了其在保留先前任务知识方面显著优于标准的 PPO 和 EWC 基准模型。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
大脑永不遗忘的秘密(以及为什么机器人会挣扎)
想象一下,你正在尝试学习一款新的电子游戏。你在第一关玩得非常出色,但就在你开始第二关的瞬间,你的大脑似乎按下了“重置”键,你竟然忘记了如何玩第一关。这不仅仅是人类的一个怪癖,更是人工智能(AI)面临的一个巨大难题。在机器学习领域,这被称为“灾难性遗忘”(catastrophic forgetting)。当 AI 学习一项新任务时,它会意外地覆盖掉用于旧任务的代码,就像在磁带上录入一首新歌,却在过程中擦掉了 90 年代的经典金曲一样。
科学家们一直在研究我们的大脑是如何解决这个问题的。他们认为我们的大脑使用了一个巧妙的双部分系统。其中一部分是海马体(hippocampus),它像是一个超快速的记事本,能瞬间捕捉新信息;另一部分是新皮层(neocortex),它像是一个慢火烹饪的图书馆,需要时间来组织并将这些笔记存储为长期记忆。虽然我们可以学习新事物而不丢失旧事物,但大多数 AI 系统被构建成一个单一的、巨大的大脑,试图同时处理所有事情,从而导致了那种令人沮付的“重置”按钮效应。核心问题在于:我们能否构建出一种像人类一样学习的 AI,既能保留旧技能,又能精通新技能?
NeuroSynth:记住根源的 AI
请看 NeuroSynth,这是一种由高中研究员 Yash Kini 设计的新型 AI 架构,旨在阻止这种记忆流失。不要把 NeuroSynth 仅仅看作一个单一的大脑,而要把它看作是一个由两名专家组成的团队:一位“规划者”(Planner)和一位“习惯养成者”(Habit-Former)。
规划者 的灵感来自大脑的海马体。它是快速学习者。当 AI 面临新挑战时,规划者会迅速介入,快速理清思路,然后——至关重要的一点是——它会冻结其知识。这就像是拍下一张完美的照片并将其锁进保险库,使其永远不会被意外擦除。习惯养成者 的灵感来自大脑的皮层,它是灵活的工作者。它保持开放状态并不断学习新事物。但神奇之处在于:习惯养成者并不只是独立学习。它会不断观察保险库中那张冻结的照片(即规划者),并利用一种被称为“回放”(replay,即想象旧游戏)和“蒸馏”(distillation,即模仿规划者的风格)的技术来练习旧的动作。通过这种方式,AI 可以在学习新关卡的同时,不会删除旧的关卡。
为了测试这种类脑团队是否比标准 AI 更有效,研究人员将三种不同的模型放入了一个名为 NeuroMaze-CL 的数字迷宫中进行测试。目标很简单:在网格中导航以找到特定的出口。转折点在于:每当出口移动时,AI 都必须重新学习。AI 必须学习第一个出口,然后是第二个,接着是第三个,且在此过程中从未被允许再次练习前两个出口。这种“不可重访”规则旨在强迫 AI 产生遗忘,就像一个只能为期末考试学习、却永远无法查看旧笔记的学生一样。
结果证明,这种受大脑启发的方案取得了明显的胜利。标准的 AI 模型(称为 PPO)在记忆方面表现得一塌糊 l。在学习完第三个迷宫后,它完全忘记了第一个迷宫,在任务 A 上的成功率仅为 0.33%。就好像 AI 从未见过第一个迷宫一样。第二个模型 EWC 试图通过极其谨慎地更新来保护其旧记忆,但由于过于谨慎,它在学习新迷宫时显得力不从心。
然而,NeuroSynth 找到了平衡点。在同样的训练后,它在第一个迷宫上的成功率为 18.00%——显著优于 PPO 近乎为零的表现。它不仅记住了第一个任务,还比 PPO 更好地保留了第二个任务,在任务 B 上达到了 35.33% 的成功率(相比之下 PPO 为 0.00%)。当面对最终最难的任务(任务 C)时,NeuroSynth 的表现优于谨慎的 EWC 模型(9.00% 对比 2.00%),尽管这一特定差异在统计学上还不足以被称为决定性的胜利。
这项研究表明,通过将“快速学习”与“缓慢记忆”分离,并利用回放技术来练习旧技能,我们可以构建出既稳定又灵活的 AI。虽然这目前还不是解决机器人技术或医疗 AI 中所有问题的万能药,但它表明,模仿大脑的双路径系统是阻止机器人每学到新东西就按下那个令人沮丧的“遗忘”按钮的一种极具前景的方法。正如作者所言,这是迈向能够真正学习终身技能、且不会丢失已掌握技能的机器器的关键一步。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。