← 最新论文
💻 computer science

Don't Forget the Critic: Value-Based Data Rehearsal for Multi-Cyclic Continual Reinforcement Learning

本文提出了 Qreg+NWLU,这是一种面向多周期持续强化学习的基于价值的数据重演方法,它通过引入连续 Q 值收集与即时“无等待”正则化,克服了以策略为核心的方法的局限性,从而有效缓解灾难性遗忘并增强知识迁移。

原作者: Benjamin Poole, Andrew Quinn, Li Yang, Minwoo Lee

发布于 2026-05-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Benjamin Poole, Andrew Quinn, Li Yang, Minwoo Lee

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人玩一系列电子游戏。首先,它学习玩《Flappy Bird》。然后,你把它切换到《Catcher》,接着再切换到一款名为《Room》的迷宫游戏。目标是让机器人精通所有这些游戏,同时不忘记如何玩第一款游戏。

在人工智能领域,这被称为持续学习(Continual Learning)。机器人面临的最大问题是“灾难性遗忘(catastrophic forgetting)”。这就像一个学生为数学考试学习,然后立即开始为历史考试学习,结果等到历史考试结束时,完全忘记了如何做数学题。

旧方法:“执行者”与“评论者”

大多数先前的研究试图通过只关注机器人的“肌肉记忆”(称为执行者 Actor)来解决这个问题。他们使用了一种称为**数据重演(Data Rehearsal)**的技术,这就像给机器人一本小笔记本,记录它过去游戏的笔记,以便在学习新游戏时翻阅。

然而,机器人的大脑还有第二部分,称为评论者(Critic)(或价值函数)。评论者就像一位教练,不断评估:“这一步有多好?我会获得多少奖励?”

先前的研究人员发现,如果他们试图利用“笔记本”(重演)来帮助评论者记住旧的分数,机器人学习的效果反而变差了。因此,他们停止尝试帮助评论者,只帮助执行者。本文的作者说:“等一下。我们忽略了半个大脑!”他们想看看是否能在不破坏评论者的情况下修复它。

新想法:Qreg+NWLU

作者尝试了一种名为**Qreg(Q 值正则化)*的新方法。这仅仅是利用笔记本提醒评论者,旧动作的分数曾经*是多少。

但他们发现,标准的做法很混乱。这就像试图通过只阅读教科书的最后一页来备考,或者等到整个学期结束才查看笔记。这导致机器人感到困惑或迅速遗忘。

为了解决这个问题,他们引入了两个简单的改进,并将它们组合成一种名为Qreg+NWLU的新方法:

  1. 实时更新(“实时”策略):

    • 问题: 在旧方法中,机器人要等到完成整个游戏关卡后才保存任何笔记。如果机器人在关卡开始时犯了错,那些笔记就永远不会被保存。
    • 改进: 现在,机器人在游戏过程中持续地记录笔记。这就像学生在讲座期间实时记笔记,而不是试图在课后记住所有内容。这确保了笔记的多样性,涵盖了整个游戏,而不仅仅是结尾部分。
  2. 无需等待(“无等待”策略):

    • 问题: 旧方法规定,“在完成第一款游戏之前,不要查看旧笔记。”这意味着机器人开始学习第二款游戏时是“冷启动”,立即忘记了所有内容。
    • 改进: 一旦机器人笔记本里有了任何笔记,它就立即开始利用这些笔记来帮助学习新游戏。这就像学生一走进新教室就开始复习旧笔记,而不是等到老师讲完第一课才行动。

“多循环”挑战

作者还在一个名为**多循环(Multi-Cyclic)**的特殊环境中测试了这种方法。想象一下,机器人玩《Flappy Bird》,然后玩《Catcher》,接着玩《Room》。但随后,循环重新开始:再次玩《Flappy Bird》,然后再次玩《Catcher》。

在现实生活中,我们经常面临重复的情况(例如,机器人吸尘器每天清洁相同的房间,或者股票交易员每周看到相同的市场模式)。作者发现,大多数机器人在这种循环中表现糟糕;每次循环重复,它们的表现都会变差。然而,他们的新方法允许机器人在经历多次循环后,仍然能够记住旧游戏。

结果

当他们测试这种新的Qreg+NWLU方法时:

  • 记忆更好: 机器人在学习第二款游戏时,没有忘记如何玩第一款游戏。
  • 学习更快: 因为它立即复习笔记(“无等待”),所以没有浪费时间重新学习基础知识。
  • 更稳定: 机器人的表现不会在“天才”和“困惑”之间剧烈波动。

核心结论

本文认为,要教机器人持续学习,我们不应该只训练它的“肌肉”(执行者);我们还必须训练它的“教练”(评论者)。通过给教练一本实时更新立即复习的笔记本,机器人可以在学习新任务时不忘记旧任务,即使任务不断重复。

他们并未声称这解决了人工智能中的所有问题,但他们证明,对于特定类型的学习算法(称为 DQN),这种简单的“实时”与“无等待”组合是防止遗忘的变革性方法。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →