Calibrated Partial Resets: Preventing Policy Collapse in Continual Reinforcement Learning
本文介绍了校准部分重置(Calibrated Partial Resets, CPR),这是一种通过定期且选择性地将低效神经元拉回其初始化状态,从而在不牺牲峰值性能的情况下维持塑性的持续强化学习优化器,旨在防止策略崩溃。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一个机器人走路、跑步或玩电子游戏。你不仅仅是教它一次并希望它永远记住;你把它投入到一个不断变化的世界中。也许地面变得湿滑,或者游戏的规则发生了变化,或者机器人在掌握了旧技能后必须学习一项全新的技能。这就是“持续学习”(continual learning)的世界。问题在于,随着这些数字大脑(神经网络)学习得越来越多,它们往往会变得“卡住”。它们大脑的一些部分完全停止工作,变得像处于休眠状态、从未放电的神经元一样;而另一些部分则变得过于僵化,无法适应新情况。这就像一个把教科书背得滚瓜烂熟的学生,如果题目中的数字变了,他就一个问题也解不出来。如果机器人失去了这种适应能力,它可能会突然忘记如何走路,或者更糟,在错误的决策循环中崩溃并毁灭。科学家们一直试图通过偶尔“重置”机器人的大脑来解决这个问题,但旧的方法有点像按下一个过于生硬的重置键,在机器人试图学习新技能时,往往会破坏它现有的技能。
这篇论文介绍了一个巧妙的新技巧,叫做校准部分重置(Calibrated Partial Resets, CPR),用以解决这个问题。把神经网络想象成一个庞大的工人团队,其中每个工人(神经元)负责机器人决策的一个微小部分。随着时间的推移,一些工人不再做任何有用的事情;他们变得“休眠”或“沉睡”了。旧的方法是解雇这些沉睡的工人并从头开始招聘全新的工人。但把他们全部解雇,就像是在晚餐高峰时段解雇了繁忙厨房里的一半员工——这会导致混乱,并且食物(机器人的表现)会被毁掉。
本文的作者提出了一种更温和、更聪明的方法。CPR 不会完全解雇那些沉睡的工人,而是给他们一个温柔的“推力”,让他们回到最初、新鲜的状态。但神奇之处在于:这个推力的大小取决于该工人有多么无用。如果一个工人几乎没做什么贡献,他们就会得到一个巨大的推力来唤醒他们。如果一个工人仍在出色地工作,他们只会得到一个微小到几乎察觉不到的轻点。这样,机器人就能保持其最佳技能,同时缓慢地刷新那些变得陈旧的部分。
研究人员在一些非常艰苦的环境中测试了这个想法。他们训练机器人在不断从干燥变为极度湿滑的表面上奔跑,这项任务持续了惊人的 4 亿步。在这些测试中,旧的方法(例如完全解雇工人的标准“二进制重置”)经常导致机器人崩溃并完全忘记如何移动。然而,CPR 方法让机器人在整个过程中都能平稳运行。它是唯一一个在所有 15 次不同测试运行中都没有出现“策略崩溃”(total failure)的方法。
论文还表明,这种方法在其他具有挑战性的类视频游戏环境中也表现良好,有助于机器人在学习新任务的同时不会忘记旧任务。作者发现,通过调节我们推挤“沉睡”工人的力度(一个被称为 的设置),我们可以平衡保持机器人稳定与帮助其快速学习之间的关系。他们发现,适度的推力效果最好,既能防止机器人崩溃,又能让其具备适应能力。
简而言之,这篇论文建议,我们不应该使用“全或无”的重置按钮,而应该为 AI 的大脑使用一个“调光开关”。通过根据每个部分的用途仔细校准我们刷新每个部分的程度,我们可以让 AI 智能体永远学习而不至于崩溃。这些以数亿步为衡量标准的实验结果表明,这种方法是构建能够真正终身学习和适应的机器人及 AI 的一种极具前景的方式。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。