SPHERE: Mitigating the Loss of Spectral Plasticity in Mixture-of-Experts for Deep Reinforcement Learning
本文介绍了 SPHERE,这是一种源自神经切线核理论的实用帕塞瓦尔惩罚项,它通过减轻混合专家网络中的谱可塑性损失,从而显著提升了 MetaWorld 和 HumanoidBench 基准测试上的持续强化学习性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在训练一个机器人执行一系列不同的任务,比如行走、拿起杯子和开门。你希望机器人能够按顺序学习这些任务,同时不忘记之前学会的技能。这被称为持续学习。
正如这篇论文所描述的,问题在于,随着机器人学习的增多,它开始变得“僵化”。它失去了可塑性——即弯曲、适应和学习新事物的能力。它变得僵硬,就像一块干涸的海绵,再也无法吸水。
以下是这篇论文如何运用日常类比来解决这一问题的简要说明。
问题:“谱系坍缩”
作者解释说,当机器人学习时,它会基于新经验更新其内部“大脑”(即神经网络)。理想情况下,它应该能够同时向许多不同的方向调整,就像一位灵活体操运动员,可以向左、向右、向上和向下扭转。
然而,随着时间的推移,机器人的大脑开始坍缩。它不再灵活,只学会向一两个特定方向移动。论文将这种现象称为谱系可塑性丧失。
- 类比:想象一个管弦乐队。起初,每种乐器(弦乐、铜管、打击乐)都演奏独特的音符,创造出丰富饱满的声音。随着机器人学习更多任务,乐队开始反复只演奏同一个音符。音乐变得平淡无奇。机器人无法再学习复杂的新技能,因为它失去了“音域”。
解决方案:MoE(混合专家模型)
为了处理多项任务,研究人员使用了一种名为**混合专家模型(Mixture-of-Experts, MoE)**的特殊大脑架构。
- 类比:与其使用一个通才大脑,不如想象一个由 10 位专家(专才)组成的团队。当机器人需要行走时,它会咨询“行走专家”;当它需要拿起杯子时,它会咨询“抓握专家”。一位“守门人”负责决定在每种情况下使用哪位专家。
论文发现,即使有了这个专家团队,机器人仍然会陷入困境。专家们不再协同工作,团队的“谱系”发生坍缩。他们开始做同样的事情,或者守门人不再听取大多数专家的意见。
修复方案:SPHERE
作者开发了一种新工具,名为SPHERE(基于超球面专家正则化的谱系可塑性,Spectral Plasticity via Hyperspherical Expert REgularization)。
- 类比:将专家们想象成一群舞者。随着时间的推移,他们可能会开始在拥挤狭小的圆圈里跳舞,以完全相同的方式移动。SPHERE 就像一位编舞家,温柔地将他们推开。它迫使专家们分散开来,覆盖整个舞池,确保他们都在不同、独特的方向上移动。
从技术上讲,SPHERE 通过在训练过程中施加“惩罚”(一种温和的推动)来实现这一点。它会检查专家特征的“形状”,如果它们变得过于相似或过于扁平,就会对其进行惩罚。它迫使它们保持“球形”(圆润且饱满),从而保持机器人大脑的灵活性,使其准备好学习新事物。
实验中发生了什么?
研究人员在两个非常困难的机器人仿真环境中测试了该方法:
- MetaWorld:一组 10 个机械臂任务(如推按钮或转动阀门)。
- HumanoidBench:一组 5 个类人机器人任务(如站立、行走或滑行)。
结果:
- 没有 SPHERE:机器人团队(MoE)陷入了困境。随着它们学习后续任务,由于失去了适应能力,其成功率显著下降。
- 使用 SPHERE:机器人团队保持了灵活性。
- 在MetaWorld上,与无用的基线相比,机器人的成功率提高了133%。
- 在HumanoidBench上,它们提高了50%。
论文还表明,当使用 SPHERE 时,“音乐谱系”(灵活性的数学度量)在整个训练过程中保持高位,证明机器人没有丧失学习新方向的能力。
总结
简而言之,深度学习机器人往往会变得“僵硬”,并忘记如何学习新事物。这篇论文介绍了SPHERE,这是一种像教练一样的方法,不断提醒机器人内部的“专家”保持多样性和灵活性。通过这样做,机器人可以学习一系列新的任务,而不会丧失适应能力,其表现显著优于以往的方法。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。