Characterizing Replay Retention Under Dynamics Shift in Model-Based Reinforcement Learning
本文通过表征变化幅度与转移年龄之间的权衡,研究了在动力学偏移下如何优化基于模型的持续强化学习中的经验回放保留,并证明了一个估计器可以根据动力学变化是永久性的还是循环出现的,有效地指导保留或丢弃旧数据。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
学习如何移动的机器人通常依赖于一个关于其身体运作方式的心理模型。它们尝试一个动作,观察结果,并利用这些经验来预测未来,通过不断精炼动作,直到能够轻松地行走、奔跑或搬运物体。这种被称为强化学习的过程非常强大,因为它允许机器在无需针对每种可能情况进行显式编程的情况下,适应新的任务。然而,机器人的世界很少是静态的。一条腿可能会断裂,负载可能会改变,或者地面可能会变得湿滑。当这些物理变化发生时,机器人过去关于如何移动的记忆可能会产生误导。如果机器人继续基于这些过时的经验进行训练,它会学到错误的教训并难以适应。如果它丢弃所有旧数据从头开始,它就会失去那些可能仍然有用、或者在机器人恢复到原始状态时可能再次变得必要的宝贵信息。核心挑战在于,究竟何时该保留过去,何时该舍弃过去。
布朗大学的研究人员通过研究机器人在其物理动力学发生变化时应如何管理其记忆库,对这一精确的困境进行了调查。他们专注于一种特定类型的学习,即机器人通过维护一个记录其交互历史的“经验回放缓冲池”(replay buffer)来训练其内部模型。团队想要确定,机器人是否应该始终保留其完整的经历历史,还是应该严格地将训练限制在仅有的最新数据上。为了寻找答案,他们模拟了一个名为 Walker 的机器人——一个双足机器,并引入了不同类型的物理变化。在某些场景中,机器人遭受了永久性损伤,例如电机失去了一半的强度。在另一些场景中,机器人经历了循环往复的变化,即损伤会出现然后消失,模拟了机器人拿起重物又放下重物的过程。他们还测试了一个对照组,即机器人的身体在整个训练过程中保持完全不变。
结果显示出一个完全取决于变化性质的清晰模式。当机器人面临永久性转变(如电机损坏)时,仅保留最新数据的策略效果最好。通过丢弃那些不匹配的旧记忆,机器人能够更快地学习新现实,并获得更高的性能评分。在这些情况下,旧数据仅仅是减慢学习过程的噪声。然而,当变化是循环往复时,情况则完全反转。当机器人的动力学恢复到原始状态时,仅保留近期数据的策略就变成了一种负担。机器人丢弃了它正确移动所需的记忆,导致其性能显著下降。在这些循环场景中,保留完整的经历历史使得机器人在旧情况回归时能够快速恢复。
研究人员发现,决定遗忘还是记忆取决于两个特定的因素。第一个因素是变化的规模。机器人移动方式的小幅偏移并不足以支撑丢弃旧数据,因为旧的经验在很大程度上仍然相关。然而,大规模的永久性变化使得旧数据变得如此不准确,以至于最好从一张白纸开始。第二个因素是变化的可预测性。如果机器人可以预见到旧情况会回归,那么保留过去就是至关重要的。团队开发了一种方法,利用机器人移动时产生的自身数据来估算这些因素,而无需了解模拟过程中的内部物理机制。通过分析机器人的电机如何响应指令,他们可以检测到变化何时发生,并估算变化的严重程度。这使他们能够做出明智的选择,即是保留旧的历史,还是切换到全新的短期记忆。
在实验中,研究人员在不同的机器人形状和学习算法上测试了这些想法,以确保研究结果具有稳健性。他们证实,在发生永久性损伤后丢弃旧数据的益处是一致的,而当条件是周期性时这样做所带来的代价也同样一致。他们还将这种方法与其他方法(例如保留随机样本的旧数据或使用复杂的权重系统)进行了比较,并发现“针对永久性变化保留近期数据,针对循环性变化保留历史”这一简单规则通常是最有效的。这项研究表明,对于在现实世界中运行的机器人而言——在那里损伤可能是永久性的,但环境条件可能会波动——判断变化类型的能力与学习能力同样重要。通过利用机器人自身的运动数据来决定记住什么,机器可以变得更具韧性,在应对损伤时能迅速适应,同时不会在损伤是暂时性的情况下忘记如何运作。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。