Rethinking the Suitability of Reinforcement Learning Algorithms Under Practical Transfer Constraints
本文认为,评估用于迁移任务的强化学习算法需要超越样本效率,将实际的墙钟训练时间以及在领域随机化下的鲁棒性纳入考量,并证明了样本效率较低的 PPO 在速度上可以超越 SAC 和 TD-MPC2 等更具样本效率的算法,同时这三种范式都从领域随机化中获得了类似的收益。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个这样的世界:机器人学习走路、跳舞或接球,不是通过被灌输死板的规则,而是通过玩一场试错游戏,就像蹒跚学步的幼儿学习走路一样。这个领域被称为强化学习(Reinforcement Learning, RL)。在这个数字游乐场里,一个 AI 智能体尝试不同的动作,做得好就得分,摔倒了就扣分。随着时间的推移,它逐渐掌握了移动的最佳方式。但问题在于:大部分学习过程都发生在一个完美的、虚构的计算机世界(模拟器)中。真正的目标是将这种习得的技能应用到混乱且不可预测的现实世界中。这被称为“迁移”(transfer)。
为了让这种迁移奏效,科学家通常会衡量一个算法的“样本效率”(sample efficient)。这就像是在计算一名学生为了理解一个概念需要翻多少次书页。如果算法 A 需要翻 1,000 页,而算法 B 需要 10,000 页,我们通常认为算法 A 是赢家。但本文提出了一个不同且非常实际的问题:如果学生面对的是一个滴答作响的时钟呢?如果真正的约束不是能翻多少页,而是阅读这些页面的速度呢?在现代计算中,我们可以同时运行数千个模拟环境,就像有一千个学生同时在读同一本书。这意味着,一个需要更多“翻页”次数的算法,如果拥有更强大的团队,实际上可能会更快地读完这本书。本文探讨了我们现有的对这些学习算法的排名方式,是否忽略了更宏大的全局观。
研究人员(来自多所大学和研究机构的一个团队)决定对三种流行的学习算法进行测试:PPO(一种以稳定且擅长利用多台计算机而闻名的算法)、SAC(一种以需要较少练习尝试而闻名的算法)以及 TD-MPC2(一种通过尝试预测未来来加速学习的聪明方法)。他们想看看,根据衡量标准的不同,“赢家”是否会发生改变。
首先,他们观察了“墙上时钟时间”(wall-clock time)与“尝试次数”之间的关系。在他们的模拟实验中,他们设置了一场比赛。当仅计算练习尝试次数(交互次数)时,SAC 和 TD-MPC2 是绝对的冠军,它们完成任务所需的尝试次数比 PPO 少。这就像看到一个学生用一半的时间就背完了整本书。然而,当他们切换秒表来测量实际时间时,情况发生了反转。因为 PPO 被设置为在 2,048 个并行环境中运行(想象一下 2,048 个学生在同一秒钟读书),它收集海量练习数据的速度极快,从而比其他两个算法更快地产生了一个可用的机器人策略。论文指出,如果你是一名面临截止日期的机器人工程师,那么那个“学习较慢”的算法(PPO)实际上可能会让你更早到达终点,因为它能更好地随算力规模化扩展。
接下来,团队应对了“领域随机化”(domain randomization)的问题。这是一种技术,即你在一个每次都会发生微小变化的模拟器中教机器人——比如这一刻地板很滑,下一刻机器人的腿变得更重了。目标是让机器人足够鲁棒,能够应对从不完美且充满变数的现实世界。当时存在一种普遍观点,认为某些学习风格(如复杂的、具有预测性的 TD-MPC2)可能会在训练环境如此混乱时感到困惑或失败,而其他风格(如 PPO)则被认为是唯一能应对这种情况的。
研究人员通过使用五种不同程度的混乱程度(从“狭窄”的微小变化到“广泛”的剧烈物理变化)来训练所有三种算法,以此进行测试。他们发现,认为某种算法天生更擅长处理混乱的观点其实是一个迷思。在他们的模拟中,PPO、SAC 和 TD-MPC2 都从领域随机化中获益,但结果各异。有时,少量的混乱对 SAC 帮助最大;有时,大量的混乱对 TD-MPC2 帮助最大。并没有一种单一的“最佳”算法适用于所有情况。论文得出结论,使用随机训练是否成功,很大程度上取决于特定的任务、特定的算法以及你引入了多少混乱。这不在于挑选“最强”的机器人,而在于调整训练环境以适应具体的工作。
最后,本文认为我们需要停止将样本效率视为唯一的评分标准。仅仅因为一个算法在交互次数上更少并不意味着它是现实项目中最好的选择。如果你有时间限制并且可以使用强大的计算机,一个“效率较低”的算法可能是实际上的赢家。当涉及到让机器人具备应对现实世界突发状况的鲁棒性时,并没有一劳永逸的解决方案;最好的方法取决于你试图解决的具体谜题。作者建议,未来的工程师应该像衡量训练机器人所需次数一样,同样重视训练机器人所需的时间。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。