SmoothRL: Online Reinforcement Learning During Asynchronous Execution
SmoothRL 是一个在线强化学习框架,它通过显式建模执行时间线并仅通过新执行的动作区域传播梯度,从而在异步推理循环中实现预训练机器人策略的高样本效率微调,以确保实时可靠性和平滑控制。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
长期以来,机器人一直难以像生物那样拥有流畅的动作。虽然人工智能已经让机器能够以惊人的准确度理解语言并识别物体,但将这种理解转化为物理运动仍然是一个顽固的障碍。问题不仅在于机器人必须足够聪明,它们还必须足够快且平滑。在现实世界中,机器人手臂不能在每一次微小的动作之间都停下来思考。如果它停下来计算下一步,动作就会变得断断续续,导致任务失败。为了实现平滑移动,机器人必须预测一系列未来的动作,并在计算下一组动作的同时执行当前的动作。这产生了一个复杂的时序问题:机器人正在根据一瞬间前生成的指令行动,而计算机已经在为下一瞬间的指令进行计算。如果机器人试图在这种条件下从错误中学习,学习过程往往会崩溃,因为机器人是在根据它从未真正完成、或者被迫在中途放弃的动作来进行评价。
Astribot 的一个研究团队开发了一种名为 SmoothRL 的新方法来解决这个特定的时序难题。他们的工作使机器人能够在复杂的、重叠的调度下实现实时经验学习,即使在思考与运动同时进行的运行环境下也是如此。研究人员关注的是机器人训练方式与实际使用方式之间的一个根本性不匹配。过去,科学家们训练机器人时假设机器会停止、思考,然后按照完美的同步节奏移动。但在现实世界中,为了保持运动的平滑,机器人使用一种系统,即生成一段未来动作的“块”(chunk),将第一部分发送给电机,同时在执行第一部分时立即开始计算下一个块。这导致了一种情况:机器人不断地丢弃它自己计划的一部分,因为一个更新、更鲜活的计划已经到达。研究人员意识到,要让机器人在这种环境下有效地学习,它必须停止尝试从那些被丢弃的计划部分中学习,而应只专注于它实际执行的部分。
他们解决方案的核心在于教机器人忽略它生成了但从未使用的“幽灵”动作。当机器人为接下来的几秒钟制定计划时,它会将该计划分为三个不同的区域。第一个区域包含由上一个计算周期已经决定的动作;机器人现在无法更改这些动作。第二个区域包含机器人在进行下一次计算时实际执行的新动作。第三个区域包含剩余的未来动作,这些动作在机器人到达之前,很可能会被下一次计算所替换。研究人员构建了一个训练系统,该系统仅观察第二个区域——即机器人实际执行的动作。他们教机器人仅根据其真正做出的动作所产生的后果来调整其行为,从而有效地切断了来自那些被丢弃计划部分的学习信号。这确保了机器人是从现实中学习,而不是从一个从未发生的假设未来中学习。
为了测试这一点,研究人员在一个带有两个手臂的移动机器人上设置了三个具有挑战性的物理任务。第一个任务涉及将物体投入箱中,这种动作需要连续、不间断的挥动。如果机器人在不同计算周期之间切换时出现犹豫或顿挫,投掷就会失败。第二个任务要求机器人在极高的精度下为钢笔盖上盖子,将两个小物体对齐在仅几毫米的公差范围内。第三个任务涉及沿着一条细小的缝隙引导刀片切开纸箱,这项工作要求毫米级的准确度,以避免切坏箱子本身。在这三种情况下,机器人都从一个虽然优秀但不完美的预训练大脑开始。当研究人员让机器人使用他们这种新的异步学习方法进行练习时,结果是显著的。机器人成功投掷物体的能力从 39% 跳升至 94%。它为钢笔盖盖的技能从仅仅 8% 提升到了 83%,而打开箱子的成功率从 30% 提高到了 90%。
这种进步不仅仅在于完成任务的频率更高,更在于机器人的运动方式。研究人员测量了机器人运动的平滑度,发现新方法将突然的震动和突发的加速度减少了近一半。这种平滑度对于动态投掷任务至关重要,因为在运动中停顿会导致物体投掷距离不足。该系统也被证明足以处理人类的帮助。如果人类操作员需要介入以纠正错误,机器人可以直接将其人类动作吸收进学习过程中,而无需将其转化为不同的代码。人类的纠正变成了另一个关于正确移动方式的范例,使得机器人能够同时从自身的尝试和人类的指导中学习。
研究人员发现,机器人的学习并不总是直线式的。在开箱任务中,机器人的表现实际上在提高之前先出现了下滑,这表明系统正在探索一些最初看起来效果变差的移动方式,随后才找到了正确的路径。这表明机器人是在真正学习如何适应,而不仅仅是记忆一组固定的动作。然而,研究人员也指出了他们方法的局限性。机器人的学习能力仍然与其初始预训练大脑的质量挂钩。如果基础机器人对某项任务存在根本性的困惑,那么这个学习系统所做的微调可能不足以解决问题。此外,该系统依赖于机器人的计算能在严格的时间限制内完成;如果计算机运行过慢,动作的时序就会失去同步,从而导致整个过程失稳。
最终,这项工作表明,要让机器人真正适用于现实世界,它们的学习算法必须匹配它们运动时那种杂乱、重叠的现实。通过教机器人只关注它实际完成的动作并忽略被丢弃的动作,研究人员为机器人在不牺牲执行所需平滑度的前提下,学习复杂、高速的任务创造了一条路径。其结果是,机器人能够以以往难以企及的可靠性和流畅度进行投掷、盖盖和切割,这证明了更好的机器人学习关键在于理解计划变为现实的那一精确时刻。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。