Skill Composition for Legged Robot Reinforcement Learning
本文认为,将独立且专门化的子策略的可靠组合视为一个独立的研究问题,对于将碎片化的机器人技能转化为一个可验证、可扩展且安全的技能库,并使其能够被高层规划器有效管理,是至关重要的。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
能够行走、奔跑或攀爬的机器人不再仅仅是理论上的梦想,它们正通过一种被称为深度强化学习的方法成为现实。在这种方法中,计算机程序通过在模拟环境中的试错来学习控制机器人,最终掌握如跑酷或穿越复杂地形等复杂的动作。成功的关键在于训练机器人一次只执行一项特定的任务,例如向前行走或踢球。这些专门的控制器训练速度快且非常可靠,因为它们专注于一个狭窄的问题。然而,一个主要的障碍仍然存在:如何让这些独立的技能无缝衔接。如果机器人需要先行走然后跳跃,仅仅从“行走”控制器切换到“跳跃”控制器往往会失败。机器人可能会突然停下脚步,失去之前积累的所有动量,或者可能会摔倒,因为跳跃控制器预期机器人是静止不动的,而不是处于运动状态。挑战不仅在于拥有一个技能库,还在于如何实现从一种技能到另一种技能的控制权移交,而不破坏机器人的平衡或浪费其能量。
罗马第一自由大学的研究人员认为,这种被称为“组合”(composition)的移交过程应该被视为一个严肃的科学问题本身,而不仅仅是一个随手解决的技术细节。他们提出,与其试图训练一个能处理所有事情的巨型大脑,或者简单地让机器人停下来切换任务,不如构建一种让独立的专家能够安全组合的系统。他们确定了两种主要的方法。第一种是“融合”(blending),即机器人的动作是两个同时发生的技能的平滑混合,就像一个行走专家和一个踢球专家协同工作一样。第二种是“桥接”(bridging),即一个临时的、专门的控制器会在极短的时间内接管,为下一个技能做准备。这个“桥”确保了即使机器人在需要切换时处于混乱的状态,也能被引导至一个能让下一个技能成功接手的状态。
为了测试这些想法,团队为一台人形机器人构建了一个系统,使其能够走下走廊然后跳跃,且无需停顿。行走技能被训练为让机器人向前移动,而跳跃技能则是从静止状态开始训练的。在传统设置中,如果机器人在跑步时尝试跳跃,跳跃控制器会失败,因为它从未见过运动中的机器人。研究人员通过创建一个“桥接”解决了这个问题。这个桥接是一个短命的控制器,它在做出跳跃决策的那一刻激活。它的唯一任务是接管当前正在运动的机器人,并将其引导至跳跃技能可以处理的蹲伏姿势,同时保留机器人已经建立的前进速度。结果是,机器人能够直接从行走过渡到跳跃,利用自身的动量来辅助跳跃,而不是先停下来。这在模拟实验中得到了验证,机器人成功地从行走切换到了跳跃,并在整个过渡过程中保持了速度和平衡。
研究人员还通过另一个任务——踢球,探索了融合方法。在这里,他们将行走技能与踢球技能结合在一起。他们没有在两者之间进行切换,而是使用一个小型的网络将这两个动作混合在一起。系统学会了在远离球时主要依赖行走技能,并随着靠近球而逐渐转向踢球技能。这使得机器人能够在接近球时自然地调整步幅和身体姿势,而不是停下来踢球。研究人员发现,通过保持原有的行走和跳跃技能不变且不进行修改,仅训练决定如何混合或切换它们的小型网络,他们就可以创造出复杂的行为,而无需从头开始重新训练整个机器人。
他们工作的一个核心部分是:切换技能的决策应该由一个独立的、可理解的组件(如规划器或简单的基于规则的系统)做出,而不是由一个做出不可预测选择的“黑箱”神经网络做出。通过将决策者与执行者分离,并使用“桥接”来处理混乱的过渡过程,研究人员相信可以让机器人变得更安全、更可靠。如果一个规划器决定机器人应该跳跃,它不需要知道如何让机器人进入跳跃姿势的复杂物理过程;它只需要发出跳跃指令即可。桥接负责处理将机器人准备就绪的困难部分。这种方法允许技能库随着时间的推移而增长,在添加新行为的同时不会破坏旧的行为。虽然目前的结果是基于模拟和特定测试用例的,但这项工作为构建能够通过将简单、可靠的技能串联起来来处理长期、复杂任务的机器人指明了一条路径,而不是试图一次性学会所有事情。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。