Reward-Free Continual Adaptation for Resilient Space Robots
本文介绍了一种无奖励持续学习框架,该框架通过利用预训练的潜在状态世界模型,经由无监督展开(unsupervised rollouts)来更新转移动力学,并在想象的轨迹上训练策略,从而使空间机器人能够通过适应严重的硬件退化来应对挑战,且无需在部署期间获取难以获取的奖励信号。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
太空是一个机器必须独自工作的场所,远离人类双手的帮助。几十年来,工程师们通过给予机器人严格的指令,或者让它们通过试错法进行学习(一种被称为强化学习的方法),来教会机器人如何移动。在这种学习过程中,机器人尝试一个动作,如果成功了,它就会收到一个数字化的“奖赏”或奖励信号,告诉它再次执行该动作。这种系统在受控环境中表现良好,因为计算机可以立即计算出机器人的表现究竟有多好。然而,在广袤、无人追踪的太空虚空中,并没有摄像头或传感器来告诉机器人它是否移动正确。由于缺乏衡量成功的方法,机器人无法获得它学习或适应所需的奖励信号。这产生了一个危险的问题:如果太空机器人损坏或磨损,它无法修复自己的行为,因为它无法知道自己是否正在失败。
卢森堡大学的一个研究小组提出了一种解决此问题的新方法,允许机器人在不需要知道自己是赢是输的情况下进行适应。他们的方法依赖于一个“世界模型”的概念,这本质上是机器人在其计算机内部构建的一个心理地图。在机器人离开地球之前,科学家们在数千个不同的计算机模拟中对其进行训练,让它经历可能遇到的每一种地形、重力和机械故障。在这些训练过程中,机器人学到的不仅是如何移动,还包括如何预测接下来会发生什么,以及什么是“好的”结果,即使它看不见最终的结果。研究人员发现,这个心理地图包含了一种对成功的隐藏理解,一种即使在看不见终点线时也能指引机器人前进方向的内在指南针。
他们发现的核心在于一种在机器人已经在太空且发生故障时更新此心理地图的方法。想象一辆在火星上行驶的漫游车,突然失去了控制其右前轮的能力。在传统系统中,机器人会陷入困境,因为它无法计算出引导其新动作的奖励信号,因此无法学习如何在轮子损坏的情况下驾驶。然而,研究人员的新系统会冻结机器人大脑中理解“奖励是什么样”的部分。然后,它利用机器人自身的运动来仅更新预测世界如何变化的部分。通过观察损坏的轮子实际上如何带动机器人移动,该系统学习了损伤后的新现实。随后,它利用其预先训练好的对“好”结果的理解,完全依靠自身学习如何重新驾驶。
为了测试这个想法,研究人员运行了一系列严谨的模拟实验,涉及三个截然不同的太空任务。首先,他们模拟了一个拥有十二个电机的漫游车试图穿越崎岖、多石的地形。接着,他们模拟了一个拥有十二个推进器的航天器试图在轨道中导航。最后,他们模拟了一个拥有七个关节的机械臂试图极其精准地将螺栓旋入螺母。在每种情况下,他们都引入了突然且严重的故障:锁定漫游车的轮子、禁用航天器的三个推进器,以及弯曲机械臂末端的螺丝刀工具。这些故障的设计旨在如此严重,以至于仅针对正常机器进行训练的机器人将会彻底失败,无法完成任务。
结果显示,使用这种新方法的机器人能够从这些灾难中恢复,尽管存在一些局限性。当研究人员将这种自适应机器人与无法从错误中学习的机器人进行比较时,自适应机器人表现出了令人期待的初步恢复,而后者则失败了。它能够弄清楚如何移动其损坏的部分以仍然实现目标。然而,研究表明,缺乏奖励信号的智能体表现始终逊于允许其看到真实奖励信号的版本,而后者是现实中的太空机器人无法实现的。此外,学习曲线显示,在获得初步性能提升后,该智能体表现出了显著的波动性和衰减,尤其是在轨道和组装任务中。这表明,虽然机器人的内部地图强大到足以引导它度过失效初期的冲击,但如果没有来自现实世界的持续反馈,它很难长期保持完美的准确性。
这项工作代表了向使太空机器人真正具备韧性迈出的重要一步。它证明了,只要机器人预先学习了对世界运作方式的深刻理解,它就不需要被告知做得好不好就能学会如何修复自己的损坏动作。研究人员证明,通过将“什么是好的”与“事物如何运动”的知识分离,机器人可以适应太空中意想不到的现实。虽然目前的测试完全是在计算机模拟中进行的,但研究结果为那些人类干预无法实现的任务提供了一条充满希望的路径,在这些任务中,机器人必须能够在身体受损时依然能够生存并开展工作。无需奖励信号的学习能力将一个潜在的任务终止性故障转变为一个可解决的挑战,让我们离未来——即我们的机器人探索者能够真正抵御宇宙严酷环境的未来——又近了一步。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。