Deep Reinforcement Learning for Quadruped Locomotion Controlled by Natural Language
本文提出了一种端到端的框架,该框架通过将轻量级自然语言理解(NLU)模块与目标条件强化学习策略(PPO)及教师-学生蒸馏技术相结合,使四足机器人能够执行自由形式的自然语言指令,并在仿真与真实世界实验中实现了鲁棒、自适应且高能效的运动控制。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个机器人狗不需要遥控器、摇杆或预设程序就能知道该做什么的世界。相反,它通过倾听人类的声音来行动。这是机器人学领域的前沿,工程师们正致力于教会机器人在复杂且不平整的世界中移动。多年来,让四足机器人行走的可靠方法一直是给它一个关于自身身体和脚下地形的刚性数学模型。虽然这种方法在平坦地面上表现良好,但当地形变得杂乱或情况发生意外变化时,往往会失效。一种被称为深度强化学习的新方法改变了游戏规则。这些机器人不再依赖固定的规则集,而是通过试错来学习行走,就像小狗学习站立一样,最终发现出人类工程师无法通过手工设计的稳定移动方式。目前仍然存在的挑战是如何与这些习得的系统进行交流。给机器人一个简单的指令如“向前走”很容易,但要求它“向左缓慢行走并避开一个凸起”则需要一座连接人类语言与机器人底层电机控制的桥梁。
哈尔滨工业大学的研究人员构建了一个系统,搭建了这座桥梁,使四足机器人能够遵循自由形式的自然语言指令。他们的研究工作(详见近期的一项研究)提出了一种方法:机器人倾听一句话,理解人的意图,并立即调整其行走风格以匹配该意图。该系统并不依赖于一个预先编写的特定动作库(例如“小跑”或“疾走”),机器人无需从中进行选择。相反,它将词汇直接转化为对速度和方向的连续调整。当用户说“缓慢向前走”时,机器人的大脑会理解它需要降低前进速度并保持平衡,并实时执行这一变化。这是通过结合两种不同的技术实现的:一个理解人类语音的语言处理器,以及一个控制机器人肌肉的学习算法。
系统的语言部分充当了翻译官的角色。它将像“急转左”这样的句子分解为两部分信息:总目标(即转向)以及完成该动作所需的具体数值(例如旋转的速度)。研究人员使用了一个现代语言模型的轻量化版本来执行这项任务。该模型经过数千个“指令与正确机器人动作”配对的示例训练。它的设计旨在足够轻量,以便在不减慢机器人运行速度的情况下在机器人上运行。一旦系统理解了指令,它就会将此信息传递给机器人的控制大脑。这个控制大脑是一个通过称为“近端策略优化”(proximal policy optimization)的方法训练而成的神经网络。训练过程包括机器人在高保真计算机模拟中尝试行走,通过保持直立和高效移动来获得奖励,并在数百万次尝试中逐渐改进其策略。
这个新系统的独特之处在于它如何连接语言翻译器与行走控制器。该系统并非强迫机器人从有限的预定义行为菜单中进行选择,而是利用语言输入来轻轻引导机器人的目标和奖励系统。如果指令是移动缓慢,系统就会调整机器人的目标速度,并改变它评估自身成功的方式,使得缓慢、谨慎的步伐比快速、冒险的步伐更具“奖励感”。这使得机器人能够持续调整其步态。它可以向前走,然后减速,然后向左转,这一切都基于单一的语音指令流。为了确保该系统不仅能在计算机中运行,也能在真实机器上运行,研究人员采用了一种教学策略。他们首先在模拟环境中训练了一个拥有完美世界信息(如地面精确摩擦力)的高能力“教师”机器人。然后,他们训练了一个“学生”机器人,让其利用真实机器人会遇到的带有噪声且不完美的传感器数据来模仿教师的行为。这个过程帮助学生学会了如何应对物理世界中混乱的现实。
团队在模拟环境以及一台真实的 Unitree A1 机器人(一种小型、敏捷的四足机器)上对系统进行了广泛测试。在计算机模拟中,机器人成功遵循了各种指令,包括复杂的指令,如“向左缓慢行走”或“快速绕过障碍物”。系统表现出了很高的成功率,机器人在模拟中完成行走或转向等基本任务的成功率超过 96%。当研究人员将系统转移到真实机器人上时,结果依然强劲。机器人在接收指令后执行行走、转向和停止的成功率在大多数动作中超过了 93%。该系统还证明了其能源效率,与使用传统控制方法或其他未使用这种特定语言调节的学习方法相比,每步消耗的能量更少。研究人员指出,机器人在接收到新指令后不到一秒钟内即可调整其动作,展示了在实现旧式控制方法时难以达到的流畅响应能力。
然而,这项研究也指出了目前的局限性。该系统最适用于与运动和速度相关的清晰、直接的指令。它尚未被设计用于处理长篇、复杂的对话或高度模糊的指令,如“做点酷炫的事”。如果用户给出的指令是机器人物理上无法完成的,例如“飞向月球”,系统目前还不够聪明,无法请求澄清或解释为什么该请求无法实现。研究人员发现,虽然机器人非常擅长遵循特定的运动指令,但其泛化到全新的语言类型或环境的能力仍受限于其训练数据。实地测试也相对较短,且是在受控条件下进行的,这意味着该系统在不可预测的户外环境中的长期可靠性尚未得到充分验证。
尽管存在这些局限性,这项工作仍代表了迈向更自然的人机交互的重要一步。通过展示机器人可以学习行走,并能通过简单的语音进行引导而无需预设动作库,研究人员展示了一条通往更直观机器人的路径。该系统不需要用户学习新的代码或特定的指令集;它只是倾听并做出响应。通过“教师-学生”训练法将技能从模拟环境转移到现实世界的成功,表明这种方法未来可以扩展到更复杂的机器人身上。随着技术的成熟,人类意图与机器行动之间的差距可能会继续缩小,使机器人成为动态且具有挑战性环境中的真正伙伴。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。