想象一只四足机器人狗,就像是高科技版的猫,正试图弄清楚如何把一块沉重的石头推过一片崎岖不平的院子。在过去,科学家们必须扮演严厉的傀儡师,精确地告诉机器人站在哪里,以及如何移动它的脚去推石头。如果石头移动了或者地面发生了变化,机器人就会卡住,因为它不知道如何适应。
这篇论文介绍了一种新的方法,旨在教机器人成为一个聪明的、独立的解题者。机器人不再是一个被动的傀儡,而是学会了像人类规划复杂任务一样,通过三个层面进行“思考”。
三层大脑
研究人员利用一种被称为“强化学习”的学习方法,为机器人构建了一个“层级化”(分层)的大脑。你可以把它想象成一家拥有首席执行官(CEO)、经理和员工的公司:
首席执行官(高层愿景): 这一层通过机器人的眼睛(激光扫描仪)观察世界。它的任务是发现岩石,并询问:“我应该站在哪里才能最好地推动它?”它不仅仅是随机选一个点;它在寻找一种“示能性”(Affordance)。
- 类比: 想象你正试图把一辆沉重的购物车推上坡。你不会站在湿滑的草地上;你会寻找平坦、坚实的铺装路面,以获得最好的杠杆作用。机器人的“首席执行官”也是如此。它会计算地面的坡度和岩石的形状,以找到完美的“推行姿态”。
经理(导航): 一旦首席执行官说“站在那里”,经理就会接管。它会告诉机器人的腿:“向前走并稍微转弯,以到达那个位置。”它引导机器人穿过地形,避开颠簸并保持平衡。
员工(运动与足操纵): 这是肌肉部分。
- 运动(Locomotion): 这部分实际负责移动腿部进行行走。
- 足操纵(Pedipulation): 这是一个关于“用脚推动”的高级词汇。一旦机器人到达正确的位置,员工会决定如何精确地将前右脚放在岩石上。它不会只是把脚重重地踩下去;它会追踪一条平滑的曲线路径(就像在空中画线一样),从而高效地推动岩石。
它是如何学习的(训练营)
机器人并不是通过立即在真实的田野里推真实的石头来学习的。那样做既危险又缓慢。相反,研究人员将机器人置于一个名为 IsaacSim 的超现实视频游戏世界中。
- 模拟环境: 在游戏中,他们向机器人投掷了数千块位于不同坡度上的岩石。机器人尝试推动它们,失败后受到“惩罚”,然后再次尝试,并最终学会了最佳的站立和推动方式。
- 现实世界: 在掌握了游戏之后,他们将机器人带到了户外。他们没有给它任何新指令,只是让它在带有假岩石的真实混凝土路面上自由活动。机器人成功运用了它在视频游戏中学到的技能,在现实世界中导航、寻找最佳站立位置并推动岩石。
“示能性”的秘密
成功的关键在于**示能性(Affordance)**这个概念。简单来说,示能性是指物体根据其形状和环境所“提供”的某些可能性。
- 一把椅子提供了坐下的可能。
- 一个门把手提供了转动的可能。
- 山坡上的一个平坦区域提供了推行时稳定的站立姿态。
机器人的大脑被训练去识别这些“提供的可能性”。它观察一块岩石并说:“啊,这一侧很平坦,而我身后的地面很稳固;这就是一个可以推行的示能位置。”
结果
论文表明,这种三层系统是有效的。
- 在游戏中: 机器人学会了选择最佳的角度来推动岩石,与随机推动相比,它使用更小的力就能让岩石移动得更远。
- 在现实生活中: 机器人成功地走向一块岩石,根据坡度判断出最佳角度,并推动了它。在这个过程中,它不需要人类拿着摇杆或告诉它每一步该怎么走。
为什么这很重要(根据论文所述)
作者解释说,这是一个巨大的进步,因为它消除了为每一项任务设计特定路径的需求。机器人不再需要被编程为“行走2米,转动10度,然后推动”,而是学会了观察混乱且未知的环境,弄清楚什么是可能的(示能性),并独立执行任务。
论文特别提到,这对于行星探测(如探索火星)和搜救工作非常有用,在这些领域,机器人需要在人类无法到达且通信速度太慢、无法进行远程控制的危险环境中运行。机器人需要足够聪明,能够自己想办法与环境进行交互。
技术摘要:基于示能性的四足机器人分层强化学习研究
问题陈述
四足机器人的自主物体操纵仍是一个重要的研究挑战。虽然以往的研究已成功利用强化学习(RL)进行低层策略学习(运动控制与基础操纵),但在开放世界环境中执行任务通常依赖于专家设计的专家级高层轨迹。具体而言,如何自主选择可行的机器人基座位姿以及目标物体上易于交互的接触点,目前仍缺乏深入研究。这一差距至关重要,因为在不平整地形上操纵物体会引入复杂的挑战,例如未建模的表面几何形状、未知的摩擦力,以及在其中一只肢体与物体交互时如何保持其余肢体平衡的需求。现有方法往往缺乏自主识别“示能感知型”(affordance-aware)位姿的能力,而这些位姿需综合考虑物体的可达性、局部地形特征以及表面特征,且无需人工引导。
方法论
作者提出了一种三层分层强化学习(RL)框架,该框架将基于视觉的示能分析与解耦控制策略相结合。系统旨在使机器人能够自主导航至目标物体,识别可行的交互点,并执行“足部操纵”(pedipulation,即使用腿部进行操纵)任务。
1. 分层架构
该框架由三个不同的层级组成:
- 高层(位姿示能与导航): 一个基于视觉的模块处理 LiDAR 点云数据以分割地形和物体。它计算局部地形坡度及物体几何形状,从而生成一个易于交互的目标基座位姿(位置与朝向)。该位姿确保机器人处于物体的可达范围内,并相对于地形坡度保持正确的朝向。
- 中层(导航策略): 该策略接收目标位姿和机器人状态(速度、朝向)来预测速度指令。它以闭环方式引导底层控制器以到达目标基座位置。
- 底层(运动控制与足部操纵策略):
- 运动控制: 一个预训练策略输出关节位置,以执行来自导航层的速度指令。
- 足部操纵: 一旦机器人到达目标位姿,系统将切换到足部操纵策略。该策略以通过三次样条插值生成的路径点为条件,这些路径点连接了“起始位置”、视觉识别出的物体接触点以及一个中间偏移点。该策略控制末端执行器(具体为前右脚)在推动物体的同时,通过其余三肢保持平衡。
2. 基于示能性的规划
其核心创新在于位姿示能模块。该系统并非依赖预定义的轨迹,而是动态计算:
- 目标基座位姿: 基于物体中心、期望的推动朝向以及局部地形坡度推导得出。
- 交互点: 通过分析物体表面几何形状,寻找距离末端执行器最近的点,以最大化接触轨迹长度。
- 轨迹生成: 构建三次样条曲线,以确保在起点和终点满足零速度约束,并对高度进行安全限制。
3. 训练与实现
- 环境: 策略在 Isaac Sim 生态系统中利用 Unitree Go2 四足平台进行训练。
- 算法: 采用带有**近端策略优化(PPO)**的 Actor-Critic 架构。
- 领域随机化: 训练过程中包含了基座质量、质心、外力及地形坡度的随机化,以确保鲁棒性。
- 实物部署: 系统通过 ROS2 框架进行部署,并使用误差状态扩展卡尔曼滤波(ESEKF)进行状态估计,使用有限状态机(FSM)管理运行模式。
主要贡献
本文概述了四项主要贡献:
- 基于视觉示能的位姿指令生成: 一个能够为机器人基座和末端执行器生成目标位姿的模块,该模块明确考虑了可达性、地形坡度和物体表面特征。
- 多层分层强化学习框架: 一个实现全自主导航与足部操纵的系统,其中高层行为将底层策略视为黑盒进行抽象。
- 仿真到现实的迁移(Sim-to-Real): 成功实现了将系统从仿真环境迁移到非结构化的室外真实环境。
- 物体交互数据集: 一个包含机器人遥测数据(包括末端执行器力反馈)、物体特征和交互位姿的数据集,旨在促进进一步的研究。
实验结果
该框架在涉及随机放置物体及不同坡度的仿真与真实世界设置中进行了评估。
- 仿真实验:
- 示能性有效性: 实验表明,使用结合了地形坡度的示能基座位姿,比使用随机或固定目标位姿具有更高的物体位移效率。
- 接触点选择: 选择距离末端执行器最近的交互点可获得最高的效率(单位力产生的位移),优于基于机器人基座距离或几何中心的策略。
- 真实世界实验:
- 导航: 在坡度高达约 9° 的情况下,机器人到达目标位姿时的平均位置误差为 0.12 m,平均航向误差为 16.37°。
- 足部操纵: 系统实现了 86% 的物体交互成功率(定义为力阈值达到 25 N)。
- 性能表现: 在成功的尝试中,机器人实现了 0.17 m 的平均物体位移,平均峰值接触力为 33 N,从而获得了 0.51 m N⁻¹ 的平均效率得分。
- 鲁棒性: 系统成功处理了从导航到操纵的动态转换,无需人工干预,仅依靠无线控制器的安全检查。
重要性与主张
本文声称这项工作通过在开放世界环境中实现以物体为中心的足部操纵规划,解决了机器人领域的一个关键空白。不同于以往依赖专家指导或仅关注低层控制的方法,该框架使四足机器人能够:
- 基于视觉示能自主识别可行的基座位姿和交互点。
- 在无需预设轨迹或人类演示的情况下,执行复杂的操纵任务(推动物体)。
- 在变化的非结构化地形环境中有效运行。
作者认为这种能力对于行星探测、样本采集及救援行动等应用具有高度相关性,因为在这些场景中,由于延迟或危险因素,实时遥操作是不可行的。研究强调,该系统利用现有的腿部硬件实现了灵巧的操纵,避免了对额外机械臂的需求,从而充分利用了四足机器人固有的机动性。作者也谦虚地指出,尽管系统效果显著,但各互连组件(视觉、状态估计、控制)之间误差的累积仍是实现高精度任务的挑战,未来的工作将侧重于利用收集到的数据来学习更好的以物体为中心的表示。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。