长期以来,机器人一直是工厂车间的专家,它们能够搬运沉重的零件并进行精准的放置。但一旦走出那个受控的环境,进入家庭或仓库,规则就改变了。在这里,物体往往太重而无法提起,或者太笨重而无法用夹持器抓取。为了移动一把笨重的扶手椅或一个大箱子,机器人不能仅仅将其拿起,而必须在地面上推、拉或滑动它。这被称为非抓取式操控(non-prehensile manipulation)。这是一项困难的技能,因为其中的物理特性非常复杂。与抓取物体时那种稳固的连接不同,推动依赖于摩擦力和接触角度。如果机器人在错误的视角进行推动,物体可能会滑走、倾倒,或者机器人自身可能会失去平衡。多年来,工程师们一直致力于教机器人如何在这种接触的微妙舞步中航行,而不至于发生碰撞或完全无法移动物体。
一组研究人员现在开发了一种教机器人掌握这些技能的新方法,该方法从一开始就引导机器人的学习过程。研究人员并没有让机器人随机猜测直到偶然找到推动物体的方法,而是给了它一张“触碰地图”。他们使用计算机算法来识别物体上最合理的接触点,例如椅子的腿或洗碗机的把手。然后,他们构建了一个训练系统,奖励机器人寻找这些特定的位置。然而,他们也意识到,如果机器人只关心触碰正确的点,它可能永远学不会如何将物体实际移动到目的地。为了解决这个问题,他们创建了一个学习进度表:起初侧重于寻找接触点,随后逐渐淡化这一重点,从而迫使机器人在建立良好的接触后,学会如何高效地移动物体。
研究人员在一台配备机械臂的四足机器人上测试了这种方法,这种机器人旨在通过操纵物体来应对崎岖地形。在模拟实验中,机器人学会了推动箱子并将椅子运送到特定位置。结果显示,如果没有这种引导式方法,机器人经常连物体都碰不到,或者会以导致物体倾倒的方式进行推动。通过使用这种方法,机器人在超过百分之九十的试验中成功移动了物体。至关重要的是,机器人学会了调整自己的身体和手臂以保持物体稳定,通常会降低自身的重心,以防止沉重的家具倾倒。
真正的考验出现在研究人员将机器人从计算机中移入现实世界时。他们将机器人放在各种从未见过的椅子前,其中包括一些三足椅和一些带有折叠机构的椅子。尽管形状和重量各异,机器人仍成功地将它们推拉到了目标位置。在一次实验中,他们给一把椅子增加了额外的重量,使其比机器人手臂的技术额定承重还要重。机器人通过利用其腿部和地面作为支撑,依然成功移动了它,这证明它已经学会了利用全身的力量来完成工作。机器人还表现出了从错误中恢复的能力;如果它打滑或失去接触,它会自动重新定位自己并再次尝试,而不会停下来。
研究人员还将这种技术应用于一个更复杂的任务:打开洗碗机。这个物体具有运动部件,要求机器人首先抓取把手,然后随着门板的摆动切换到推动门板。机器人学会了将把手识别为起始点,然后无缝过渡到推动门板直至其完全打开。这表明该方法可以处理在任务过程中发生形状变化的物体,而不仅仅是静态的方块。这项研究表明,通过将机器人的初始好奇心引导向有意义的接触点,然后逐渐让它自行探索其余部分,工程师可以教会机器处理日常生活中那些沉重、笨拙且难以预测的物体。虽然该系统仍依赖外部摄像头来追踪物体的位置,但其核心学习策略已被证明足以应对现实世界中重量、形状和摩擦力的变化,让我们离能够真正协助家中繁重劳动的机器人又近了一步。
技术摘要:基于多评论家强化学习的接触引导式非抓握移动操纵探索
问题陈述
非抓握操纵(推、拉、滑动)结合移动平台,为在非结构化环境中移动沉重或笨重的物体提供了多样化的解决方案。然而,控制此类交互具有挑战性,因为其动力学具有混合特性,依赖于单侧接触约束和摩擦锥,而非刚性抓取。虽然深度强化学习(DRL)为传统的模型预测控制(MPC)提供了一种无模型替代方案,但在移动操纵任务中面临着显著的“探索瓶颈”。在这些长时程任务中,随机探索很难产生有效的接触,导致奖励稀疏。因此,智能体往往会收敛到局部最优解,即通过完全避免接触来最小化能量或运动惩罚,从而无法学习必要的交互技能。此外,现有方法在处理复杂的非凸几何形状物体时表现不佳,因为均匀的表面采样会导致运动学上不可行的接触点。
方法论
作者提出了一种在**多评论家强化学习(Multi-Critic RL)框架内实现的接触引导式探索(Contact-Guided Exploration)**策略。其核心架构和训练过程如下:
- 以物体为中心的接触先验: 系统并非采用均匀采样,而是利用通用的抓取算法在物体网格上生成一组候选交互点(例如:椅腿、把手)。在训练回合期间,系统从该集合中采样一个特定的目标接触点,以引导末端执行器。
- 多评论家架构: 该框架采用共享骨干网络,并配有三个专门的评论家头(Critic Heads),分别对应不同的奖励组:
- 任务奖励 (rtask):侧重于目标达成(物体位置和速度)。
- 探索奖励 (rexp):一种稠密奖励,鼓励末端执行器接近采样的接触点。
- 正则化奖励 (rreg):惩罚突发运动、能量消耗以及违反关节限制的行为(例如:钩子高度)。
- 加权优势混合: 策略使用复合优势函数进行更新,At=∑whAth,其中 wh 代表各奖励组的权重。
- 衰减调度: 一个关键组件是评论家权重的动态调度。探索权重 (wexp) 在训练早期阶段(5k–10k 步)从 0.1 线性退火至 0.01,同时正则化权重逐渐增加。这迫使策略在初期优先考虑寻找有意义的接触,随后逐步过渡到优化任务性能和稳定性,从而将探索阶段与最终的任务目标解耦。
- 系统控制: 高层策略输出目标臂关节位置、底座速度和底座高度。底座高度被主动调节,以防止在手臂向下延伸时达到肩部关节极限。低层腿部指令由一个冻结的、预训练好的运动策略处理。
核心贡献
- 接触引导式探索策略: 一种新颖的方法,通过利用源自抓取算法的以物体为中心的先验知识,引导强化学习探索有意义的交互区域,而非依赖于均匀采样或专家演示。
- 带有衰减机制的多评论家公式化: 实现了一个专门的探索评论家,其影响力会逐渐衰减。这使得智能体能够在早期学习富接触行为,随后将其精炼为鲁棒的任务最优策略,而不会陷入次优的探索行为。
- 系统性评估与硬件验证: 在箱体推动、椅子运输和洗碗机开启任务中进行了广泛评估。至关重要的是,椅子运输策略在真实的四足移动操作机器人(ALMA)上得到了验证,展示了对未见过的物体几何形状和质量的零样本泛化能力。
结果
- 仿真性能: 所提出的方法(Multi-Critic PPO + 权重调度)在椅子运输任务中实现了 94.1% 的成功率,显著优于标准 PPO(受困于高“漏失接触”率)和固定权重多评论家基准(由于持续的探索激励而导致较高的“倾覆”率)。
- 失效模式分析: 该方法有效地缓解了“漏失接触”问题(将其降低至忽略不计的水平),并相比于在不稳定学习或局部最优中挣扎的基准方法,最大限度地减少了“倾覆”事件(4.4%)。
- 现实世界部署: 在 ALMA 四足机器人上,该策略在四种未见的 IKEA 物体(包括折叠椅和三脚桌)上实现了 69.0% 的综合成功率。系统展示了:
- 泛化性: 在无需微调的情况下,成功操纵不对称和非标准几何形状的物体。
- 反应式恢复: 在发生滑动或尝试失败后,能够自主重新规划并重新建立接触。
- 高载荷处理: 通过利用地面支撑和移动底座动力学,成功运输了一把增加了 5 kg 负载(总重 6.5 kg)的椅子,超过了机械臂额定的静态负载。
- 扰动抑制: 在运输过程中能从物理推搡中恢复。
- 关节类物体: 在洗碗机开启任务中,策略学会了动态序列化接触:随着运动学状态的变化,从把手切换到门板,与标准 PPO 相比,这使手臂处于关节极限附近的时间减少了 59%。
意义
本文声称,通过构建学习过程,该方法解决了非抓握移动操纵中奖励稀疏的基本难题。通过多评论家架构配合衰减调度,将探索与任务目标解耦,该系统避免了“规避惩罚”与“寻找接触”之间的权衡。这项工作证明了无需专家演示即可学习接触丰富的重型操纵任务,并在具有不同物体形态和质量的物理硬件上实现了鲁棒的仿真性能和可部署行为。作者指出,尽管结果令人鼓舞,但对外部动作捕捉的依赖限制了野外部署,未来的工作可以探索基于性能的自适应课程学习,以降低对超参数的敏感性。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。