想象一下,你正试图在一个堆满杂物的房间里,推着一个沉重且形状怪异的箱子,把它送到另一端的特定位置。你不能把它拎起来,只能通过推的方式移动它。这就是机器人学中所说的“非抓取操纵”(non-prehensile manipulation)。
这篇论文描述了一种新的方法来让机器人解决这个问题,而由于物理特性非常复杂,这向来是一个极具挑战性的难题。如果你推错了一点点,箱子可能会卡住、撞到墙上,或者失控旋转。
以下是他们解决方案的简单拆解,使用了日常类比:
问题所在:“近视眼”机器人
标准的机器人规划(称为 MPPI)就像是一个戴着眼罩的人在推箱子,他的视野只能看到前方几英尺远的地方。他只关注眼前的局部位置,并试图找到当前能让箱子离目标更近的最佳推力。
问题在于,有时为了到达目标,你必须先将箱子向远离目标的方向推,才能绕过椅子或桌子。一个“近视”的机器人会认为这种移动是个坏主意,因为它在当下增加了与目标的距离,因此它会拒绝这样做。它会试图直接穿过障碍物,结果导致自己陷入僵局。
解决方案:“建筑师”与“建造者”
作者提出了一个两步走的团队协作方案,将任务拆分为规划器(建筑师)和执行器(建造者)。
- 建筑师(物体级规划): 首先,机器人忽略自己拥有机械臂关节这一事实。它假装这个箱子是神奇的,可以自行移动。它会问:“如果我可以让这个箱子直接绕过障碍物移动到目标点,那么完美的路径是什么?”它绘制了一张关于箱子“应该”如何移动的地图,暂时忽略机器人的物理限制。
- 建造者(机器人级规划): 现在,机器人观察这张地图。它会想:“好的,箱子需要先去这里,然后再去那里。”随后,机器人计算出如何移动自己的手臂,从而沿着这条特定的路径去推动箱子。
通过给机器人一张关于物体运动轨迹的“大局观”地图,机器人就不再会犯近视眼的错误。因为它知道“建筑师”告诉它,那是绕过障碍物的唯一途径,所以它愿意暂时将箱子推离目标方向。
两种变体
论文测试了这两个角色协同工作的两种方式:
- “一次性完成”法 (SOI): 建筑师在最开始就绘制好整张地图。随后,建造者尝试逐步遵循这张地图。如果箱子被撞了一下或者地面很滑,建造者必须设法在保持原定地图路径的同时进行调整。
- “实时更新”法 (CLOI): 建筑师和建造者处于一个循环之中。建筑师绘制一段短路径,建造者跟随它,然后检查箱子实际停在了哪里。接着,建筑师根据箱子的“实际”新位置重新绘制下一段地图。这种方法在情况出错时更具鲁棒性(稳健性),但需要更多的计算能力来不断重绘地图。
结果:奏效了吗?
研究人员在真实的机器人手臂(xArm6)和计算机模拟中测试了该方法。
- 成功率: 新方法完成任务的效果显著更好。在计算机模拟中,它的成功率比标准机器人高出 40%。在真实机器人的实验中,成功率提高了 20%。
- 速度: 有趣的是,新方法并没有拖慢机器人的速度。事实上,在模拟中,由于“建筑师”简化了问题,使得“建造者”更容易找到解决方案,因此计算速度反而快了 26%。
- 现实表现: 即便存在摄像头误差和推力不精准的问题,新方法处理障碍物的能力也远强于旧方法,后者经常会直接放弃或卡住。
核心结论
论文指出,通过将“物体应该去哪里”与“机器人如何移动”进行分离,机器人可以进行更长远的思考并避免陷入僵局。这就像是给司机提供了一个告诉他需要绕道的 GPS 路线,而不是仅仅告诉他“直行前往目的地”,否则可能会带他进入死胡同。
作者也指出目前存在的两个局限性:如果机器人对物体的模型不准确,地图可能无法被遵循;此外,该系统需要大量的计算能力来运行模拟。但总体而言,它让机器人在杂乱的房间里推动物体变得更加出色。
技术摘要:面向非抓取式机器人操控的对象感知模型预测路径积分控制
问题陈述
非抓取式操控(如推动物体)扩展了机器人的能力范围,使其超越了稳定的抓取,但也带来了显著的挑战,特别是在长时程规划方面。其主要困难源于两个因素:
- 不连续的接触动力学: 机器人运动的微小变化可能会导致物体行为发生质的变化,具体取决于接触是如何建立或断开的。这使得机器人配置空间的大部分区域在完成任务进度方面是无效的。
- 隐式驱动: 物体并非被直接驱动;机器人必须推断出必要的运动,以通过接触产生期望的物体位移。这创造了一个巨大的搜索空间,规划器必须同时对机器人运动学、接触几何形状和物体响应进行推理。
标准的基于采样的模型预测控制(MPC)方法(如模型预测路径积分控制,MPPI)利用快速并行模拟器来处理复杂的动力学。然而,在非抓取式任务中,标准 MPPI 通常难以进行长时程规划,由于短视的代价最小化,经常在障碍物附近停滞不前,或无法发现可行的绕行路径。
方法论
作者提出了一种 分层形式的 MPPI,将联合机器人-物体规划问题分解为两个运行在不同抽象层级的耦合最优控制问题:一个物体级问题和一个机器人级问题。
分层分解
核心思想是将物体视为通过虚拟控制输入进行直接驱动,从而生成参考轨迹,进而引导机器人级规划器。
- 物体级规划: 系统求解一个仅针对物体的最优控制问题(公式 13),假设物体可以被直接驱动。该规划器在一个更小的物体运动配置空间内运行,并具有更长的时程(Ho),生成名义物体参考轨迹 xo∗。
- 机器人级规划: 机器人级规划器(公式 14)求解实际的机器人控制输入,其时程较短(Hr)。它最小化一个包含标准机器人动力学以及耦合项 ℓc 的代价函数,该耦合项惩罚实际物体状态与物体级规划器生成的参考轨迹之间的偏差。
控制变体
论文引入了两种具体的层次化实现方案:
- 顺序对象感知(SOI)MPPI: 物体级规划器计算一次全局参考轨迹(离线或在回合开始时)。随后,机器人级规划器以递推时程的方式执行该轨迹,且不更新物体参考。
- 闭环对象感知(CLOI)MPPI: 物体级规划器以闭环方式运行。在每个时间步,它根据最新的观测到的物体状态重新计算物体参考轨迹。这为简化物体模型与实际交互动力学之间的偏差提供了鲁棒性。
代价函数
- 物体级: 代价函数追踪与目标的平方距离,并惩罚与静态障碍物的过度接触力(使用接触力大小的铰链损失)。
- 机器人级: 代价包括末端执行器与物体的接近度、末端执行器相对于目标的对齐程度(鼓励“推动”姿态),以及保持有利的垂直朝向。
核心贡献
本文的主要贡献如下:
- 分层 MPPI 变体: 引入了 CLOI 和 SOI,它们将非抓取式操控分解为物体级和机器人级规划问题,有效地减少了机器人级的规划时程,同时允许物体级进行长时程推理。
- 数学公式化: 基于耦合仅通过外部力项发生的通用动力学模型,提供了一种清晰的分解形式。
- 实验验证: 通过在 IsaacGym 模拟环境和使用 6 自由度 xArm6 机械臂的真实硬件实验中,证明了该方法的有效性。
实验结果
作者在 IsaacGym 模拟和使用 6 自由度 xArm6 机械臂的真实硬件实验中,针对五种不同的非抓取式任务(从简单的推动到在拥挤环境中导航)评估了其方法。
模拟结果
在五种不同的非抓取式任务中(涵盖从简单推动到复杂环境导航):
- 成功率: SOI 实现了 82% 的成功率,CLOI 实现了 72%,而标准 MPPI 仅为 42%。
- 性能: 对象感知方法表现出更低的平均位置误差,并且显著缩短了执行时间(SOI 约为 183s,CLOI 约为 195s,而 MPPI 为 236s)。
- 频率: CLOI 展示了比标准 MPPI 快 26% 的控制频率(3.01 Hz 对比 2.38 Hz),这归功于降低了机器人级搜索空间的复杂度。
硬件结果
在涉及将罐头推向目标的真实世界实验中(包括有障碍物和无障碍物的情况):
- 成功率: CLOI 和 SOI 均达到了 90% 的成功率,优于标准 MPPI 的 70%。
- 执行时间: 即使考虑到离线物体轨迹规划的开销,SOI 仍产生了最低的总体执行时间。
- 鲁棒性: 虽然标准 MPPI 在成功尝试中的位置误差略低(可能是由于测试集环境较简单),但对象感知方法在导航障碍物和避免停滞方面表现出更强的能力。作者指出,当规划的参考轨迹过于靠近障碍物时,会导致所提方法失败,因为这给硬件执行误差留下的余量不足。
意义与主张
论文声称,所提出的对象感知 MPPI 方法显著提高了长时程非抓取式操控的可靠性和样本效率。通过在独立的物体级计划中注入任务结构,该方法引导机器人级规划器走向更有希望的控制动作,从而实现了标准 MPPI 往往缺乏的非近视(non-myopic)推理。
作者承认存在两个局限性:
- 模型失配: 简化的物体模型与实际机器人-物体动力学之间的差异可能导致产生动力学上不可行的参考轨迹。
- 计算成本: 层次化方法增加了总共需要的并行模拟次数,因为它涉及同时求解物体和机器人问题。
未来的工作建议通过不确定性感知引导和接触感知物体建模来解决这些限制,例如在 Rollout 过程中显式考虑可行的接触力矩(wrench)以及随机化摩擦力等参数。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。