Where to Touch, How to Contact: A Hierarchical RL-MPC Framework for Geometry-Aware Sim-to-Real Manipulation
本文提出了一种分层 RL-MPC 框架,将灵巧操作解耦为高层接触意图规划与底层接触隐式控制,从而在多种非抓取任务中实现了鲁棒、高效且零样本的仿真到现实迁移。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
长期以来,机器人一直是工厂车间的专家,能够沿着预设的路径精准移动,以组装汽车或分拣包裹。然而,当这些机器步入充满不可预测性的现实世界时——特别是当它们必须在不单纯通过“抓取”的情况下处理物体时——它们往往会表现得力不从心。挑战在于“富接触”(contact-rich)操纵,即机器人必须通过推、滑、旋转或翻转物体来使其移动。与简单的举起不同,这些动作依赖于物体、机器人手臂与环境之间复杂且不断变化的相互作用。如果机器人推箱子力气过大,箱子可能会滑走;如果推的角度不对,箱子可能会倾倒或卡住。多年来,研究人员一直试图通过大量数据训练来教机器人应对这些情况,希望机器最终能通过试错法学会物理规则。然而,这种方法通常速度缓慢、耗费数据,并且当在计算机模拟中训练出的机器人在真实房间中使用时,往往无法奏效。
一组研究人员提出了一种不同的解决办法,通过模仿人类思考如何移动物体的方式。他们并没有试图一次性学习所有的微小肌肉运动和摩擦细节,而是将任务分解为两个截然不同的思维层面。在高层级上,机器人决定在哪里接触物体以及想要实现的总体结果,例如“推动把手使箱子向前滑动”。在低层级上,一个独立的系统负责实时计算如何执行该计划,并根据当时的精确物理状况进行调整,比如判断物体是在粘滞还是在滑动。这种结合了基于学习的“大脑”与基于物理的“肌肉”的新型框架,使机器人能够更快地学习,并将技能从模拟环境无缝迁移到现实世界,而无需任何额外训练。
研究人员在配备了一个简单棒状工具的机器人手臂上测试了这个想法,要求它执行不需要抓取的任务。在一种情景中,机器人必须将各种字母形状的积木从随机的起始位置推向特定的目标点。在另一种情景中,它必须重新定向一个立方体,通过翻转和旋转使其达到理想的姿态。在第三种情景中,它必须利用楼梯来辅助将一个物体翻转到桌面上。他们成功的关键在于一种被称为“接触意图”(contact intention)的特定指令。这并不是关于每个关节运动的详细指令,而是一个高层级的目标,即:“在这里接触物体,并旨在使其达到那个位置。”机器人的高层策略基于观察到的信息来预测这一意图。一旦意图确定,低层控制器就会接管。这个控制器就像一个快速运算的计算器,不断规划未来几秒钟的运动,以确保机器人的棒状工具始终与物体在选定位置保持接触,并带动物体向目标移动,同时在物体滑动或碰撞时进行即时调整。
这种方法之所以特别有效,是因为它分离了“做什么”与“怎么做”。高层策略只需要理解物体的形状和目标,而无需理会复杂的接触物理细节。这使得它能够快速学习,并能泛化到从未见过的形状。在测试中,机器人经过相对较少的训练,就能近乎完美地完成推行未知字母的任务。相比之下,试图从零开始学习整个过程(而不进行这种职责分离)的系统则需要多得多的数据,且表现并不理想。研究人员发现,与这些传统的端到端方法相比,他们的方法在学习一项任务时所需的决策步骤大约减少了四十倍。此外,由于高层策略专注于几何形状而非具体的物理动力学,因此可以在简单的计算机模拟中进行训练,然后几乎无需调整即可部署在真实的机器人上。
这种分离带来的结果在模拟和现实世界中都非常显著。当研究人员将训练好的机器人从计算机转移到一台物理性的 Franka 机器人手臂时,它在无需微调的情况下就能可靠地执行任务。对于字母推送任务,机器人在处理训练期间见过的字母时达到了 100% 的成功率,而在处理从未遇到的字母时也达到了 95% 的成功率。即使是对于在三维空间内翻转立方体这种更复杂的任务,机器人也几乎每次都能成功。在现实世界的测试中,机器人成功推送了未见的字母并重新定向了物体,通常在少于十次高层决策的情况下即可完成任务。唯一的失败案例是由实际问题引起的,例如摄像头丢失了对物体的追踪,而不是因为机器人的逻辑有误。这证明了机器人确实学习到了一种稳健的交互策略,而不仅仅是记住了某套特定的运动轨迹。
研究还探讨了当系统的某些部分被移除时会发生什么,从而证实了每个组件都是必不可少的。当研究人员移除设置中间目标的能力时,机器人经常会陷入困境,例如在原地绕圈或将物体推入角落,因为它试图直接到达最终目的地而缺乏计划。当他们移除关于机器人可以在不碰撞环境的情况下安全接触的位置信息时,机器人则难以找到有效的接触点。这些测试表明,机器人既需要对物体形状有清晰的感知,也需要一套分阶段移动的计划才能取得成功。该框架也优于其他尝试直接学习接触动力学的方法,后者往往会陷入局部循环,或者需要海量数据才能收敛。通过将困难的物理计算交给专门的控制器,学习系统得以专注于最重要的战略决策。
最终,这项工作为让机器在非结构化环境中变得更具能力开辟了一条新路径。它表明,教机器操纵物理世界最好的方法,不是强迫它一次性学习物理的所有细节,而是给它一个层次化的任务体系。机器人学习推理几何与策略,而一个独立的、可靠的系统则处理即时的物理执行。这种方法不仅使学习更加快速高效,而且弥合了模拟与现实之间的鸿沟,使得机器可以在虚拟世界中接受训练,然后立即投入现实工作的应用。展望未来,研究人员希望将这一框架扩展到拥有多个手指的更复杂的机械手,尽管他们也承认,目前的方法依赖于对物体位置的精确追踪,并且在面对更精细操作中众多的接触点时可能会面临挑战。但就目前而言,研究结果展示了一种清晰且稳健的方式,让机器学会如何触摸并移动周围的世界。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。