Leveraging Inter-object Affordances for Efficient Planning in Contact-rich Tasks
本文提出了统一任务与运动规划(Unified TAMP, U-TAMP),该方法利用视觉-语言模型生成物体间的示能性抽象,从而在接触丰富的机器人任务中,相比现有方法显著提高了规划成功率和效率一个到两个数量级。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
长期以来,机器人一直是工厂车间的专家,在那里它们对完全相同的零件重复着同样精确的动作。但走进一个真实的厨房,规则就改变了。在这里,物体具有各种各样的形状、大小和材质,并且以复杂的方式相互作用。一个沉重的煎锅无法平衡在一个细小的盐罐上,而一个圆形的玻璃杯会从曲面上滚落。为了让机器人应对这种混乱的现实,它需要的不仅仅是一份步骤清单;它需要理解物体之间物理上的“交互规则”。这就是任务与运动规划(task-and-motion planning)所面临的挑战,该领域试图弥合高层目标(如“整理桌面”)与机器人手臂实际移动的底层物理学之间的鸿沟。尽管现代人工智能在理解语言和图像方面取得了长足进步,但要让机器人可靠地堆叠各种家用物品而不使其倒塌,仍然是一个显著的障碍。
因斯布鲁克大学的一个研究小组通过教导一种规划系统在动一下肌肉之前先思考物体之间的物理关系,解决了这个问题。他们没有依赖将所有物体视为统一方块的简化模型,而是开发了一种能够考虑现实世界物品特定“示能”(affordances)的方法。在这种语境下,示能简单来说就是根据物体的形状和材质,该物体允许机器人对其进行的动作。例如,一块平坦的切菜板提供了一个稳定的表面来承载其他物品,而盐罐的圆形底部则不行。研究人员构建了一个系统,利用这些物理事实在机器人尝试执行动作之前就过滤掉不可能的操作,从而确保只有在物理学确实允许的情况下,才会生成将杯子堆叠在煎锅上的计划。
他们工作的核心在于一种定义机器人如何与环境交互的新方法。他们创建了一套规则,描述了物体如何被抓取、支撑、抬起或滑动。例如,系统理解煎锅可以通过手柄抬起,但通过边缘抓取则太重且太笨拙。它知道木托盘太重无法从桌子上抬起,但可以在表面上滑动。通过将这些物理约束直接编码进规划过程,机器人避免了浪费时间去尝试执行那些在物理上不可能实现的动作,比如试图将一个又大又重的物体平衡在一个细小且不稳定的表面上。作者称这种方法为统一任务与运动规划(Unified TAMP),它允许机器人生成一系列在现实世界中保证可行、而非仅仅在理论上可能的动作序列。
为了测试这个想法,研究人员搭建了一个模拟厨房环境,其中包含一个机械臂和一系列常见物品:一个盐罐、一个玻璃杯、一块切菜板、一个煎锅和一个木托盘。目标是通过将这些散乱的物品整齐地堆叠到托盘上来进行整理。他们创建了一百多个不同的起始场景,通过改变物体的数量和初始位置,来观察该方法在压力下的表现。他们将新系统与另外两种方法进行了对比:一种是忽略特定物理属性的旧版规划工具,另一种是依赖大型视觉语言模型根据常识来猜测正确动作的系统。
结果令人瞩目。这个融入了详细物理规则的新系统在几乎每次测试中都能成功创建有效计划,当规则完全已知时,成功率高达百分之百。即使系统必须使用视觉模型来识别物体及其属性,它仍能达到百分之九十的成功率。相比之下,将物体视为通用方块的旧规划方法失败了一半以上,因为它试图以违背物理定律的方式堆叠物品,比如把沉重的煎锅放在微小的盐罐上。视觉语言模型尽管具备理解语言和图像的能力,但表现却很不理想,成功率仅为百分之四十左右。它经常忽略微妙的物理细节,例如圆形的表面无法支撑重物,导致生成的计划在文本逻辑上看似合理,但在现实中却会失败。
除了成功率之外,规划速度也是一个主要的差异点。新系统生成计划仅需不到一秒的时间,大约比视觉语言模型快两个数量级,后者平均需要一分多钟。这种速度优势源于新系统使用结构化的逻辑框架立即排除不可能的选项,而视觉模型则必须从头开始推理每一种可能性。研究人员发现,随着物体数量的增加,旧方法变得越来越慢且越容易出错,而他们的新方法则保持了高效与准确。这表明,如果机器人要在复杂的现实环境中有效运作,它们需要建立在物理理解的基础之上,而不仅仅是识别出物体是什么。
这项研究还强调了仅依靠人工智能来理解物理世界的局限性。虽然视觉语言模型是识别物体和生成想法的强大工具,但它们缺乏确保计划在物理模拟中有效的严谨、循序渐进的推理能力。研究人员展示了通过将这些模型的常识知识与严格的基于规则的规划系统相结合,可以实现两全其美:既具备识别现实世界物体的能力,又具备生成符合物理定律计划的能力。这种混合方法使机器人能够处理现实厨房中的混乱情况——比如沉重的煎锅不能通过边缘抬起,或者圆形的杯子不能平衡在曲面上——而不会陷入停滞或失败。
最终,这项工作证明了,对于机器人要从受控实验室走向我们的家庭,它们必须配备一种对物体如何相互作用的深刻的符号化理解。仅仅知道一个杯子的存在是不够的;机器人必须理解这个杯子有一个平底可以支撑杯垫,但侧面是弯曲的,无法支撑其他东西。通过将这些物理约束直接构建进规划过程,研究人员创建了一个既快速又可靠的系统。他们在现实模拟中进行的实验表明,该方法能够以极高的成功率处理复杂的堆叠任务,为需要在多变的现实人类环境中运行的机器人提供了一条充满希望的路径。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。