← 最新论文
💻 computer science

IM-ENGINE: Image Editing for Embodied Data Generation

IM-ENGINE 是一个以模拟器为基础的流水线,它利用图像编辑作为中间表示,为具身机器人学习生成可扩展、具有语义意义且物理可执行的监督信号,特别是在实现灵巧抓取合成和目标状态生成方面。

原作者: Yian Wang, Junyi Cao, Xiaowen Qiu, Chuang Gan

发布于 2026-09-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Yian Wang, Junyi Cao, Xiaowen Qiu, Chuang Gan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

长期以来,机器人一直在与拿起杯子或挂起外套这类简单的动作作斗争。虽然机器人的移动速度和精度惊人,但它们往往缺乏一种直觉性的理解,即如何抓取物体才能使其发挥作用。机器人可能会成功举起一个喷雾瓶,但如果它抓的是瓶身而不是扳机,它就无法进行喷洒。这种物理能力与功能意图之间的差距,是教导机器人帮助人类的一大障碍。传统上,研究人员试图通过两种方式来解决这个问题:要么拍摄人类执行任务的过程,要么让计算机模拟数百万次随机运动直到其中一次奏效。第一种方法既缓慢又昂贵,而第二种方法产生的结果往往在物理上可行但在实际应用中毫无意义,比如手抓着杯沿而不是把手。

来自马萨诸塞大学阿默斯特分校和 Genesis AI 的一个研究小组开发了一种新的弥合这一鸿沟的方法,称为 IM-ENGINE。他们的方法将机器人的学习过程视为一位创意艺术家与一位严谨工程师之间的对话。他们首先使用一个包含物体的房间计算机模拟,然后使用图像编辑工具画出一只人手抓取物体或将物体放置在特定位置的图像。这张编辑后的图像作为视觉指令,向系统明确传达了期望的结果应该是什么样子的。随后,系统利用已知的模拟规则,从这张二维图片出发进行逆向推导,计算出手和物体的精确三维位置和朝向。最后,物理引擎会检查所提议的动作是否真正可行,拒绝任何会导致物体漂浮、掉落或撞穿桌子的方案。其结果是一个机器人运动库,这些运动不仅在物理上有效,而且在语义上也正确,能够教会机器人像人类一样握住电钻的手柄,或将马克杯挂在树枝上。

该方法的核心依赖于一个将简单绘图转化为机器人就绪指令的四步流程。首先,系统渲染一个带有精确深度和几何测量数据的模拟场景。接着,一个图像编辑模型会对这张图片进行修改,插入一只处于功能性姿态的人手,或将物体移动到期望的最终状态(例如将盘子滑入碗架)。这一步提供了“意图”,捕捉了人类与世界进行特定交互的愿望。随后,系统利用原始模拟数据作为引导,在三维空间中重建场景。因为计算机准确知道摄像机的位置以及物体的深度,所以即使在图像被修改后,它也能精确计算出手或物体在现实世界中的位置。

一旦系统拥有了所需动作的三维模型,它就会对其进行严格的物理测试。计算机模拟该动作,检查碰撞和稳定性。如果提议的抓取会导致滑动,或者物体在放置时会倾倒,系统就会丢弃该尝试并重新尝试。这确保了生成的每一个动作不仅仅是一张漂亮的图片,而是一个在物理上可执行的动作。对于需要复杂运动的任务,例如将马克杯穿过细窄的树枝,系统会规划一条避开障碍物的路径,确保机器人能够在不撞倒任何东西的情况下达到目标。最终的输出是一组机器人可以遵循的轨迹,其中包含了实现任务所需的指尖位置和手臂运动。

研究人员在各种具有挑战性的任务上测试了该系统,包括抓取电动工具、喷雾瓶和高脚杯,以及将物体放入容器(如碗架和马克杯架)中。在涉及 ShadowHand 机器人的测试中,该系统在提升物体方面的成功率达到了 99.4%,在执行正确的抓取方式方面的成功率达到了 83.2%。这相比以往的方法有了显著提升,以往的方法往往能成功举起物体,却无法以正确的方式抓取。例如,虽然其他系统能 97% 的时间成功举起喷雾瓶,但只有 7% 的时间能正确握住扳机;相比之下,新方法能 69% 的时间正确握住扳机,证明了视觉引导有效地教会了机器人功能性交互的细微差别。

该系统在“目标状态生成”方面也表现出色,即机器人必须将物体放置在特定的配置中,例如将一把剪刀挂在架子上,或将一根管子插入支架中。在这些高度依赖关系的复杂任务中(即最终位置取决于两个物体之间的精确对齐),新方法的成功次数为 40 次中的 35 次。这远优于那些依赖猜测位置或使用简单视觉线索的方法,后者往往无法考虑到任务中的紧密约束。研究人员发现,通过从清晰的视觉目标开始并经过物理优化,该系统可以解决以前通过自动化数据生成难以处理的问题。

为了验证这些模拟课程能否转化为现实世界,团队使用 IM-ENGINE 生成的数据训练了一台机器人,并使用真实的物体对其进行了测试。机器人成功完成了抓取马克杯和悬挂衣架等任务,成功率分别为 80% 和 70%。这表明在虚拟世界中创建的数据足够强大,足以教导物理机器人如何处理现实世界的物体。研究人员指出,虽然该系统非常有效,但并非完美;它偶尔会生成描绘不可能交互的图像,或者物理模拟可能会遗漏细微的碰撞。然而,整个框架提供了一种强大的新方法,用于生成高质量、针对特定任务的数据,从而让机器人学习复杂的操控技能。

这项工作的意义不仅在于改进机器人的手部动作。通过展示图像编辑可以作为人类意图与机器执行之间的桥梁,研究人员为机器人学习开辟了一条新路径。机器人不再依赖昂贵的人类演示或无止尽的随机尝试,而是可以从植根于物理现实的视觉示例中学习。这种方法允许快速生成多样化的训练数据,无需持续的人类干预即可覆盖广泛的物体和任务。随着机器人越来越多地融入我们的日常生活,教导它们不仅是如何移动,更是如何有意义地与世界互动,将变得至关重要。IM-ENGINE 系统为实现这一未来迈出了极具前景的一步,将简单的视觉指令转化为了可靠的物理动作。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →