Scene2Demo: Self-Evolving Embodied Data Generation via Object-Action Graph
Scene2Demo 是一个利用物体-动作图(object-action graphs)和反馈驱动细化(feedback-driven refinement)进行自我进化的框架,能够从单张图像中自动生成高质量、可执行的具身数据,从而显著提升任务规划成功率并实现有效的下游机器人策略学习。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
能够在我们的家中移动并协助处理日常家务的机器人,长期以来一直是科幻小说中的梦想,但制造出这样的机器人已被证明是一个极其困难的现实。核心问题不仅在于教会机器如何移动它的手臂,还在于教会它如何理解一个混乱、不可预测的世界,并决定下一步该做什么。为了学习这些技能,机器人传统上需要海量的数据:数千小时展示人类执行任务的视频,或者在计算机模拟中进行数百万次的试错尝试。通过人工收集这些数据既缓慢又昂贵,而且对于罕见或危险的情景来说往往是不可能的。研究人员已转向利用人工智能来自动生成这些数据,但早期的尝试往往产生的模拟场景虽然看起来真实,却违反了物理定律,或者生成的指令是机器人实际上无法执行的。挑战在于创建一个能够接收一张房间照片和一个简单的请求,然后构建一个运行良好的、基于物理法则的模拟系统,让机器人在其中成功练习任务,通过失败与自我纠正,直到最终成功。
一个研究团队推出了一种名为 SCENE2DEMO 的新系统,该系统通过扮演一个“自我改进的数据工厂”来解决这一问题。该过程始于一张真实房间(例如厨房)的照片和用户的一条简单文本指令,例如“拿起玻璃杯”。系统首先利用先进的计算机视觉技术,将那张照片重建为一个完全可交互的 3D 模拟环境。它识别物体、它们的形状以及它们所在的位置,创建一个遵循重力和碰撞等物理法则的数字孪生场景。一旦这个虚拟房间建成,系统并不仅仅是猜测机器人应该如何移动;它会将用户的请求分解成一系列逻辑清晰、易于管理的微小步骤。它将任务视为一张地图,其中旅程的每一站都是一个特定的动作,例如开门或拿起物体,并确保一个步骤的结束能完美地衔接下一个步骤的开始。
随后,系统尝试在模拟环境中运行该计划。如果机器人成功了,系统会记录整个动作序列和摄像机视角,作为未来学习的完美范例。然而,SCENE2DEMO 真正的力量在于机器人失败时所发生的情况。在许多之前的系统中,一次失败会被直接丢弃。在这里,系统采用了自我进化机制。当某个步骤出错时——例如机器人撞到了门或掉落了物体——两个专门的数字智能体就会介入调查。一个智能体充当安全检查员,从多个摄像机角度观察失败的视频,以精准定位问题所在。另一个智能体充当监督员,利用这些视觉证据来重写计划。它可能会建议将机器人的底座稍微向左移动,或者将手臂再伸长一点,然后再尝试执行任务。这种尝试、失败、分析和纠正的循环会自动持续进行,直到机器人成功完成任务。
研究人员在一百多个不同的场景中测试了这种方法,范围从简单的任务(如拿起杯子)到复杂的、多步骤的家务(如将玻璃杯放入冰箱)。如果没有自我纠正功能,该系统在简单任务中的成功率约为 72%。当他们为更复杂的长程任务加入自我进化循环后,成功率显著提高,且单个步骤的质量也变得更加可靠。该系统能够生成高质量的训练数据,随后用于教导真实的机器人策略。当机器人从这些自动生成的示例中学习时,它在打开冰箱的任务中达到了 96% 的成功率,在拿起玻璃杯的任务中达到了 92% 的成功率,这证明了机器创建的数据足够健壮,足以教会机器人在现实世界中执行任务。
这项工作表明,我们不需要手动记录机器人可能与世界进行交互的每一种方式。相反,通过将真实的模拟与允许系统从自身错误中学习的反馈循环相结合,我们可以生成庞大的可靠训练数据库。该系统并不依赖于魔法或完美的视觉,它依赖于一个将问题分解、进行测试并根据视觉证据优化解决方案的结构化过程。虽然目前的系统在特定类型的动作和物体上存在局限性,并且在面对最复杂的物理约束时仍有困难,但它展示了一条清晰的前行之路。通过自动化创建训练数据,这种方法最终可能让机器人仅通过看一眼房间的照片并被告知要做什么,就能快速且安全地学习新技能。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。