DREAM: Deployment-Time Demonstration Generation via Real-to-Sim for Scalable Policy Adaptation
DREAM 是一个能够使视觉-语言-动作模型向新工作空间进行可扩展适应的框架,它通过实到虚重建、大语言模型驱动的任务规划以及轨迹渲染来自动生成微调数据,从而消除了对高成本人工遥操作演示的需求。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
长期以来,机器人一直是重复动作的大师,能够在工厂里精准地执行成千上万次相同的动作,但当被要求适应一个新房间或略有不同的物体排列时,它们却显得力不从心。为了教会机器人一项新任务,工程师们传统上依赖一种被称为“遥操作”(teleoperation)的方法,即由人类物理引导机器完成每一个步骤,并记录下每一次移动以创建训练数据集。虽然这种方法很有效,但过程缓慢、成本高昂,且要求人员必须在每一个新环境中都在场。机器人领域目前正转向一种不同的方法:使用能够同时理解语言和视觉的人工智能模型。这些模型经过海量数据的训练,已经可以根据像“把蓝色方块放入碗里”这样简单的句子来推测如何移动机械臂。然而,即使是这些先进的系统,在面对从未见过的现实世界环境时也经常失败,因为房间的具体布局、光照以及物体的精确位置都构成了独特的挑战,这是通用训练无法解决的。
东京大学的研究人员开发了一套名为 DREAM 的系统来解决这个问题,而无需人类引导机器人。该系统不再要求人类演示任务,而是通过一段空置工作空间的短视频和一条简单的文本指令,构建出一个精确的数字孪生空间,其中包含了机器人观察环境时所使用的精确相机视角。通过一个复杂的规划引擎,计算机可以计算出实现目标的逻辑动作序列,例如拿起一个物体并将其放在某处。随后,它会在虚拟世界中生成该任务的数千种变体,模拟物体处于不同起始位置的情况,并记录下机器人的成功移动路径。这些模拟出的移动轨迹随后会被转化为真实的图像和动作数据,用于在机器人接触真实世界之前对其“大脑”进行微调。
这种方法的核心在于创建物理空间的“数字孪生”。研究人员首先使用标准的便携式相机拍摄一段桌子或工作空间的简短视频。系统会对这段素材进行分析,从而在三维空间中重建场景,捕捉每个表面和物体的纹理与位置。至关重要的是,它将这种数字重建与机器人自身的坐标系相对齐,确保虚拟相机看到的景象与真实机器人的相机完全一致。这使得系统生成的训练数据看起来和感觉起来都像是真实环境,从而弥合了计算机模拟与物理世界之间的鸿沟。环境构建完成后,系统利用大语言模型将人类指令转化为一系列逻辑目标。例如,如果指令是“打包水果”,系统就会理解它必须先伸手去拿香蕉,然后是桃子,最后将它们放在盘子里。
在定义好目标后,系统会采用“任务与运动规划器”(task-and-motion planner)来确定完成任务所需的物理步骤。这个规划器就像一位高度逻辑化的工程师,将任务分解为一系列动作,并计算出机器人需要进行的精确关节运动,以避免碰撞并触达目标。它会生成一小组初始的成功路径,称为“源演示”(source demonstrations)。为了创造足够的数据来训练一个稳健的机器人,系统会将这些少量的示例扩展成一个庞大的数据集。它将成功的移动应用到数百个随机化的新场景中(即物体位置发生变化的情况),并检查每一次尝试是否符合物理规律且安全,剔除所有失败的尝试。最后,它将这些成功的尝试渲染成逼真的视频帧,创建一个完整的图像-动作对数据集供机器人学习。
研究人员在真实机械臂上测试了这一方法,执行了两个截然不同的任务:将蓝色方块放入红色碗中,以及按特定顺序将香蕉和桃子装入盘中。他们将基于 DREAM 生成的数据进行训练的机器人,与通过人类操作员引导机器进行训练的机器人进行了对比。结果显示,数字孪生是现实世界表现的可靠预测器:如果机器人在模拟中表现出色,那么在现实世界中也会表现出色。更重要的是,该系统证明了其高度的可扩展性。人类操作员在合理的时间内大约只能制作一百次演示,而 DREAM 系统则能生成一千个高质量的训练样本。当使用这种更大规模的自动生成数据进行训练时,机器人的成功率高于那些使用较少人类演示数据训练的机器人。
这项研究凸显了机器人学习方式的重要转变。虽然人类遥操作仍然是收集数据的一种有效方式,但它受限于操作者的时间和注意力。相比之下,DREAM 系统仅需一段视频采集和一条文本指令,即可产生大量的训练样本。初始设置仅需几分钟,但一旦系统开始运行,它生成数千个训练场景所需的时间,仅相当于人类记录寥寥数个样本的时间。研究人员发现,对于简单任务,自动生成的数据能让机器人比人类收集的数据获得更高的成功率,这仅仅是因为练习的量级要大得多。对于更复杂的、多步骤的任务,该系统依然优于人类数据收集,尽管复杂任务需要更多的计算时间来进行初始动作的规划。
这项工作预示着一个机器人可以在极少人工干预的情况下部署到新环境中的未来。用户不再需要等待专家花费数小时来教机器人如何应对特定的厨房或车间,只需向机器人展示房间并告诉它要做什么即可。系统随后会处理繁重的训练数据创建工作,确保机器人为该空间的特定挑战做好准备。研究人员承认,目前的系统在处理静态桌面上的刚性物体时效果最好,未来的工作需要解决涉及柔软或移动物体的更复杂场景。然而,能够将一段简单的视频和一句话转化为一个经过完整训练的机器人策略,代表了迈向让机器人助手真正具备适应性并走进日常生活的关键一步。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。