RoboCousin: Build Your Own Simulation Playground for Robust Bimanual Robotic Manipulation
RoboCousin 是一个可扩展的仿真平台,它能够自动将用户提供的物体观测数据转换为多样化、符合物理规律的资产和专家轨迹,从而为具有高效从仿真到现实迁移能力的双臂机器人操作实现可扩展且鲁棒的数据生成。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
教导机器人像人类一样使用双手是现代机器人领域最困难的挑战之一。为了学习复杂的任务,如折叠衣物、打开罐子或搬运重箱子,机器人需要看到成千上万个如何完成这些动作的范例。在现实世界中,收集这些范例既缓慢、昂贵,又往往具有危险性。如果机器人摔碎了一个玻璃杯,它会破碎;如果它撞倒了一叠餐具,清理工作将是一件苦差事。因此,科学家们转向了计算机模拟。他们构建了虚拟世界,让机器人在不损坏任何东西的情况下进行数百万次的练习。然而,一个主要问题一直阻碍着这一领域的发展:大多数模拟环境就像是带有固定家具的封闭房间。你可以让机器人在房间里跑来跑去,但你无法轻松地添加一个新物体(例如用户拥有的特定咖啡杯),或者改变房间的布局。要做到这一点,人类工程师通常需要花费数小时手动重建物体的形状、定义其重量,并确定机器人的手指应该如何精确地接触它。这种手工劳动过于缓慢,阻碍了创建用于教会机器人真正适应能力的庞大且多样化数据集的过程。
一组研究人员推出了一种名为 RoboCousin 的新系统,通过将模拟器转变为一个开放、可扩展的工作室,解决了这一瓶颈。该系统不再强迫机器人仅从预选的物体列表中学习,而是允许用户通过拍摄一张简单的照片或一段关于房间的描述,瞬间将其转化为机器人可以练习的真实的、可交互的三维模型。该系统不仅仅是创造一张漂亮的图片;它会自动计算物体的物理属性,例如其重量和表面的光滑程度,并计算机器人夹持器抓取它的最佳位置。这个过程将一张扁平的图像转化为一个“数字表亲”(digital cousin)——一个看起来和行为都像实物,但又足够灵活,可以与其他物体和背景混合以创建无穷无尽的新训练场景的虚拟版本。
研究人员在现有的模拟平台之上构建了这个系统,并添加了一个处理从初始照片到最终机器人动作的全流程流水线。当用户提供一张物体图像时,系统首先将其从背景中分离出来,并重建其三维形状。然后,它利用人工智能来推测物体的物理特征,例如质量和摩擦力,确保机器人能与物体进行真实的交互。至关重要的是,系统会自动识别“接触点”,即机器人手部可以安全且有效地抓取物体的特定位置。在传统的设置中,人类必须为每一个物体手动标记这些点,这是一个极其繁琐的过程,限制了可以添加的物体数量。而在这个新系统中,计算机可以瞬间完成。其结果是拥有了一个包含超过 3,000 个不同物体实例和 50 种不同背景环境的库,随时供机器人使用。
为了使训练更加稳健,该系统创建了“数字表亲”。虽然“数字孪生”(digital twin)是现实场景的一个精确、僵硬的副本,但“数字表亲”是一个保留了重要关系但改变了细节的变体。例如,如果机器人需要学习如何从桌子上拿起一个瓶子,系统可以生成一个瓶子颜色不同、桌子材质不同、或者背景是厨房而非客厅的场景,只要瓶子仍然以合理的方式放在桌子上即可。这种方法教会机器人的是核心概念,而不是仅仅死记硬背某一个特定的设置。该系统还可以扩展到房间级别。它可以规划一个移动机器人在虚拟房屋中导航、接近桌子并执行操作任务的路径,这一切都在单个连续的模拟中完成。这使得机器人不仅能学习如何移动手臂,还能学习如何移动整个身体以完成任务。
团队测试了这种自动化方法在现实世界中是否有效。他们使用该系统生成了超过一百万条训练轨迹,并训练了一台具有双臂的实体机器人来执行特定任务。结果令人瞩目。当机器人使用系统自动从图像中重建的物体进行训练时,其表现与使用由人类专家精心手工制作的物体进行训练时一样出色,在某些情况下甚至更好。例如,在拿起瓶子的任务中,使用新系统的资产时,成功率从 40% 跳升到了 80%。此外,当机器人是在多种“表亲”场景而非单一精确房间副本中进行训练时,它在处理新情况时表现得更好。在一次涉及拿起眼镜盒的测试中,接受单一精确场景训练的机器人完全失败了,而接受了多样化“表亲”场景训练的机器人则成功了 55%。
研究人员还验证了计算机对抓取物体位置的自动猜测是否准确。他们将系统建议的抓取点与一组由人类仔细标记的点进行了对比。计算机的建议略好一些,在模拟中的成功率为 76%,而人类标记的点为 72%。这证明了该系统可以用快速、自动化的方式取代缓慢的手动标注过程,且可靠性不遑多让。通过将“将现实观察转化为模拟资产的能力”与“生成多样化训练场景的能力”相结合,RoboCousin 提供了一条切实可行的路径。它表明,机器人学习的未来并不需要工程师手动构建每一个新物体,而是依赖于能够瞬间理解并适应我们所生活的混乱且多样化世界的系统。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。