机器人已经变得能够非常熟练地在世界中移动,这种能力很大程度上建立在海量的视频数据基础之上。多年来,研究人员一直教机器通过观察成千上万个简单动作的示例来学习,比如在厨房或客厅里拿起杯子或堆叠积木。这些日常任务是具有容错性的;如果机器人抓取失败,它通常可以尝试重新进行而不会产生后果。然而,工业世界运行在更为严格的规则之下。在工厂里,组装机器零件通常要求机器人进行极高精度的推、滑和扭转,哪怕只有零点几毫米的误差都可能导致整个过程卡顿。在这些环境中取得成功,不仅取决于“看到”物体,还取决于“感觉到”金属与金属之间的细微阻力、橡胶密封圈的轻微形变,或是齿轮卡入到位的那一瞬间。长期以来,用于训练机器人的可用数据仅仅无法捕捉到这些细腻且带有力量感的交互,从而在机器人实验室中所能做到的工作与它们在真实工厂中所需要做的工作之间留下了鸿隙。
为了弥补这一差距,一个研究小组推出了一个名为 PRISM 的新数据集,专门旨在教机器人如何应对工业组装中混乱且高压的现实情况。研究人员收集了超过 5,000 条详细记录,记录了人类操作员执行复杂任务的过程,例如插接精密的电子元件、在移动的传送带上分拣物品以及包装精密工具。与以往侧重于短促、简单动作的数据集不同,这些记录捕捉了长序列的工作过程,在这些过程中,机器人必须与环境保持持续接触。该数据蕴含着丰富的信息,不仅记录了机器人通过多个摄像头看到的视觉画面,还记录了它施加的力量、关节的扭矩,甚至通过专门传感器感知到的表面纹理。通过同步所有这些不同的信号,该数据集提供了一个完整的图景,展示了执行一项既需要稳健手感又需要敏锐触觉的任务时是什么感觉。
该团队通过为几种不同类型的机器人配备先进传感器,并让八位志愿者使用三种截然不同的方法来执行任务,构建了这一资源:穿着模仿人类动作的机器人外骨骼、使用手持追踪器,或通过虚拟现实头显控制机器人。这种多样性是刻意为之,旨在让研究人员观察不同的机器人引导方式如何影响最终数据的质量。他们发现,控制方法具有显著影响。当人类使用提供与机器关节直接物理连接的外骨骼来引导机器人时,由此产生的数据使机器人能够更成功地完成任务且误差更少。相比之下,通过虚拟现实(即操作员通过平面屏幕观察场景)收集的数据产生的结果较不可靠,这可能是因为操作者缺乏引导机器人进行必要精准操作所需的深度感知和物理反馈。
为了测试这一新数据集的价值,研究人员在数据上训练了标准的机器人学习程序,然后将它们发送到真实的机器人上执行相同的组装任务。结果显示,虽然机器人随着练习的增加有所进步,但在处理工作中难度最高的部分时仍然感到吃力。当机器人在专注于特定任务之前,先在大量数据上进行训练并获得对许多不同任务的广泛概览时,它们的鲁棒性变得更强。它们更擅长从微小的错误(如轻微的对准偏差)中恢复,而不是彻底失败。然而,实验也揭示了一个残酷的事实:即使拥有高质量的数据,目前的学习方法仍然难以处理在传送带上移动物体时所需的瞬时时机,或是在插入零件而不使其损坏时所需的精确力度。机器人可以观察世界并感知接触,但它们仍然缺乏人类工人经过多年经验积累所形成的深层、直觉性的物理理解。
这项工作表明,虽然大型数据集是一个强大的工具,但它们并不是解决每一个工业挑战的万灵药。PRISM 数据集证明,捕捉任务的全感官体验——视觉、触觉和力量——对于教机器人处理严苛公差至关重要。它还强调了我们教导这些机器的方式与数据本身同样重要;在训练期间,人类与机器人之间的物理连接可以决定机器人是学会了适应,还是仅仅在机械地模仿其无法真正理解的动作。随着该领域向前发展,这个数据集提供了一个衡量进展的现实基准,表明通往真正多功能工业机器人的道路不仅需要更多的数据,还需要更好的方法来解读组装过程中那复杂且充满力量感的舞步。
技术摘要:PRISM 数据集
问题陈述
机器人学习的最新进展是由在日常环境(如家庭和实验室)中收集的大规模数据集驱动的。然而,这些现有的资源主要侧重于短时程、低接触的任务,例如取放(pick-and-place)。因此,它们未能捕捉到工业组装的特定需求,而工业组装要求:
- 精密控制与紧凑的公差。
- 持续接触与复杂的交互动力学。
- 力/力矩及触觉调节,因为仅靠视觉传感通常不足以检测微小的对准偏差、摩擦粘滞或插入卡顿。
现有数据集缺乏多具身平台、同步多模态感知、工业接触密集型程序以及多样化遥操作接口的结合,而这些对于学习能够跨不同机器人本体、感知模态和接触条件进行泛化的策略(尤其是在类生产设置中)至关重要。
方法论:PRISM 数据集
为了填补这些空白,作者推出了 PRISM(具有多模态感知的精密且接触密集型现实工业技能数据集)。该数据集围绕三个核心原则构建:更高的采集标准、更广泛的多模态覆盖以及大规模的多样性。
1. 数据采集与规模
- 容量: 该数据集包含超过 5,000 条遥操作轨迹(与人类演示配对),总计超过 45 小时 的交互。
- 任务: 涵盖 25+ 项操纵任务,包括电子元件插拔、汽车材料分拣、传送带分拣、包装以及轴承安装。这些任务涵盖了代表真实工业过程的多样化机械约束(例如 NIST 组装任务板的操作)。
- 多样性: 数据采集自 3 个机器人平台(Franka、Realman、LEJU)以及 3 种不同的末端执行器类型(3D 打印夹持器、视触觉夹持器、视触觉灵巧手)。
- 遥操作: 演示通过三种互补的接口进行收集,以改变人类控制风格:
- 外骨骼(Exoskeleton): 一个双臂 Realman 机器人系统。
- 追踪器(Tracker): 配备模块化末端执行器的 Franka Emika Panda 机械臂。
- 虚拟现实(VR): 通过沉浸式 VR 控制的 LEJU 上肢类人机器人。
- 参与者: 8 名志愿者进行了演示,引入了运动风格、接触时机和纠错行为的自然变化。同时还加入了有意的人为扰动,以提高鲁棒性。
2. 多模态感知与同步
PRISM 提供时间对齐的高保真多模态观测,这对于接触密集型学习至关重要:
- 视觉: 同步的多视图 RGB-D 相机(15 Hz)。
- 本体感知: 机器人关节角度、关节力矩、夹持器笛卡尔位姿及夹持器宽度(15 Hz)。
- 力/力矩: 6 自由度末端执行器力/力矩扳手测量值(100 Hz)。
- 触觉: 部分序列中包含来自触觉传感器/末端执行器的视触觉图像(30 Hz),用于捕捉局部接触模式、形变和滑动线索。
- 处理: 所有数据流均校准至统一坐标系,并保留原始时间戳,以便在训练期间进行最近邻匹配或插值。
3. 组合结构
数据集的组织方式旨在支持多阶段的学习。复杂的工业程序被视为可重用的子任务的组合,允许模型在细粒度技能上进行训练,或在长时程工作流上进行评估。
实验评估
作者将 PRISM 作为接触密集型工业操纵的基准,并使用了三种代表性的行为克隆基线模型:ACT、Diffusion Policy (DP) 和 π0。
实验设置
- 平台: 实验在配备 3D 打印平行指夹持器的双臂 Realman 机器人上进行。
- 任务: 选择了三个代表性任务:电子元件插拔、卡尺包装和传送带分拣。
- 协议: 模型在完整的 5,000 条轨迹数据集上进行预训练,然后在特定任务的子集(100 vs 200 次演示)上进行微调。在真实机器人上重复进行 20 次评估。
关键结果
- 数据规模的影响: 将特定任务的演示次数从 100 次增加到 200 次,带来了持续的性能提升,尤其是在静态、接触密集型任务(如插拔)中。这表明接触密集型操纵是数据密集型的,需要更大的数据集来覆盖初始条件的变化和接触转换。
- 预训练的益处: 在完整数据集上进行预训练并在特定任务子集上进行微调的模型,其表现显著优于在小型特定任务数据集上从头开始训练的模型。预训练提供了稳健的多模态特征提取和接触密集型稳定性的先验知识,减少了灾难性失败并提高了从轻微对准偏差中恢复的能力。
- 遥操作模态的影响: 通过 外骨骼 遥操作收集数据的策略,比通过 VR 数据训练的策略具有更高的成功率和效率。作者将其归因于外骨骼装置提供的优越深度/空间线索和运动学对齐,相比之下,VR 提供的是 2D 渲染视图。
- 当前局限性: 尽管有所改进,但整体性能仍然受限,特别是在动态操纵(传送带分拣)和精确力觉感知操作方面。失败通常源于不完美的时机把握、延迟抓取下的状态估计问题,以及在紧凑公差下可靠调节接触力的能力不足。
意义与贡献
论文声称了以下贡献:
- 工业真实性: PRISM 为高精度工业约束下的多模态感知与控制提供了一个真实的基准,弥合了通用数据集与工业需求之间的差距。
- 高保真多模态数据: 它是首个专门针对接触密集型工业操作,结合了多视图 RGB-D、六轴力/力矩、机器人状态和触觉信号的大规模、时间对齐的数据集。
- 面向泛化的可扩展性: 凭借跨多个机器人和遥操作方法的 5,000 多条轨迹,PRISM 使系统性地训练和评估旨在泛化到不同工业操作家族的策略成为可能。
作者总结道,虽然 PRISM 促进了进展,但目前的模仿学习策略在动态状态推理和紧凑公差场景下的可靠力觉调节方面仍面临挑战。该数据集为未来研究更强的多模态融合、交互状态估计以及闭环接触调节奠定了基础。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。