✨ 要点🔬 技术摘要
想象一下,试图教一个机器人如何拿起咖啡杯。在过去,工程师必须编写数千行代码,测量咖啡杯的精确形状,并用激光精度校准机器人的眼睛。这就像是通过给一个人一本关于轮胎压力和空气动力学的说明书来教他骑自行车,而不是直接让他跳上去摇摇晃晃地练习。这使得机器人非常擅长工厂工作,但在处理我们家中混乱、不可预测的世界时却表现得很糟糕。
最近,科学家们发现了一种更好的方法:“从演示中学习”(Learning from Demonstration)。与其编写每一项动作的代码,不如让一个人向机器人展示如何操作,然后机器人通过观察进行学习。但问题在于:让人类去物理引导机器人的手臂或使用摇杆控制它,既缓慢、枯燥又难以规模化。如果机器人能自学呢?如果它只需看一眼物体,猜出抓取位置,意识到自己稍微偏了一点,然后通过不断练习修正自己的错误,直到成功为止呢?这就是“自监督学习”(Self-Supervised Learning)的前沿领域,在这里,机器人既是学生又是老师,无需人类牵手,就能自行生成练习题。
本文介绍了一种巧妙的新方法,机器人正是以此方式运作的。研究人员构建了一个系统,其中的机器人配备了一个腕部摄像头,能够自动创建自己的“演示”。机器人不再需要人类展示如何抓取物体,而是从一个随机位置开始,观察物体,然后移动到完美的抓取位置。它将这次移动记录为一个教训:“当我以这种 方式看到物体时,我需要向那个 方向移动才能到达目标。”通过在不同物体周围重复这一过程数千次,机器人建立了一个庞大的“图像到动作”教训库,其中没有任何人类标签或复杂的相机校准。
团队通过两种方式测试了这个想法。首先,他们在名为 Isaac Sim 的高科技视频游戏模拟器中运行了它。他们教机器人粗略接近物体,然后微调其位置。结果令人期待:机器人的最终瞄准变得更加精准。在模拟中,机器人的最终落点“偏差”(即距离完美位置有多远)从 9.69 毫米缩小到了仅 5.38 毫米。这就像是从投掷飞镖落在大致区域,进化到了击中红心。
接下来,他们将该系统转移到现实世界中,使用一台配备了夹爪和标准 USB 摄像头的 UR5e 机械臂。他们没有使用任何特殊的尺子或激光导引来校准摄像头;机器人只是通过它拍摄的照片进行学习。他们在三种具有不同形状和纹理的物理物体上进行了测试。机器人在不旋转物体的情况下尝试抓取,其中一个物体的成功率为 66.6%,另一个为 63.6%。当他们加入了一个变化——即旋转物体,让机器人必须从新的角度识别它们时,成功率有所下降(分别降至 36.4% 和 55.5%),但机器人仍然有时能成功抓取。
论文指出,虽然这种自教方法在平整表面上让机器人靠近并精细调整瞄准方面效果良好,但在预测物体深度(深度预测)方面仍有些吃力,并且在物体被奇怪旋转时会感到困惑。然而,核心理念是成立的:机器人确实可以生成自己的训练数据来学习视觉操控,从而跳过对昂贵人类教师或完美实验室环境的需求。这是迈向未来的一步——未来的机器人可以仅仅观察杂乱的桌面,弄清楚如何抓起杯子,并通过自身的错误进行学习,而无需人类为其编写规则。
技术摘要:基于自动生成演示数据的自监督视觉机器人操控
问题陈述 在非结构化或动态环境中,机器人操控仍然具有挑战性,因为这依赖于特定对象的编程、人工数据标注以及经过校准的感知流水线。虽然从演示中学习(Learning from Demonstration, LfD)提供了一种直接的替代方案,但传统方法通常依赖于耗时的人类遥操作或运动教导。此外,许多现有的视觉操控系统需要显式的相机-机器人外参标定,这增加了部署的复杂性。本文旨在解决一种能够自动化演示收集、消除人工标注并无需显式标定、同时保持现实世界鲁棒性的方法。
方法论 所提出的框架是一个构建在 ROS 2 之上的自监督流水线,并在 Isaac Sim 和物理 UR5e 协作机器人上进行了验证。其核心方法是让机器人在目标位姿 (P 0 P_0 P 0 ) 周围自动生成演示,以直接从腕部安装的单目 RGB 图像中学习相对位姿修正。
自动数据生成: 不同于人类遥操作,一个“机器人指挥官”(Robot Commander)节点使机器人围绕参考位姿进行预定义的轨迹运动。对于捕获的每一帧 RGB 图像,系统使用 tf2 计算返回目标位姿 (P 0 P_0 P 0 ) 所需的相对变换。这在无需人工标注或显式相机标定的情况下,创建了带标签的“图像-位姿”对。
数据集复杂度: 针对三种具有不同几何形状的物理对象生成了独立的数据集。数据采集利用了四种轨迹族来逐步增加难度:
2-DOF(平面): 在 x-y 平面上进行之字形运动。
3-DOF(平面 + 旋转): 平面运动结合平面内旋转。
3-DOF(圆锥): 垂直位移结合平面位置,用于粗略接近。
4-DOF(圆锥 + 旋转): 垂直位移结合平面内旋转。
视觉策略学习: 使用卷积神经网络(遵循 Johns [1] 的架构)进行训练,通过单帧 RGB 观测值回归相对位姿修正(包含 3 个平移值和 1 个 4 分量四元数)。损失函数结合了平移和旋转的均方误差(MSE),并对平移准确度进行了加权(L = M S E t r a n s + 0.01 ⋅ M S E r o t L = MSE_{trans} + 0.01 \cdot MSE_{rot} L = M S E t r an s + 0.01 ⋅ M S E r o t )。
由粗到精的控制策略: 在执行过程中,系统采用两阶段控制器:
粗略接近(Coarse Approach): 使用基于圆锥型(3D)数据训练的模型,从不同高度接近物体。
平面精细化(Planar Refinement): 使用基于平面数据训练的模型,在 x-y 平面上进行最终对齐微调。
主要贡献 本文概述了四个主要贡献:
自监督数据收集: 一种机器人无需人工干预或手动标注,即可自动生成演示类“图像-位姿”对的方法。
免标定视觉策略: 一种学习模型,能够从单目 RGB 观测中预测相对位姿修正,且无需显式的相机-机器人外参标定。
由粗到精的控制: 一种将 3D 接近过程与平面精细化过程解耦的策略,提高了闭环执行中的最终对齐精度。
现实世界验证: 在配备夹爪和单目相机的 UR5e 机器人上进行了全面的评估,展示了在不同外观的多个物理对象上的性能。
结果 该框架在仿真环境和真实硬件上使用三种不同的物体进行了评估。
仿真实验: “由粗到精”策略成功降低了最终的平面离散度。最终位置的包围圆半径从粗略阶段的 9.69 mm 降低到了精细化阶段的 5.38 mm 。然而,深度预测仍具挑战性,3D 球体半径仅从 33.39 mm 降至 31.55 mm,且部分轨迹表现出高度估计不稳定的情况。
现实世界实验: 系统进行了端到端的抓取尝试。成功率随物体和条件而变化:
无物体旋转时: 物体 1 的成功率为 66.6% ,物体 2 为 63.6% 。物体 3 的成功率较低,为 35.2% 。
有物体旋转时: 各项性能均有所下降。物体 1 下降至 36.4% ,物体 2 保持最高水平为 55.5% ,物体 3 则降至 25.0% 。
结果表明,虽然系统具有一定的鲁棒性,但其性能依赖于物体,并且当物体的方向显著偏离训练分布时,性能会发生退化。
意义与主张 作者声称,自动生成的演示可以支持实际的视觉操控,且仅需极少的设置工作,有效地消除了对手动标注和显式标定的需求。这项工作证明了自监督演示生成可以从模拟或低维环境扩展到现实世界的视觉操控,并实现闭环抓取验证。
然而,论文对其局限性保持了谦逊的态度。作者承认该方法对深度预测、物体几何形状和物体旋转仍然较为敏感。作者总结道,虽然该方法对于实际操控是可行的,但未来的工作必须解决深度估计方面的挑战(可能通过 RGB-D 或立体视觉感知),并提高在不同物体方向下的泛化能力。本文并不声称解决了所有的泛化问题,而是展示了一个能够减少视觉操控任务设置工程量的高效功能性流水线。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。