← 最新论文
💻 computer science

Self Supervised Learning from Automatically Generated Demonstrations for Visual Robotic Manipulation

本文提出了一种自监督视觉操控方法,该方法利用在仿真中自动生成的演示来训练卷积网络,以实现从腕部安装的 RGB 图像进行相对位姿校正,使 UR5e 机器人能够在模拟和真实环境中以更少的设置工作量并提高平面精度来实现成功的抓取。

原作者: Andres Rivas, Anselmo R. Cukla, Rodrigo S. Guerra, Bruna V. Guterres, Ricardo B. Grando

发布于 2026-08-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Andres Rivas, Anselmo R. Cukla, Rodrigo S. Guerra, Bruna V. Guterres, Ricardo B. Grando

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,试图教一个机器人如何拿起咖啡杯。在过去,工程师必须编写数千行代码,测量咖啡杯的精确形状,并用激光精度校准机器人的眼睛。这就像是通过给一个人一本关于轮胎压力和空气动力学的说明书来教他骑自行车,而不是直接让他跳上去摇摇晃晃地练习。这使得机器人非常擅长工厂工作,但在处理我们家中混乱、不可预测的世界时却表现得很糟糕。

最近,科学家们发现了一种更好的方法:“从演示中学习”(Learning from Demonstration)。与其编写每一项动作的代码,不如让一个人向机器人展示如何操作,然后机器人通过观察进行学习。但问题在于:让人类去物理引导机器人的手臂或使用摇杆控制它,既缓慢、枯燥又难以规模化。如果机器人能自学呢?如果它只需看一眼物体,猜出抓取位置,意识到自己稍微偏了一点,然后通过不断练习修正自己的错误,直到成功为止呢?这就是“自监督学习”(Self-Supervised Learning)的前沿领域,在这里,机器人既是学生又是老师,无需人类牵手,就能自行生成练习题。

本文介绍了一种巧妙的新方法,机器人正是以此方式运作的。研究人员构建了一个系统,其中的机器人配备了一个腕部摄像头,能够自动创建自己的“演示”。机器人不再需要人类展示如何抓取物体,而是从一个随机位置开始,观察物体,然后移动到完美的抓取位置。它将这次移动记录为一个教训:“当我以这种方式看到物体时,我需要向那个方向移动才能到达目标。”通过在不同物体周围重复这一过程数千次,机器人建立了一个庞大的“图像到动作”教训库,其中没有任何人类标签或复杂的相机校准。

团队通过两种方式测试了这个想法。首先,他们在名为 Isaac Sim 的高科技视频游戏模拟器中运行了它。他们教机器人粗略接近物体,然后微调其位置。结果令人期待:机器人的最终瞄准变得更加精准。在模拟中,机器人的最终落点“偏差”(即距离完美位置有多远)从 9.69 毫米缩小到了仅 5.38 毫米。这就像是从投掷飞镖落在大致区域,进化到了击中红心。

接下来,他们将该系统转移到现实世界中,使用一台配备了夹爪和标准 USB 摄像头的 UR5e 机械臂。他们没有使用任何特殊的尺子或激光导引来校准摄像头;机器人只是通过它拍摄的照片进行学习。他们在三种具有不同形状和纹理的物理物体上进行了测试。机器人在不旋转物体的情况下尝试抓取,其中一个物体的成功率为 66.6%,另一个为 63.6%。当他们加入了一个变化——即旋转物体,让机器人必须从新的角度识别它们时,成功率有所下降(分别降至 36.4% 和 55.5%),但机器人仍然有时能成功抓取。

论文指出,虽然这种自教方法在平整表面上让机器人靠近并精细调整瞄准方面效果良好,但在预测物体深度(深度预测)方面仍有些吃力,并且在物体被奇怪旋转时会感到困惑。然而,核心理念是成立的:机器人确实可以生成自己的训练数据来学习视觉操控,从而跳过对昂贵人类教师或完美实验室环境的需求。这是迈向未来的一步——未来的机器人可以仅仅观察杂乱的桌面,弄清楚如何抓起杯子,并通过自身的错误进行学习,而无需人类为其编写规则。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →