← 最新论文
💻 computer science

VE2VF: Vision-Enabled to Vision-Free Distillation via Real-world Reinforcement Learning for Robust Contact-Rich Manipulation

本文提出了 VE2VF,这是一种人机回环强化学习框架,它将从具备视觉能力的教师模型中提炼出的知识蒸馏至一个完全在真实世界中训练的、鲁棒的无视觉学生策略,从而在不依赖域随机化或数据增强的情况下,在富含接触的操作任务中实现高成功率和强泛化能力。

原作者: Victor Kowalski, Chengxi Li, Dongheui Lee

发布于 2026-05-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Victor Kowalski, Chengxi Li, Dongheui Lee

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下教机器人组装精密部件,比如将 USB 线缆插入端口,或将齿轮拧入到位。这是一项棘手的工作,因为它涉及“接触丰富”的操作——这意味着机器人必须通过触觉在狭窄空间内摸索,应对摩擦力、碰撞以及完美对齐的需求。

本文介绍了一种名为VE2VF(视觉赋能至无视觉)的新方法,用于教导机器人完成此类任务。以下是其工作原理的故事,采用简单的类比进行说明。

问题:过度依赖视力的机器人

传统上,要教会机器人这些技能,你可能会给它展示一段视频,或让它“看见”任务。这就像教学生开车时让他们透过挡风玻璃观察。这在课堂(或模拟环境)中效果极佳,但它存在一个缺陷:学生记住了风景。

如果你用摄像头训练机器人,它可能会学会:“当我看到左边有一面蓝墙时,我就向右转。”但如果你将机器人移到一面红墙的房间里,或者光线发生变化,机器人就会困惑并发生碰撞。它过度拟合了房间的外观,而非理解任务的物理原理。

解决方案:“导师 - 学生”辅导系统

作者提出了一种两步辅导系统来解决这个问题。这就像一位主厨在教导学徒。

步骤 1:视觉赋能的导师(主厨)
首先,他们利用人机回路强化学习训练一个“导师”机器人。

  • 工作原理:人类观察机器人。如果机器人即将犯错,人类会接管控制(就像驾驶教练踩下刹车),引导其走向成功。
  • 导师的工具:这位导师拥有眼睛(摄像头)和触觉(测量位置、速度和力的传感器)。
  • 结果:因为导师有眼睛,它学习得非常快。它能看见目标,调整抓握,并找出棘手角度。通过大约 40 分钟的现实世界实践,它就能成为该任务的专家。

步骤 2:无视觉的学生(学徒)
现在到了神奇的一步。他们希望机器人能在不依赖视力的情况下完成任务,因为眼睛容易被光线变化或新背景所欺骗。

  • 知识蒸馏:他们将专家“导师”的“知识”注入到“学生”机器人中。
  • 关键点:学生机器人没有摄像头。它只有能感知机器人位置、速度以及施力大小的传感器(就像一位蒙眼的专家)。
  • 课程:学生并非在盲目猜测;它是在模仿导师的决策。它学会了:“当我感受到这种特定的压力和这个特定的角度时,我应该这样移动我的手臂”,因为这就是导师所做的。

为什么这很重要

通常,当你剥夺机器人的视力时,它会变笨。但因为这位学生是从一位看见了解决方案的导师那里学习的,所以学生继承了任务的“直觉”,而不会被视觉风景所干扰。

  • 类比:想象一位能看着乐谱完美演奏乐曲的大师钢琴家(导师)。然后,他们教导一位蒙眼的学生(学生),让学生通过感受琴键和节奏来学习。学生学会了乐曲的肌肉记忆和感觉,而不仅仅是视觉音符。如果你将钢琴移到光线不同的另一个房间,蒙眼学生仍然能完美演奏,因为他们学会的是感觉,而非外观。

结果:快速、稳健且具适应性

该团队在标准装配板(NIST 基准测试)上测试了这种方法,涉及各种棘手任务,如插入齿轮、销钉和线缆。

  1. 速度:整个过程仅耗时约50 分钟的机器人实际运行时间。
  2. 成功率:最终机器人在许多不同任务中达到了95% 的成功率。
  3. 稳健性:当他们扰乱环境(改变光线、增加视觉杂乱或稍微移动目标)时,“视觉赋能”的机器人彻底失败。然而,“无视觉”的学生却能持续工作,因为它不会被这些变化所干扰。
  4. “滑脱”恢复:在一次测试中,机器人错过了 USB 端口并发生了滑脱。无视觉机器人没有惊慌;它利用其“触觉”感知到滑脱,进行调整并再次尝试,直到成功。这是一种它从导师那里习得,但保留在自己“盲眼”身体中的行为。

“微调”奖励

如果机器人遇到一个全新且从未见过的任务(例如某种特定类型的连接器),该系统可以进行快速的“复习课程”。

  • 他们为该特定任务训练一位新的导师(使用视觉)。
  • 他们迅速将该新知识蒸馏给学生。
  • 这使得他们能够在短短几分钟内,在最难的任务上达到100% 的成功率。

总结

本文提出了一种训练机器人成为复杂任务触觉探索专家的方法。通过使用一位“有视力”的导师快速学习,然后教导一位“盲眼”的学生依赖触觉和力觉,他们创造了一种训练快速、不会因房间变化而困惑,且在精密装配工作中表现卓越的机器人。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →