← 最新论文
⚡ electrical engineering

From Perception to Assistance: Open-Vocabulary Shared Autonomy for Robotic Manipulation

本文提出了一种用于机器人操作的开放词汇共享自主框架,该框架结合了无需穿戴式设备的姿态控制、视觉-语言目标定位以及 GPU 加速的模型预测控制,旨在协助操作员在杂乱的工业环境中实现精确且无碰撞的抓取。

原作者: Murilo Vinicius da Silva, Ricardo V. Godoy, Juliano Negri, Gustavo J. G. Lahr, Ranulfo Bezerra, Marcelo Becker

发布于 2026-07-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Murilo Vinicius da Silva, Ricardo V. Godoy, Juliano Negri, Gustavo J. G. Lahr, Ranulfo Bezerra, Marcelo Becker

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你戴着厚厚的冬手套,站在一个摇晃的梯子上,隔着一层雾气腾腾的窗户,试图穿针引线。这大约就是远程操控一台巨型机械臂的感觉。这就是**遥操作(teleoperation)**的世界——人类操作员通过摄像头和操纵杆来引导机器。问题在于,我们的眼睛和大脑在通过屏幕判断深度感方面并不擅长,而且工业环境通常充满了管道、墙壁和其他容易发生碰撞的障碍物。

为了解决这个问题,科学家们开发了**共享自主(shared autonomy)**技术。你可以把它想象成机器人的“副驾驶”。人类不再是孤军奋战,机器人的计算机芯片会介入并提供帮助。它可能会轻轻地将机械臂转向远离墙壁的方向,或者将其推向目标,但方向盘仍然掌握在人类手中。这篇论文深入探讨了一种更智能的新型“副驾驶”系统,专门为能够四处走动的机器人(如四足机器狗)以及在杂乱的现实工厂中执行精细任务而设计。


机器狗的“智能副驾驶”

认识一下这位机器人:它是一个带有长而灵活机械臂的四足机器(类似于波士顿动力的 Spot),机械臂安装在它的背部。它的任务是什么?走进一个杂乱的工业现场,找到特定的阀门或工具,然后将其转动或拿起。挑战在于?操作员离得很远,通过一个会让深度感知变得困难的摄像头画面进行观察。如果操作员试图转动阀门,由于看不清精确距离,他们可能会不小心让机械臂撞到附近的管道上。

这篇论文介绍了一个系统,它就像是机器人手臂的一个得力且隐形的引导者。它结合了三种“超能力”:无需标记的视觉识别理解语言以及柔性转向

1. 无需手套,无需校准,只需是你

通常,要用身体控制机器人,你需要穿着带有传感器的特殊套装,或者站在一个需要根据你的身高进行校准的摄像头前。这个新系统说:“不用了。”它使用标准的 3D 摄像头(RGB-D)来观察操作员的自然动作。

想象一下,摄像头是一个观察入微的朋友,它注视着你的肩膀、臀部和手腕。它会实时构建你的身体心理地图。如果你把右手向前移动,机器人的手臂也会向前移动;如果你转动手腕,机器人的夹持器也会随之旋转。该系统甚至能即时计算出你的手臂长度,从而知道如何精确缩放你的动作以匹配机器人的尺寸。无需设置,无需标记,只有你与机器人同步律动。

2. “嘿,机器人,去抓那个轮式阀门”

在过去,告诉机器人要抓取什么非常困难。你必须指向某个特定物体或使用代码。这个系统允许你使用自然语言。操作员只需说(或输入):“轮式阀门”。

奇迹就在这里发生:机器人使用一种“视觉-语言模型”(可以理解为一个能同时阅读和观察的机器人大脑)来观察摄像画面并寻找“轮式阀门”。一旦它发现了目标,它不仅仅是说“我看到了”,它还会创建一个精确的空间 3D 目标点,就像一个数字靶心。更棒的是,即使操作员的视野被遮挡,它也能利用机身上的其他摄像头持续追踪该阀门,确保不会丢失目标。

3. 隐形的磁场

这是这篇论文最酷的技巧。当机械臂靠近目标时,一个隐形的“势场”(类似于一种温柔的磁力)就会启动。

想象你在开车驶向停车位。你在驾驶,但有一股轻柔的风正轻轻地将你的车推向停车位的中心,帮助你完美停车。这就是该系统所做的:

  • 你仍然掌控全局: 如果你想向左移动,机器人就会向左移动。系统永远不会夺走你的控制权。
  • 帮助是微妙的: 当你进入距离目标 0.4 米(约 1.3 英尺)范围内时,系统会将你的指令轻轻地向“轮式阀门”的正中心修正。它能纠正因摄像头画面模糊而产生的微小误差。
  • 结果: 你可以进行粗略瞄准,而机器人的“副驾驶”会平滑最终的接近过程,确保夹持器精准地落在需要的位置。

4. “防撞”护盾

在机器人移动的过程中,它会利用自身的摄像头不断构建房间的 3D 地图。它清楚地知道墙壁、管道和交通锥在哪里。论文通过让操作员故意尝试驱动机械臂撞向一个交通锥来测试这一点。

结果如何?操作员的指令直接冲向了交通锥,但机器人的手臂在距离障碍物 18 厘米(约 7 英寸)处停住了。系统表现得像一个力场,在遵循操作员大致方向的同时,使路径绕过了障碍物。这证明了即使人类犯错,机器人的安全大脑也能防止碰撞。

5. “自动驾驶”按钮

有时,操作员可能厌倦了手动转向。一旦他们找到了目标并确认,只需举起两根手指即可切换到自主模式。随后,机器人将完全接管工作,利用相同的安全规则和 3D 目标来独立完成任务(例如抓取阀门)。如果操作员想重新夺回控制权,只需再次举起一根手指即可。

他们发现了什么?

研究人员在一个杂乱的工业环境中,使用一台真实的机器人测试了这个系统,主要完成了两个任务:转动一个大型工业阀门和拿起一把电钻。

  • “全队协作”获胜: 当他们使用整个系统(语言目标 + 柔性转向 + 防撞护盾)时,机器人在所有测试中取得了 100% 的成功率(两个任务各 5 次尝试全部成功)。
  • “半队协作”失败: 当他们移除防撞护盾时,机器人撞到了障碍物;当他们移除柔性转向时,机器人因为摄像头视角不够精确而错过了目标。这表明这两个部分都是必要的;它们各司其职,解决了不同的问题。
  • 数据表现: 该系统非常精准。机器人的手臂跟随人类手部的平均误差仅为 59 毫米(约 2.3 英寸)。在碰撞测试中,操作员试图将手臂推入障碍物 6 厘米,但机器人始终将手臂保持在距离危险源至少 18 厘米 的位置。

核心结论

这篇论文并不声称已经解决了机器人领域的所有问题。它展示了通过将简单的、无需标记的摄像头界面与一个能够理解语言并能温柔纠错的智能“副驾驶”相结合,我们可以让机器人在杂乱的现实工厂中表现得更好。它不是一个完全独立思考的机器人,也不是一个只会盲目听令的机器人。这是一种伙伴关系:人类提供意图(“去拿那个阀门”),而机器人处理那些关于不撞击障碍物和精准落位的复杂细节。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →