← 最新论文
💻 computer science

Hydra: Marker-Free RGB-D Hand-Eye Calibration

本文介绍了 Hydra,一种利用基于李代数的迭代最近点算法的无标记 RGB-D 手眼标定方法,该方法与现有基准相比实现了显著更高的收敛率、更快的处理速度和更高的任务空间精度,同时提供了开源代码和 ROS 2 集成。

原作者: Martin Huber, Huanyu Tian, Christopher E. Mower, Lucas-Raphael Müller, Sébastien Ourselin, Christos Bergeles, Tom Vercauteren

发布于 2026-09-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Martin Huber, Huanyu Tian, Christopher E. Mower, Lucas-Raphael Müller, Sébastien Ourselin, Christos Bergeles, Tom Vercauteren

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在科幻小说中,能够用手和眼睛活动的机器人是一个经典元素,但在现实世界中,让机器具备感知其手臂在空间中位置的能力,是一个出人意心地复杂的工程难题。这一挑战被称为“手眼标定”(hand-eye calibration),其过程是教会机器人如何将其摄像机获取的数据转化为其自身关节的语言。如果没有这种转换,机器人可能会清晰地看到一个物体,却抓向错误的位置,或者无法理解自身的运动如何改变了视觉画面。几十年来,解决这一问题的标准方案一直依赖于物理标记——即放置在机器人或环境中的特殊图案或贴纸,以便摄像机能够轻松识别。虽然这种方法很有效,但这些标记非常脆弱;如果它们被遮挡、损坏,或者仅仅是不在摄像机的视野范围内,标定就会失败。这种局限性使得在杂乱、不可预测的环境中部署机器人变得困难,因为在这些环境中无法保证始终能使用这些标记。

现在,一组研究人员开发出了一种无需任何标记即可解决此问题的新方法。他们将这种方法称为 Hydra,它允许机器人仅通过观察自己的手臂来进行自我标定。该系统不再依赖特殊的贴纸,而是利用摄像机捕捉机器人金属连杆和关节的形状,然后将该视觉形状与机器人的数字模型进行匹配。研究人员在三种不同类型的机械臂和两种不同的摄像机上测试了这种方法,发现该系统能够在几乎所有情况下成功实现机器人视觉与运动的对齐。值得注意的是,这种新方法仅需三个随机的机械臂位置即可完成,其精度足以媲美使用标记的方法,且速度比其他无标记尝试快了两个数量级。

Hydra 的核心思想是将机器人的手臂视为一个单一的、实心的 3D 物体,而不是一系列移动部件,并将其与摄像机捕捉到的点云进行匹配。过去,研究人员试图通过训练复杂的计算机程序来识别机器人上的特定点,或者使用沉重的计算技术来模拟光线如何在机器人表面反射。这些旧方法通常运行缓慢,且容易陷入局部误差,这意味着机器人会认为自己已经完成了标定,但实际上却存在偏差。Hydra 团队采取了一条不同的路径。他们使用一种现代图像分析工具,从视频流中分离出机器人并将其从背景中提取出来,从而创建一个干净的仅包含手臂的 3D 地图。然后,他们将这个地图与机器人已知的数字蓝图进行对比,通过相互滑动这两个形状,直到它们完美契合。

为了确保这种拟合过程具有鲁棒性(稳健性),研究人员制定了一种侧重于机器人表面而非仅仅是单个点的数学方法。想象一下尝试将两个拼图块组合在一起:如果拼图块略有磨损,仅仅观察角部可能会产生误导,但观察平坦边缘如何相互滑动则能提供更稳定的连接。团队的方法利用这种表面对齐的原理来寻找正确的位置。他们还建立了一种安全机制,可以忽略掉干扰数据点,例如阴影或反射,这些因素经常会让其他系统产生困惑。这使得机器人即使在摄像机视角不理想或处于杂乱空间时,也能找到正确的对齐位置。

实验结果令人瞩目。在对三种不同机械臂(一个大型医疗机器人、一个紧凑型桌面机械臂和一个轻型工业模型)进行测试时,该系统仅使用三个随机位置就在约 90% 的尝试中成功完成了标定。在速度方面,整个过程耗时不到一秒钟,这比其他无标记方法(可能需要超过两分钟)要快得多。标定的精度也令人印象深刻,机器人的手部落点与现实世界中的目标点误差在 5 毫米以内。相比于误差通常在 7 毫米或以上的旧有无标记技术,这是一个显著的进步。虽然使用物理标记的方法有时可能更精确一些,但这种新方法完全消除了对标记的需求,从而为那些不想在设备上粘贴贴纸的用户简化了流程。

这项工作最实用的特点之一是它不要求机器人属于特定的品牌或型号。由于该系统依赖于机器人的通用形状,而非其关节的预设知识,因此它可以应用于几乎任何串联操作器(serial manipulator,这是对具有一系列连接段的常见机械臂的专业术语)。研究人员向公众开放了他们的软件和实验数据,允许其他工程师进行测试和改进。他们还将该系统集成到了一个标准的机器人软件平台中,这意味着开发者现在可以以极小的代价将这一功能应用到自己的机器人中。

该研究确实存在一些局限性。目前该系统需要一台能够测量深度的摄像机,这意味着它无法仅靠标准的 2D 摄像机工作。此外,它仍依赖于人类在初始视频帧中短暂地指出机器人,尽管这种交互非常微小。再者,该方法是在静态环境下测试的,即在标定期间摄像机和机器人都不移动,因此它目前还不适用于时刻处于运动状态的机器人。尽管存在这些约束,这项工作仍代表了使机器人更加自主和易于部署的重要一步。通过消除对物理标记的依赖并大幅缩短设置时间,这种新方法让灵活、自标定机器人的愿景离现实更近了一步。研究人员表示,未来的工作将集中在如何将该方法应用于移动设置,并进一步提高精度以匹配最优秀的基于标记系统的水平。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →