← 最新论文
🤖 machine learning

Bi-Manual Joint Camera Calibration and Scene Representation

本文介绍了 Bi-JCR,这是一个利用 3D 基础模型来实现双臂机器人摄像头的无标记联合标定,并直接从 RGB 图像构建统一且尺度一致的 3D 场景表示,从而促进下游双臂协调任务的框架。

原作者: Haozhan Tang, Tianyi Zhang, Matthew Johnson-Roberson, Weiming Zhi

发布于 2026-07-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Haozhan Tang, Tianyi Zhang, Matthew Johnson-Roberson, Weiming Zhi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下有两个机器人手臂,就像一对机械好朋友,正试图在桌子上协同工作。通常情况下,在它们能击掌或传递工具之前,它们需要准确知道自己的眼睛(摄像头)是如何安装在手上的,以及它们彼此之间的相对位置。传统上,获取这些信息是一项枯燥且繁琐的工作:你必须把一种特殊的棋盘格图案贴在墙上,移动机器人进行拍照,然后通过数学计算来确定角度。这就像是试图通过盯着一个额头上贴着尺子的镜子来学习跳舞一样。

这篇论文介绍了一种被称为 Bi-JCR(双臂联合标定与表示)的新技巧。Bi-JCR 不再使用那些烦人的棋盘格,而是让机器人直接观察摆满随机物品(如勺子、胶带卷、工具箱)的杂乱桌面,从而实现自主感知。

它是如何工作的:“神奇大脑”与拼图
其核心秘诀是一个“3D 基础模型”。你可以把它想象成一个超级聪明的、经过预训练的“大脑”,它见过数百万张图像,仅凭看平面照片就能猜出房间的 3D 形状。当机器人拍摄桌面照片时,这个大脑会构建出一个粗略的 3D 地图。但问题在于,这个大脑并不知道物体的真实尺寸(那把勺子是 5 英寸长还是 5 英尺长?),也不知道机器人的底座具体在哪里。

Bi-JCR 扮演着“侦探”的角色,负责将这些点连接起来。它提取机器人自身的运动日志(我们确切知道机器人手臂是如何移动的),并将这些日志与“神奇大脑”做出的“猜测”进行对比。通过解开一个巨大的数学谜题,它能同时确定三件事:

  1. 摄像头在手上的位置: 它将机器人的眼睛与手部对齐。
  2. 两个机器人的站位: 它计算出两个机器人底座之间的距离。
  3. 现实世界的比例尺: 它计算出一个“神奇数字”,将大脑模糊的 3D 猜测转化为真实的、具有度量比例的地图(这样勺子就是勺子,而不是巨人手中的勺子或微缩模型)。

论文强调的“并非答案”
作者非常明确地指出:他们没有使用棋盘格、AprilTags 或任何特殊的标记物。他们也没有依赖机器人拥有完美的深度传感器(如 LiDAR)或预先存在的物体 3D 模型。他们明确反对旧有的方法,即那种需要停止机器人、粘贴标记物,并分别对每个机械臂进行标定后再尝试将它们融合在一起的做法。他们的这种方法是在一次性完成所有工作,仅使用机器人自带的标准 RGB 摄像头。

他们有多确定?(证据)
团队不仅是凭空构想,还在现实世界中进行了测试。他们设置了两个真实的机械臂(AgileX Piper 6 自由度机械臂)并配备了廉价的 USB 网络摄像头。他们在三种不同的光照条件下,针对不同数量的物体(9 个或 10 个物品)进行了实验。

  • 标定精度: 他们将自己的方法与其他流行工具(如 COLMAP 和 Ray Diffusion)进行了对比。结果显示,Bi-JCR 的一致性更高。当每个机器人仅使用 4 张图像时,他们的法仍然有效,而其他方法往往无法找到解。即使在使用更多图像(最多 9 张)的情况下,他们的误差率依然保持在较低水平。例如,“旋转误差”(即角度偏差)在 4 张图像时约为 0.0769,在 9 张图像时降至 0.0612
  • 比例尺精度: 他们测量了真实的物体,如勺子、茶盖和电池。仅使用每台机器人 8 张图像时,重建的 3D 模型就极其精确。他们观察到的最大误差为 2.98%(针对一个摇杆),而中值误差仅为 1.48%。这意味着如果一个真实的勺子是 10 英寸,机器人的地图显示它大约是 10.15 英寸。
  • “精细化”步骤: 他们测试了运行“梯度下降”(一种数学微调过程)是否会有帮助。他们发现,当图像稀缺时(仅有 4 个视角),这一步效果显著,能大幅降低误差。但当拥有充足图像(8 个视角)时,额外的步骤帮助微乎其微。
  • 大脑的选择: 他们尝试了不同的“基础模型”(即神奇大脑)。他们发现名为 DUST3R 的模型表现最好,在几乎所有测试中都击败了 MASt3R 和 VGGT 等其他模型。

大结局:它们真的能干活吗?
最终的测试不仅仅是数字,而是行动。一旦机器人完成了标定,它们就会利用 3D 地图执行实际任务。

  • 协同抓取: 它们共同抬起了沉重且笨拙的物体,如工具箱和电池组。
  • 交接物品: 它们成功地在两个机器人之间传递了较小的物品(如扳手、勺子、胶带卷)。

论文得出结论:由于机器人准确掌握了自身位置和物体大小,它们可以无需人类帮助或特殊标记物即可完美协作。作者建议,未来可以利用 AI 大脑提供的“置信度”评分,来指导机器人拍摄哪些新的照片以进一步优化地图,但目前,他们已经证明了这种无标记、联合标定的方法在现实世界中是行之有效的。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →