← 最新论文
💻 computer science

xperception -- Making Robotic Grasping Easier

xperception 是一个零样本 6D 位姿估计系统,它利用 CAD 模型和基础模型特征,在无需针对特定物体进行训练或数据标注的情况下,实现毫米级精度且鲁棒的机器人抓取,适用于高混合度、低产量的制造业。

原作者: Matteo Bortolon, Andrea Caraffa, Alice Fasoli, Fabio Poiesi

发布于 2026-07-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Matteo Bortolon, Andrea Caraffa, Alice Fasoli, Fabio Poiesi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下这样一个世界:机器人就像一群才华横溢但固执己见的厨师。它们可以以完美的速度切削一百万根完全相同的胡萝卜,但如果你递给它们一个从未见过的形状奇特的土豆,它们就会陷入僵局。为什么?因为它们的“眼睛”和“大脑”只接受过胡萝卜的训练。要教会它们认识土豆,你必须拍摄成千上万张照片,手动标注每一张照片,然后重新训练机器人的大脑——这个过程既漫长又昂贵。这就是当前工厂自动化领域的瓶颈:机器人擅长重复做同样的事情,但在应对新的、杂乱的或独特的物品时却表现得很糟糕。

为了解决这个问题,科学家们正在研究一种不需要从零开始学习的新型“视觉”。把它想象成一位读过宇宙中所有书籍的超级聪明图书管理员。如果你给这位图书管理员看一张新奇水果的照片,他们不需要花好几周时间去研究;他们能瞬间识别出来,因为他们已经理解了“水果”、“纹理”和“形状”这些通用概念。这篇论文深入探讨了一项名为 6D 位姿估计(6D pose estimation) 的技术,这是一种高级说法,指的是“精确确定一个物体在 3D 空间中的位置以及它的朝向”。其目标是让机器人能够瞬间抓取新物体,而无需经历漫长、枯燥的训练过程,从而让工厂能够灵活应对“高混合、低产量”的世界,即使其中的每一件物品都各不相同。


认识 xperception:阅读说明书而非照片的机器人

认识一下 xperception,这是由意大利 Fondazione Bruno Kessler 研究人员开发的一种新工具。把 xperception 想象成机器人的“即读”超能力。与其强迫机器人盯着成千上万张新物体的照片看以学习它的样子,xperception 说:“直接把蓝图给我。”

在过去,如果工厂想让机器人拿起一种新型螺丝,他们必须从各个角度拍摄数百张该螺丝的照片,进行标注,并训练神经网络。这就像是通过投掷成千上万次完全相同的球,来教一只狗去捡特定的球。xperception 颠覆了这种模式。它利用物体的 3D CAD 模型(工程师用于设计零件的数字蓝图),并将其与“基础模型”(一个已经理解视觉世界的庞大预训练 AI 大脑)相结合。

魔法是如何发生的呢?想象一下,你面前有一堆乱七八糟的玩具散落在地板上。传统的机器人可能会感到困惑。但 xperception 会观察这堆玩具,并利用其预训练的大脑,从视觉数据中提取点级特征(point-level features)。然后,它将这些特征与数字蓝图(CAD 模型)中对应的特征进行匹配,以执行点云配准(point cloud registration)。它不需要见过那个特定的玩具;它只需要蓝图以及将视觉点与模型几何形状对齐的能力。随后,它会计算 6D 位姿,这是一种高级说法,指它能算出玩具确切的位置(左、右、上、下、前、后)以及确切的倾斜角度(翻滚、俯仰、偏航)。这就像机器人突然为它看到的每一个物体都配备了 GPS 和指南针,能将位置精确到毫米级。

为什么这很重要:“随机拣选”问题

这项技术的真正考验是一个经典的工业噩梦,叫做“随机拣选(bin picking)”。想象一个装满零件的料箱,这些零件被随机倾倒在里面。它们堆叠在一起,遮挡了部分自身(遮挡现象),而且光照可能很奇怪。机器人需要伸手进去,抓起一个特定的零件,并准确知道如何握持它,以免掉落或撞到料箱壁。

研究人员在 Automatica 2025 贸易展上以一种非常酷的方式测试了 xperception。他们设置了一个机器人去捡起散落在桌面上的随机笔。难点在于?机器人必须拿起一支笔,放入一台激光打印机中,并在上面刻上定制信息。为了让激光精准击中目标位置,机器人必须以近乎零误差的精度掌握笔的朝向。如果笔稍微歪了一点点,刻出的字就会是歪的。

实验设置非常简单。团队没有为这些笔拍摄任何照片,也没有针对它们训练机器人。他们只是上传了笔的数字 CAD 模型,并在数字模型上预定义了最佳抓取点(在论文的插图中表现为蓝色标记)。当机器人开始工作时,xperception 观察了凌乱的笔堆,找到了每一支笔,计算出它们各自的摆放方式,并告诉机器人在哪里抓取。机器人成功地捡起了笔,并完美地对齐了激光位置,尽管这些笔互相遮挡,且光照环境具有挑战性。

结果:快速、灵活且面向现实世界

论文表明,xperception 是一个游戏规则改变者,因为它消除了通常会减慢工厂节奏的“训练时间”。通过使用 FreeZe 算法(该算法最近赢得了名为 BOP Challenge 2024 的重大国际竞赛),该系统实现了毫米级的精度。这意味着机器人足以胜任精细的任务。

更棒的是,这不仅仅是一个实验室实验。研究人员证明了它可以在工业边缘硬件上运行,特别提到了 NVIDIA Jetson Thor——这是一款专为安装在机器人手臂上的强大计算芯片。这意味着“大脑”不需要待在遥远的巨型服务器集群中;它可以直接在工作现场进行思考和反应。

作者们对这种方法能够投入现实应用充满信心,因为它已达到 6 级技术成熟度(TRL 6)。在工程领域,这意味着该技术已在相关环境中得到了测试,并且非常接近成为商业产品。他们不仅仅是在暗示这可能可行,而是已经在真实硬件和真实物体上展示了其实际效果。

核心总结

xperception 正在解决机器人僵化的问题。它认为我们不需要为遇到的每一个新物体都重新训练机器人。相反,通过使用物体的数字蓝图和一个能将视觉点与几何形状对齐的智能预训练 AI,机器人可以变得足够灵活,以应对现代制造业中混乱、不可预测的现实情况。它将“如何抓取这个奇怪的新东西”这一复杂任务,转化为了一个简单的“即插即用”式软件更新,为实现能在眨眼间完成产品切换的灵活工厂铺平了道路。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →