← 最新论文
💻 computer science

Single-View 3D Shape and Pose Estimation of Transparent Objects Using Statistical Shape Models

本文提出了一种通过利用 YOLO11 进行初步检测,并迭代优化特定类别的统计形状模型以克服传统深度传感器局限性的方法,从而从单幅 RGB-D 图像中估计透明物体的完整 3D 形状和姿态。

原作者: Toshiro Nakano, Kaihei Okada, Tokuo Tsuji, Hiroaki Seki, Toshihiro Nishimura, Yosuke Suzuki, Tetsuyou Watanabe

发布于 2026-08-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Toshiro Nakano, Kaihei Okada, Tokuo Tsuji, Hiroaki Seki, Toshihiro Nishimura, Yosuke Suzuki, Tetsuyou Watanabe

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,试图用标准的深度相机拍摄一个装有水的玻璃杯或水晶花瓶的完美 3D 照片。这就像是在绘制一个幽灵的轮廓;光线在玻璃上反射、在其中折射,或者直接穿透过去,让相机感到困惑,导致生成的图像充满了空洞和故障。这对机器人来说是一个巨大的问题。如果一个机械臂想要拿起一个玻璃瓶,它需要准确知道瓶子的位置、倾斜角度以及它的完整形状——甚至是那些被遮挡住的部分。如果没有这些信息,机器人可能会尝试抓取空气,或者捏碎物体。科学家们曾尝试通过使用昂贵的新型相机或从各个角度拍摄数百张照片来解决这个问题,但这些方案往往太慢、太贵,或者对于机器人进行实时操作来说过于复杂。

这篇论文通过教机器人仅凭一张快速拍摄的照片就能“猜出”透明物体的完整形状,解决了这个棘手的问题。作者使用了一个被称为“统计形状模型”(Statistical Shape Model, SSM)的巧妙技巧。可以将 SSM 想象成一个数字粘土模具,它已经学习了特定类别(如高脚杯)的平均形状。它知道一个高脚杯通常有杯柄、杯身和杯缘,并且知道这些部分如何拉伸或收缩以制造出不同的杯子。通过将这种对“玻璃通常长什么样”的记忆与单张照片及深度扫描(显示玻璃所放置的桌面)相结合,该方法可以填补缺失的空洞,并确定物体的精确位置和朝向。研究人员发现,这种方法在猜测隐藏部分方面比以往的方法更准确,而且速度更快,为实现能够安全处理易碎透明物品的机器人迈出了重要一步。

这项研究的核心是开发一种新方法,仅通过一张 RGB-D 图像(包含颜色和深度数据的照片)来估计透明物体的完整 3D 形状和位姿(位置和朝向)。作者认为现有的解决方案存在显著缺陷:有些需要昂贵的专业相机;有些需要从不同角度拍摄数十张照片,这耗时太长;许多试图“填补”缺失深度的深度学习模型在光照或背景变化时往往会失败。论文明确指出,仅靠标准深度传感器无法可靠地测量透明物体,并指出反射和折射会导致“缺失和错误的深度值”。该方法并没有试图直接修复损坏的深度数据,而是用一个智能的、数学生成的模型来替换这些损坏的数据。

整个过程就像是在玩一个 3D 拼图版的“热与冷”游戏(指通过反馈逐渐接近目标)。首先,系统使用 YOLO11 工具观察彩色照片,识别物体是什么(例如,瓶子)、其朝向以及轮廓。它还会查看深度图像以找到物体所放置的平面(桌面)。利用这些信息,系统会从数据库中调取一个“统计形状模型”(SSM)。这个模型是一个灵活的 3D 模板,它是通过扫描许多真实物体实例构建而成的。系统将这个数字模板放入场景中,大致位于物体应该出现的位置。

接着,真正的魔法发生了。系统会将数字模板的轮廓(投影到屏幕上)与照片中看到的实际物体轮廓进行对比。如果两者不匹配,系统就会调整模板的形状、旋转和大小,然后再次检查。它会反复进行这一过程,使用一种称为“梯度下降”的数学技术,缓慢地推动模板,直到它的影子与真实的物体轮廓完美对齐。至关重要的是,系统还会根据桌面进行模板位置的修正,以确保其摆放正确。这个迭代过程使机器人能够“看到”那些对相机而言隐藏或不可见的物体部分,从而重建整个 3D 形状,包括背面。

作者在包含塑料瓶、高脚杯和杯子的数据集上测试了这种方法,涵盖了物体直立、侧卧甚至倒置的情景。他们还测试了当物体被其他物体部分遮挡时的表现。结果显示,与 ClearGrasp 和 TDCNet 这两种流行方法相比,该方法在深度估计方面的误差显著更小。在研究人员自己的数据集上,该方法的平均绝对误差(MAE)为 14.5 mm,而 ClearG grasp 的误差为 74.9 mm,TDCNet 为 39.2 mm。这表明,与那些在离开特定训练数据后表现不佳的方法不同,SSM 方法在相机或光照条件发生变化时具有更强的鲁棒性。

此外,研究表明该方法比之前的 SSM 技术版本更快。旧方法处理每个物体平均需要 4.32 秒,而新方法将其缩短至 0.506 秒。这种提速是通过优化系统计算形状变化的方式,并使用图形处理器(GPU)进行并行处理实现的。研究人员还发现,随着用于构建 SSM 的训练模型数量增加,最终 3D 形状的准确度也会提高;使用八个训练模型时,重建形状的误差降至 2.77 mm,而仅使用四个模型时为 4.16 mm。

然而,论文也谨慎地指出了局限性。该方法依赖于预先知道物体的类别;它无法猜测它从未见过或没有预建模型的透明物体形状。它还假设物体放置在一个可检测到的平面上。如果桌面不平整或物体处于悬浮状态,该方法可能会遇到困难。此外,由于系统是基于单一视角进行“猜测”,它高度依赖于 SSM 中存储的“先验知识”。如果真实的物体与模型学习到的平均形状差异很大,那么“猜测”的结果可能会出现偏差,特别是在物体沿视线方向的厚度方面。

总之,这篇论文介绍了一种成功的方法,能够通过单视角和统计模型来估计透明物体的完整 3D 形状和位姿。它表明,通过将视觉轮廓与典型形状的“记忆”相结合,机器人可以克服标准深度相机的局限性。研究结果表明,通过结合视觉轮廓与典型形状的“记忆”,机器人可以克服标准深度相机的局限性。研究结果表明,通过将视觉轮廓与典型形状的“记忆”相结合,机器人可以克服标准深度相机的局限性。该方法在处理各种取向甚至部分遮挡的透明物体时,比现有替代方案更准确、更快速,为机器人自信地操纵精细透明物品提供了一条切实可行的路径。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →