← 最新论文
💻 computer science

ProjFormer: Point Cloud Completion via Geometric-Projective Transformer and Cross-Modal Semantic Constraints

ProjFormer 是一个用于点云补全的轻量级跨模态框架,它通过显式投影和自适应特征路由来强制执行几何一致性,从而解决该任务的病态问题,并有效地将 2D 语义约束与 3D 结构细化相结合。

原作者: Sheng Liu, Meng Wang, Ruihui Li, Huilong Pi, Zhuo Tang, Kenli Li

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Sheng Liu, Meng Wang, Ruihui Li, Huilong Pi, Zhuo Tang, Kenli Li

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在计算机视觉领域,机器正在不断学习如何感知三维世界。虽然标准的照片捕捉的是现实中平面的、二维的切片,但许多现代应用——从在繁忙街道上行驶的自动驾驶汽车到组装精密零件的机器人——都需要对空间进行完整的体积理解。为了实现这一点,科学家们使用点云,它们本质上是悬浮在三维空间中的大量单个点集。每个点代表表面上的一个特定位置,它们共同构成了物体的数字骨架。然而,现实世界是混乱的。由于阴影、其他物体遮挡视线或扫描距离过远,传感器经常会遗漏物体的部分区域。这使得计算机面对的是一个破碎、不完整的形状,就像一个丢失了一半拼图块的拼图。研究人员面临的挑战是,如何教会机器观察这些破碎的碎片,并在脑海中重建整个物体,用符合几何逻辑的形状来填补这些空隙。

多年来,解决这一问题的最成功尝试依赖于两种截然不同的方法。一些方法试图仅利用已有的三维点来猜测缺失的部分,本质上是要求计算机基于以往见过的模式来想象剩余部分。另一些方法则试图借鉴人类观察世界的方式,利用二维图像来引导三维重建。图像类方法的缺陷在于,它们往往将三维点和二维图像视为需要被“粘合”在一起的独立个体。这种“粘合”过程通常是不精确的;计算机可能知道一张照片里的椅子长什么样,但它很难准确知道三维点云中的哪个特定点对应于照片中的哪个部分。这种 3D 点与图像之间缺乏直接物理联系的问题,往往导致重建的形状看起来模糊不清,或者出现奇怪的扭曲伪影。

湖南大学的一个研究小组推出了一种名为 ProjFormer 的新方法,它改变了计算机连接二维图像与三维点的方式。该方法不再试图学习两者之间模糊的关系,而是利用严格的几何规则在两者之间画出一条直接的连线。想象一下,尝试将 3D 模型上的一个特定点与照片上的一个点进行匹配;研究人员的系统通过将 3D 点投影到图像上来实现这一点,就像相机镜头将真实物体投影到胶片上一样。这确保了计算机从图像中提取的每一条信息都能与它试图修复的特定 3D 点完美对齐。通过强制执行这种严格的几何一致性,该系统避免了困扰早期方法的猜测问题,从而能够获取精确的视觉细节,以填补形状缺失的部分。

该新系统的核心是一个被称为“投影引导视角注意力”(projective guided view attention)的过程。简单来说,计算机从几个不同的角度观察不完整的 3D 物体,创建一组虚拟地图。对于不完整点云中的每一个点,系统都会计算该点在这些虚拟地图上的确切位置。然后,它会触及这些地图上的特定位置,抓取视觉特征(如纹理或边缘信息),并将其带回 3D 点。这种过程实现的精度是以往方法无法企及的,因为这种连接不是通过试错学习而来的,而是由透视定律所决定的。系统还包含一个智能过滤器,用于权衡每条信息的可靠性:它会对物体清晰可见的视角给予更多关注,而对可能被遮挡或距离过远的视角则减少关注。

一旦系统收集了这些精确的视觉线索,它便面临另一个挑战:决定如何使用它们。物体的某些部分清晰可见,而另一些部分则完全缺失。研究人员发现,单一、僵化的组合信息规则并不适用于整个物体。为了解决这个问题,他们构建了一个“几何感知路由”(geometry-aware routing)机制。这就像是一个动态的数据交通控制器。对于已经可见的部分,系统会重度依赖刚刚收集到的详细视觉线索;但对于完全缺失的部分,它会转向更广泛的结构模式,利用它对物体整体应有样貌的认知来填补空白。这种根据局部情况切换策略的能力,使得系统生成的成果既能在应有的地方保持细节,又能在数据缺失的地方保持结构稳固。

这一新方法的成果具有重要意义。在包含数千种不同物体(从飞机到汽车)的标准数据集测试中,该方法产生的形状比目前许多领先的技术都更加准确和完整。在一个名为 PCN 的基准数据集上,该系统实现了 6.34 的平均误差得分,这一数值表明其与物体的真实形状非常接近。除了准确性之外,该系统还具有极高的速度。虽然其他尝试结合 2D 和 3D 数据的方法处理单个物体可能需要超过 26 毫秒,但这种新方法大约只需 15.85 毫秒即可完成任务。这种速度对于实时应用至关重要,例如机器人需要瞬间理解周围环境以避免碰撞。

研究人员还在采集自自动驾驶汽车的真实世界数据上测试了他们的系统,在这种场景下,输入数据通常是充满噪声且不完整的。在这些测试中,与以往的方法相比,该系统生成的形状更接近现实世界中汽车的真实形态。虽然存在轻微的权衡,即系统在填充缺失部分时表现得更为激进,但整体重建质量更为优越。这项研究表明,通过尊重光影与空间相互作用的基本几何原理,而非仅仅依赖复杂的统计学猜测,机器可以更清晰地观察世界。这项工作表明,3D 视觉的未来不仅在于收集更多的数据,更在于在不同形式的世界表征之间建立更智能的连接。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →