← 最新论文
💻 computer science

Mixed Neural Rendering: Interactive Mixed Reality Capture and Curation for Neural 3D Reconstruction

本文介绍了混合神经渲染(MiNeR),这是一个使用 HoloLens 2 的交互式混合现实流水线,它集成了实时采集、原位检测和可提示分割技术,旨在克服传统的获取限制并实现稳健的以物体为中心的神经 3D 重建。

原作者: Alessio Paolucci, Lorenzo Stacchio, Emanuele Balloni, Pasquale Cascarano, Primo Zingaretti

发布于 2026-07-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Alessio Paolucci, Lorenzo Stacchio, Emanuele Balloni, Pasquale Cascarano, Primo Zingaretti

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图用相机为自己最喜欢的玩具制作一个完美的、照片级真实的 3D 副本。通常情况下,你会拍一堆照片,把它们发给一台超级计算机,然后等待数小时,让它计算出你每次拍摄时的站位。如果你漏掉了一个位置或者拍了一张模糊的照片,计算机可能会崩溃,而你直到一切都太迟了才会发现。这就像是在烤蛋糕,直到蛋糕进了烤箱才意识到忘了放鸡蛋。

于是有了 MiNeR(混合神经渲染),这是一个由研究团队设计的全新系统,旨在解决这个“烘焙灾难”问题。他们构建了一个工作流,让你在拍照的同时进行捕捉、检查和修复,使用的是一种叫做 HoloLens 2 的特殊头显。

“魔法眼镜”工作流

不要只把 HoloLens 2 看作是一个相机,把它看作一副能看到 3D 世界的“魔法眼镜”。当你戴着它们拍照时,眼镜能瞬间知道你站在哪里以及你的视线朝向哪里。

在旧的方法中,你会拍好照片,带回家,然后寄希望于计算机能算出角度。有了 MiNeR,当你绕着物体走动时,你的视野中会出现一些漂浮的“幽灵相机”,显示你究竟在哪里拍了照。

  • 问题: 如果你看到某个地方有空隙(你没拍到照片),或者那里漂浮着一张模糊的照片,你可以立即将其删除。
  • 解决方法: 你可以立刻走到那个空缺的位置并拍一张新照片。你是在实时策展自己的数据集,在计算机开始工作之前,你就已经充当了人类编辑的角色。

三大实验

研究人员不仅构建了这个系统,还通过九个不同的真实世界物体(如水瓶、背包和风扇)对其进行了严格的“口味测试”。他们测试了三个不同的变量,以观察什么能做出最好的 3D 副本:

  1. “GPS”(位姿来源/Pose Source): 他们是使用头显内置的追踪技术(Direct),还是使用一个强大的离线计算机程序 COLMAP (SfM) 来确定角度?
  2. “遮罩”(分割/Segmentation): 他们是使用 AI 工具 (SAM 2) 来抠出背景并只关注物体,还是让杂乱的背景留在画面中?
  3. “引擎”(渲染器/Renderer): 他们是使用较旧的“NeRF”方法,还是使用较新的“3D 高斯泼溅”(3D Gaussian Splatting, 3DGS)方法来构建 3D 模型?

研究发现(计分板)

结果非常明确,但也有一些重要的注意事项。

1. “黄金标准”(最佳质量)
当一切都完美运行时,绝对最好的结果来自于结合以下三点:

  • 使用 COLMAP 计算机程序来确定角度。
  • 使用 SAM 2 AI 来遮罩背景。
  • 使用 3D 高斯泼溅 (3DGS) 引擎。

这个组合产生了最高质量的图像,其 PSNR 为 31.78SSIM 为 0.964LPIPS 为 0.050。(可以将 PSNR 理解为“清晰度得分”,数值越高越好;31.78 非常锐利)。

2. “B 计划”(可靠性)
这里有一个转折:这个“黄金标准”(COLMAP)是非常脆弱的。在他们的测试中,它在 9 个物体中有 4 个无法正常工作(仅在 55% 的序列中成功)。这就像是一辆高端跑车,如果路面稍微颠簸一点就会抛锚。

然而,“Direct”方法(使用头显自身的追踪)从未失败。它在 9 个物体中全部成功(9/9)。

  • 权衡: 在没有遮罩的情况下,Direct 方法本身产生的图像质量较低(PSNR 约为 13.2713.36),相比之下不及黄金标准。但它从不崩溃。作者认为这是一个至关重要的“后备”选项:如果高级计算机无法处理,头显自身的追踪会让整个过程得以延续。

3. “遮罩”的力量
无论使用哪种方法,使用 AI 遮罩切除背景都会带来巨大的提升。

  • 对于 3DGS 引擎,在使用 COLMAP 时,遮罩将质量得分提高了 +12.37 分;在使用 Direct 头显位姿时,提高了 +10.04 分。
  • 基本上,告诉计算机“忽略乱糟糟的房间,只看这张椅子”能防止它被背景杂物干扰。

4. 引擎的胜者
较新的 3D 高斯泼溅 (3DGS) 方法在几乎所有测试中都一致优于旧的 NeRF 方法。它更快,能更好地处理 “Direct” 位姿,并且能产生更锐利的结果。

核心结论

论文指出,MiNeR 是通过将人类纳入流程(human in the loop)来制作日常照片 3D 模型的一种变革性工具。它并不承诺头显的追踪是完美的(它承认头显的角度可能会有“漂移”或不如计算机精确)。相反,它提供了一个安全网:如果你能让计算机运行,你可以获得最高的质量;但如果你使用头显自身的追踪和 AI 遮罩,你总能得到一个可用的结果。

它并不是一个能瞬间解决所有问题的魔杖;作者承认他们的测试规模较小(仅在房间内的九个物体中进行),并且他们没有用尺子测量精确的几何精度。但就目前而言,这表明将人类策展、AI 遮罩和正确的 3D 引擎相结合,是将杂乱的房间转化为干净、可重复使用的 3D 资产最可靠的方法。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →