Immediate 3D Gaussian Splat Reconstruction of Unordered Input with Global Consistency
本文提出了首个针对无序输入进行 3D 高斯泼溅(3D Gaussian Splatting)重建的即时反馈解决方案,该方案通过利用视觉地点识别、共视图以及一个渐进式层级框架,确保了全局一致性,从而实现了快速、可扩展且高质量的场景渲染。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图仅凭几张照片,构建一个完美、发光的 3D 房间模型。在计算机图形学领域,这被称为“辐射场重建”(radiance field reconstruction)。长期以来,实现这一目标的最佳方法是拍摄视频,其中每一帧都像轨道上的火车一样,紧随前一帧之后,整齐划一。计算机可以很容易地通过观察前一帧来推测每一时刻摄像机的位置。但现实生活并非电影;它是混乱的。当你走在博物馆或公园里时,你的移动并不是直线。你会转身环顾,或者为了看清错过的某个地方而退后一步,而且拍照的顺序也是随机的。
这就是**3D 高斯泼溅(3D Gaussian Splatting)*技术发挥作用的地方。你可以把它想象成一个由数百万个微小的、模糊的、发光的球体(高斯分布)组成的数字云。当你从正确的角度向这片云团投射光线时,它看起来就像真实的场景一样。问题在于,如果你将这些随机、无序的照片输入计算机,它会感到困惑。它不知道哪张照片属于哪一部分,也无法确定拍照时的相机位置。以往的方法要么要求你必须等收集完所有*照片后才能开始构建(这很枯燥且缓慢),要么假设你是在沿直线行走(这并不符合实际情况)。
这篇论文介绍了一种新的方法,即使在处理完全杂乱、无序的照片时,也能立即构建这些发光的 3D 云团。由 Andreas Meuleman 及其团队领导的研究人员创建了一个系统,该系统就像一个超级智能的即时记忆。当你按下快门时,系统会瞬间识别出你的位置,将其与你之前见过的场景正确的部分连接起来,并实时更新屏幕上的 3D 模型。无论你是绕圈走还是前后跳跃,系统都能保持整个 3D 世界的一致性和清晰度,让你在捕捉的过程中就能获得高质量的实时视图。
“即时记忆”的魔力
这种新方法的核心在于处理无序照片的巧妙技巧。通常,计算机试图将一张新照片与前一秒拍摄的照片进行匹配。但如果你已经走了一个小时,突然拍了一张十分钟前经过的地方的照片,计算机需要在庞大的历史图像库中找到那个旧位置。
为了解决这个问题,团队使用了一个两级匹配系统。首先,他们使用一个“视觉地点识别”(visual place recognition)工具(可以把它想象成一位超级快速的图书管理员),它通过观察照片的整体氛围,迅速从整个历史记录中筛选出一份最可能的候选名单。这就像是通过外套的颜色在人群中认出一个朋友,甚至还没看到对方的脸。然后,第二层更仔细的检查通过观察具体细节(如衬衫的图案)来确认匹配。这个过程非常快,以至于系统可以在眨眼之间搜索数千张过去的图像。
一旦系统知道哪些照片属于一起,它就会构建一个共视图(Covisibility Graph)。想象这是一个蜘蛛网,每张照片都是一个节点,强有力的线条连接着观察到相同场景部分的照片。这个网络帮助计算机快速找到当前时刻需要处理的最佳照片组,忽略掉那些无关紧要的照片。这使得系统可以进行“局部束调整”(local bundle adjustment),这是一种高级的说法,意指它能微调相机位置和 3D 球体,以确保一切完美对齐,同时在图形处理器(GPU)上运行,从而保持极高的速度。
修复漂移:“闭环”问题
当你走动并拍照时,微小的误差会不断累积。这就像蒙着眼睛绕圈走;你可能以为回到了起点,但实际上却向左偏了几步。在 3D 重建中,这被称为“漂移”(drift)。如果计算机没有意识到你已经回到了曾经去过的地方,3D 模型就会拉伸或变形,看起来像个哈哈镜。
在传统系统中,计算机使用时间戳来了解何时形成了闭环。但在处理无序照片时,时间并不起作用。作者通过**基于簇的闭环检测(cluster-based loop detection)**解决了这个问题。他们根据照片在蜘蛛网图中的连接方式将照片分为若干个“簇”。如果系统发现一张新照片连接了两个看起来正在观察相同事物的遥远簇,它就知道一个闭环已经形成了。
他们没有选择重新计算所有内容(这会很慢),而是使用了一种“焊接”(welding)技术。他们找到两个簇之间最佳的连接点,并将它们轻轻地“焊接”在一起。然后,他们利用蜘蛛网图将这种修正立即传播到模型的其余部分,在不停止展示的情况下修复漂移。这确保了无论你的拍照风格多么混乱,3D 世界始终保持稳固和一致。
规模扩展:“渐进式层级结构”
最后,团队必须解决规模问题。如果你尝试构建整个城市的 3D 模型,你的计算机显存(VRAM)将会爆炸。为了处理这个问题,他们引入了渐进式层级结构(progressive hierarchy)。你可以把它想象成一个地图应用:当你缩小视图时,你看到的是城市简单的粗略轮廓;当你放大视图时,应用会加载更多详细的街道和建筑。
在他们的系统中,3D 球体(高斯分布)被组织在一个树状结构中。如果一个球体从当前的相机角度看太小而看不见,系统会将它“卸载”到计算机的常规内存(RAM)中,为重要的可见细节腾出空间。当你移动相机并需要更多细节时,系统会立即将精细细节拉回到高速内存中。这使得系统能够处理包含数千张图像和大规模环境的场景,而不会崩溃,同时保持渲染的流畅和实时。
结果:快速、清晰且应对各种情况
作者在包括房间、户外徒步和大型城市场景在内的各种数据集上测试了他们的方法。他们发现,该系统可以处理无序输入,并提供具有高视觉质量的即时反馈。例如,在一个名为 MipNeRF360 的数据集中,他们的方法在大约 1 分 17 秒内就生成了一个高质量的 3D 模型,而其他尝试这样做的方法则耗时更长或完全失败。即使与需要处理所有数据数小时的离线方法相比,他们的方法速度大约快了 6 倍,同时产生的质量也非常接近。
论文明确排除了“必须在收集完所有照片前等待”或“必须按严格顺序拍照”的观点。他们证明了依赖于基于时间的假设或简单的顺序匹配,对于人们捕捉场景的混乱现实是不够的。相反,通过结合快速视觉识别、智能基于图的连接以及动态内存层级结构,他们创造了第一个真正允许从无序输入进行即时、高质量 3D 重建的解决方案。
简而言之,这篇论文表明,我们不再需要成为小心翼翼、循规蹈矩的摄影师才能构建出惊人的 3D 世界。我们可以随心所欲地拍照,旋转身体,或者跳回原处,依然能瞬间获得完美的、发光的 3D 模型。它将捕捉场景的混乱过程变成了一种无缝的、交互式的体验,让虚拟现实的未来离今天又近了一步。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。