✨ 要点🔬 技术摘要
想象一下,你正试图仅通过几张不同角度的照片,去重建一座巨大且复杂的乐高城堡。在计算机视觉领域,这是一个经典的挑战,被称为“3D重建”。长期以来,计算机必须为看到的每一座新城堡,逐一、费力地调整数百万个微小的虚拟积木,这个过程既缓慢又昂贵。最近,一种被称为“3D高斯泼溅”(3D Gaussian Splatting)的聪明捷径出现了。这种方法不再使用僵硬的方块进行构建,而是使用数百万个柔软、模糊的3D“云团”(称为高斯函数),这些云团可以被挤压、拉伸和着色,以完美匹配场景的形状和外观。这些云团可以瞬间渲染成新的照片,使其非常适合虚拟现实和机器人技术。
然而,这种最新、最快技术的版本存在一个问题。为了让过程更快,一些研究人员开始使用一种“基于查询”(query-based)的方法。把这想象成雇佣了一支隐形的侦探团队(称为“标记/tokens”)来弄清楚城堡的形状。每个侦探都应该观察照片,收集线索,然后大声喊出一个特定的模糊云团组,以此来建造城堡的一部分。理想情况下,侦探A应该建造前门,而侦探B应该建造屋顶。但问题在于,在目前的方法中,这些侦探会感到困惑。侦探A可能会同时喊出属于前门、屋顶和烟囱的云团,将它们散布在整个城堡各处。结果是一个混乱、模糊的重建效果,云团无法固定在正确的位置,场景看起来有点像梦境,物体漂浮在错误的地方。
正是由于这里,名为“LocusGS”的论文介入并拯救了局面。来自国防科技大学的作者们意识到,这些隐形侦探缺少了一个关键信息:物理地址。在他们的新系统 LocusGS 中,他们给了每个侦探一个“3D锚点”。这不仅仅是一个模糊的概念;它是一个特定的3D空间坐标(中心点)和一个半径(即他们的“责任区域”有多大)。在侦探们工作时,他们不仅仅是在猜测;他们不断地完善自己的地址。如果一名侦探被分配到了前门,他们的锚点就会让他们始终固定在那里,防止他们游走到屋顶。这种“空间定位”(spatial grounding)迫使那些模糊的云团保持成整齐、紧凑的群体,从而真正符合它们本应代表的物体的形状。
论文指出,增加这个简单的物理锚点产生了巨大的影响。当他们在 RealEstate10K 和 DL3DV 等标准数据集上测试该方法时,他们发现即使使用完全相同数量的模糊云团,LocusGS 产生的图像也比之前的最优方法更清晰、更锐利。那些“侦探”(tokens)不再到处乱撒云团,而是构建了紧密、有组织的集群,完美地遵循了场景的几何结构。作者通过展示单个 token 生成的云团彼此更加靠近(更紧凑),以及整体3D结构更加连贯来衡量这一点。他们还发现,这些锚点本身在场景中形成了一个逻辑性的“脚手架”,在最终细节绘制完成之前,就有效地勾勒出了物体的不同部分。
简而言之,论文认为,通过给这些数字建造者一个清晰的物理位置站立,你就能阻止他们迷失方向并散乱地开展工作。其结果是一个看起来更真实的3D场景,具有更少的漂浮伪影和更清晰的形状定义。作者展示了这种方法在不同数量的相机视角下都能表现良好,并且不需要通过降低系统速度或增加计算能力来获得更好的结果。这提醒我们,有时,组织混乱数字世界最好的方法,就是给每样东西一个明确的立足之地。
技术摘要:LocusGS
问题陈述
近期的前馈式 3D 高斯泼溅(3DGS)方法已从昂贵的逐场景优化转向从输入视图进行直接预测。在这些方法中,基于查询(query-based)的方法(例如 TokenGS)使用一组固定的可学习查询(tokens)来表示场景。每个 token 通过 Transformer 解码器聚合多视图证据,并被解码为一组 3D 高斯。
然而,作者观察到现有基于查询的方法存在一个关键局限性:空间相干性弱 。虽然理想情况下,不同的查询应该专门负责不同的、具有相干性的局部区域,但从单个潜在查询(latent query)解码出的高斯分布往往会散落在远离且无关的场景区域。这导致了空间弥散的分布,无法很好地与底层场景结构对齐。作者将这一失败归因于现有高斯查询的纯潜在表示(purely latent representation) ,即它们缺乏关于查询在 3D 空间中具体“在哪里”操作以及其覆盖范围“有多大”的显式概念。因此,由查询聚合的多视图证据以及生成的最终高斯,并不能被约束在一个连贯的局部区域内。
方法论:LocusGS
为了解决这个问题,作者提出了 LocusGS (空间锚定 Token),它通过为每个高斯查询增加一个显式的 3D 锚点状态(3D anchor state) 来进行增强。该状态由一个 3D 中心(μ \mu μ )和一个支撑半径(r r r )组成。
核心组件
显式 3D 锚点状态: 不同于仅将查询表示为潜在特征向量,LocusGS 将每个第 l l l 层解码器的查询 i i i 与锚点状态 a i l = ( μ i l , r i l ) a^l_i = (\mu^l_i, r^l_i) a i l = ( μ i l , r i l ) 相关联。
中心 (μ \mu μ ): 指定查询当前的 3D 参考位置。
半径 (r r r ): 定义了查询的局部支撑范围。半径通过一个无约束变量 ρ \rho ρ 参数化,并通过 softplus 函数处理以确保其正定性。
这些状态是可学习的、跨场景共享的,并在解码器层级中不断得到细化。
锚点引导解码器: 解码器利用锚点状态来引导自注意力(self-attention)和交叉注意力(cross-attention)机制:
锚点感知自注意力: 从锚点中心 μ \mu μ 导出的位置嵌入被注入到 token 特征中。这使得高斯 token 之间的交互取决于它们的相对 3D 位置,而不仅仅是潜在特征的相似度。
锚点到射线几何偏置(交叉注意力): 为了聚合多视图证据,该方法引入了一个基于查询的锚点中心 μ i l \mu^l_i μ i l 与图像 token 相关的相机射线 ℓ j \ell_j ℓ j 之间距离的几何偏置。
偏置定义为 b i j l = − 1 2 ( D ( μ i l , ℓ j ) σ 0 r i l ) 2 b^l_{ij} = -\frac{1}{2} \left( \frac{D(\mu^l_i, \ell_j)}{\sigma_0 r^l_i} \right)^2 b ij l = − 2 1 ( σ 0 r i l D ( μ i l , ℓ j ) ) 2 ,其中 D D D 是点到射线的欧几里得距离。
该偏置会对那些远离锚点的图像 token 进行惩罚,从而有效地引导查询关注具有几何相关性的观测结果。半径 r i l r^l_i r i l 控制了这种空间偏好的带宽。
动态锚点细化: 在每个解码器层之后,token 特征会预测用于更新锚点中心和半径的残差更新量(Δ μ , Δ ρ \Delta \mu, \Delta \rho Δ μ , Δ ρ )。这使得锚点状态能够随着解码过程的推进,针对特定输入场景调整其 3D 位置和支撑尺度。
以锚点为中心的高斯解码: 在最终解码阶段,高斯的预测并非完全不受约束。相反,模型预测相对于最终细化后的锚点中心的局部偏移量 (δ \delta δ )。最终的高斯中心计算如下:μ i , k G = μ i L + r i L δ i , k \mu^G_{i,k} = \mu^L_i + r^L_i \delta_{i,k} μ i , k G = μ i L + r i L δ i , k 在此,锚点中心提供了全局参考,而半径则缩放了局部偏移。这种公式强制要求从单个 token 解码出的高斯形成一个围绕锚点的紧凑局部组,而不是自由散布。
多层渲染监督: 训练目标包括在中间解码层(除最终层外)进行的渲染监督。损失函数结合了图像重建(MSE + SSIM)以及应用于解码高斯中心和锚点中心的可见性正则化,从而在整个解码过程中鼓励相干的空间组织。
核心贡献
查询的空间锚定(Spatial Grounding of Queries): 在基于查询的 3DGS 中引入了显式的 3D 锚点状态(中心和半径),超越了纯粹的潜在表示。
锚点感知机制: 设计了用于交叉注意力(锚点到射线)的几何偏置以及用于自注意力的位置嵌入,利用锚点状态来强化空间相干性。
结构化高斯生成: 一种解码策略,通过缩放锚点半径来预测局部偏移,确保 token 生成空间紧凑的高斯组。
渐进式细化: 一种在解码层间迭代细化锚点位置和支撑半径的机制,使模型能够适应场景几何。
实验结果
作者在新型视角合成基准测试,特别是 RealEstate10K (RE10K) 和 DL3DV 上对 LocusGS 进行了评估,并与 TokenGS、MVSplat 和 DepthSplat 等基准方法进行了比较。
渲染质量: 在相同的 token 和高斯预算下,LocusGS 在 PSNR、SSIM 和 LPIPS 指标上一致优于基于查询的基准方法(TokenGS)。例如,在具有 4 个输入视图的 DL3DV 数据集上,LocusGS(4096 个 tokens)实现的 PSNR 为 24.80,而 TokenGS 为 23.44。
空间组织: 定性和定量分析表明,LocusGS 产生了显著更具结构的化高斯分布。
Token 级紧凑性: 文中引入了一个指标 C c e n t r o i d C_{centroid} C ce n t r o i d 来衡量 token 内高斯的离散程度。LocusGS 大幅降低了这种离散度(例如,在 RE10K 上从 5.11 降至 0.19),表明来自单个 token 的高斯是高度聚集的。
锚点布局: 学习到的锚点在场景上形成了粗糙且连贯的空间骨架,覆盖了主要结构,并根据局部复杂度调整其半径(在稀疏区域半径较大,在细节丰富的区域半径较小)。
泛化能力: 与密集的像素对齐方法不同,该模型保持了独立于输入视图数量的固定高斯预算。在 DL3DV 上使用不同数量的上下文视图(2、4 和 6 个视图)进行测试时,展现出了鲁棒的表现。
效率: 虽然 LocusGS 的参数量略高(241.5M 对比 TokenGS 的 222.0M)且前向延迟稍高,但它在不增加预测高斯数量的情况下实现了更优的重建质量。
重要性与主张
本文声称,显式的 3D 锚点状态 为基于查询的前馈式 3DGS 提供了一个有效的空间先验。通过将查询锚定在 3D 空间中,LocusGS 将高斯 token 从隐式的潜在嵌入转变为可解释的空间重建查询。
作者认为,这种方法不仅提高了渲染精度,而且从根本上增强了表示的空间组织性和可解释性 。结果表明,显式的空间状态鼓励查询专注于连贯的局部区域,从而产生更具结构性的高斯分布,使其更好地与场景几何对齐。这项工作表明,将几何状态整合到查询机制中是迈向更稳健、更有结构的 3D 场景重建的关键一步。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。