← 最新论文
💻 computer science

LocusGS: Spatially Grounded Tokens for Feed-Forward 3D Gaussian Splatting

LocusGS 通过为高斯查询引入显式的 3D 锚点状态(中心和半径)来增强前馈 3D 高斯泼溅(3D Gaussian Splatting),通过引导空间相干的特征聚合与解码,使其在渲染质量和结构对齐方面相比纯潜变量表示得到提升。

原作者: Wenyu Li, Sidun Liu, Tongrui Hu, Peng Qiao, Yong Dou

发布于 2026-08-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Wenyu Li, Sidun Liu, Tongrui Hu, Peng Qiao, Yong Dou

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图仅通过几张不同角度的照片,去重建一座巨大且复杂的乐高城堡。在计算机视觉领域,这是一个经典的挑战,被称为“3D重建”。长期以来,计算机必须为看到的每一座新城堡,逐一、费力地调整数百万个微小的虚拟积木,这个过程既缓慢又昂贵。最近,一种被称为“3D高斯泼溅”(3D Gaussian Splatting)的聪明捷径出现了。这种方法不再使用僵硬的方块进行构建,而是使用数百万个柔软、模糊的3D“云团”(称为高斯函数),这些云团可以被挤压、拉伸和着色,以完美匹配场景的形状和外观。这些云团可以瞬间渲染成新的照片,使其非常适合虚拟现实和机器人技术。

然而,这种最新、最快技术的版本存在一个问题。为了让过程更快,一些研究人员开始使用一种“基于查询”(query-based)的方法。把这想象成雇佣了一支隐形的侦探团队(称为“标记/tokens”)来弄清楚城堡的形状。每个侦探都应该观察照片,收集线索,然后大声喊出一个特定的模糊云团组,以此来建造城堡的一部分。理想情况下,侦探A应该建造前门,而侦探B应该建造屋顶。但问题在于,在目前的方法中,这些侦探会感到困惑。侦探A可能会同时喊出属于前门、屋顶和烟囱的云团,将它们散布在整个城堡各处。结果是一个混乱、模糊的重建效果,云团无法固定在正确的位置,场景看起来有点像梦境,物体漂浮在错误的地方。

正是由于这里,名为“LocusGS”的论文介入并拯救了局面。来自国防科技大学的作者们意识到,这些隐形侦探缺少了一个关键信息:物理地址。在他们的新系统 LocusGS 中,他们给了每个侦探一个“3D锚点”。这不仅仅是一个模糊的概念;它是一个特定的3D空间坐标(中心点)和一个半径(即他们的“责任区域”有多大)。在侦探们工作时,他们不仅仅是在猜测;他们不断地完善自己的地址。如果一名侦探被分配到了前门,他们的锚点就会让他们始终固定在那里,防止他们游走到屋顶。这种“空间定位”(spatial grounding)迫使那些模糊的云团保持成整齐、紧凑的群体,从而真正符合它们本应代表的物体的形状。

论文指出,增加这个简单的物理锚点产生了巨大的影响。当他们在 RealEstate10K 和 DL3DV 等标准数据集上测试该方法时,他们发现即使使用完全相同数量的模糊云团,LocusGS 产生的图像也比之前的最优方法更清晰、更锐利。那些“侦探”(tokens)不再到处乱撒云团,而是构建了紧密、有组织的集群,完美地遵循了场景的几何结构。作者通过展示单个 token 生成的云团彼此更加靠近(更紧凑),以及整体3D结构更加连贯来衡量这一点。他们还发现,这些锚点本身在场景中形成了一个逻辑性的“脚手架”,在最终细节绘制完成之前,就有效地勾勒出了物体的不同部分。

简而言之,论文认为,通过给这些数字建造者一个清晰的物理位置站立,你就能阻止他们迷失方向并散乱地开展工作。其结果是一个看起来更真实的3D场景,具有更少的漂浮伪影和更清晰的形状定义。作者展示了这种方法在不同数量的相机视角下都能表现良好,并且不需要通过降低系统速度或增加计算能力来获得更好的结果。这提醒我们,有时,组织混乱数字世界最好的方法,就是给每样东西一个明确的立足之地。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →