← 最新论文
💻 computer science

Sparse Code Uplifting for Efficient 3D Language Gaussian Splatting

本文提出了 SCOUP,一种新颖的方法,该方法通过利用源自 2D 图像区域的基于稀疏码本的表示并将其经加权稀疏聚合提升至 3D,从而将语言表示学习与 3D 高斯优化解耦,进而实现开放词汇 3D 场景理解在训练速度、内存效率和渲染性能方面的同步提升。

原作者: Lovre Antonio Budimir, Yushi Guan, Steve Ryhner, Sven Lončarić, Nandita Vijaykumar

发布于 2026-05-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Lovre Antonio Budimir, Yushi Guan, Steve Ryhner, Sven Lončarić, Nandita Vijaykumar

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你有一个巨大的、由数百万个微小、发光、漂浮的气球(这些就是“3D 高斯”)构建而成的 3D 数字房间。你希望这个房间能够理解语言。你希望能够提问:“红色的椅子在哪里?”或者“把咖啡杯显示给我看”,并让房间瞬间点亮正确的位置。

问题在于,如果给每一个气球都赋予一个完整、详细的描述(例如一个包含 512 个词的词典定义),负担就太重了。构建这个房间需要耗费漫长时间,会占满你计算机的所有内存,而且后续搜索起来也非常缓慢。

现在,SCOUP(稀疏代码提升)登场了。

可以把 SCOUP 想象成一位聪明的图书管理员,它通过三个巧妙的步骤来解决这个问题:

1. “集体照”策略(2D 稀疏编码)

SCOUP 并不是一开始就尝试逐个描述每一个气球,而是首先从一个平坦的 2D 相机视角观察房间。它将气球分组为“街区”(例如“红色椅子街区”或“咖啡杯街区”)。

接着,它创建一个仅包含 64 个关键词的主词典(码本)。它不再为每个街区撰写长篇大论,而是直接说:“这个街区 40% 是‘红色’,30% 是‘木质’,30% 是‘椅子’。”它仅使用少数几个关键词来描述整个区域。这比给每个气球都写一份完整描述要轻量得多。

2. “投票系统”(稀疏代码提升)

现在,SCOUP 将这些来自 2D 照片的简短、简单的描述投射到 3D 气球上。但这里有个窍门:单个气球可能会从许多不同的角度被观察到。

  • 从左边看,一个气球可能看起来像“木质”。
  • 从右边看,它可能看起来像“阴影”。
  • 从顶部看,它看起来像“棕色”。

SCOUP 就像一个投票系统。它让所有不同的相机角度对那个气球是什么进行投票。如果有 10 个相机说是“木质”,而只有 1 个说是“阴影”,那么“木质”的投票获胜。“阴影”的投票被视为噪声并被忽略。这确保了每个气球都能获得一个清晰、公认的标识,而不会因相互冲突的视角而感到困惑。

3. "Top-K"过滤器(清理工作)

投票结束后,一些气球可能仍然混杂着各种投票结果。SCOUP 应用一条严格的规则:“只保留得票最多的前 4 个,其余全部丢弃。”

因此,气球不再携带一个沉重的、包含 512 个词的词典条目,而是只持有4 个微小的数字(索引),指向主词典。

  • 之前: 气球携带着一本厚重的百科全书。
  • 之后: 气球携带着一张写有 4 个数字的微型索引卡。

为什么这很重要?

该论文声称,SCOUP 相比之前的方法(如 LangSplatV2)是一个巨大的升级:

  • 速度: 构建 3D 语言房间过去需要数小时。使用 SCOUP,仅需不到一分钟。这意味着400 倍的速度提升。这就像从一块砖一块砖地盖房子,变成了组装预制套件。
  • 内存: 在构建过程中,它使用的内存减少了 3 倍。这就像用背包而不是用集装箱来打包旅行行李。
  • 质量: 尽管它更快、更轻量,但实际上它在查找物体方面表现更好。因为它过滤掉了“噪声”(那些令人困惑的投票),所以它能更清晰地理解场景。
  • 渲染: 当你提出问题时,计算机可以极其快速地搜索这些微小的索引卡,其速度之快,堪比旧有的重型方法搜索百科全书的速度。

总结: SCOUP 不再试图强迫每一个 3D 气球都携带一份沉重、完整的描述。相反,它教导气球基于群体共识携带几个简单的“关键词”。这使得整个系统的构建速度如闪电般快,存储成本低廉,且搜索精准锐利。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →