← 最新论文
💻 computer science

ATSplat: Compact Feed-forward 3D Gaussian Splatting with Adaptive Token Expansion

ATSplat 是一个前馈式 3D 高斯泼溅(3D Gaussian Splatting)框架,它通过一个自适应令牌扩展(Adaptive Token Expansion)模块恢复了自适应容量分配能力,使其能够以显著更少的高斯点和更快的推理速度,生成紧凑且高质量的 3D 重建,相比于现有的稠密方法具有明显优势。

原作者: Cho In, Jeonghwan Cho, Mijin Yoo, Gim Hee Lee, Seon Joo Kim

发布于 2026-07-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Cho In, Jeonghwan Cho, Mijin Yoo, Gim Hee Lee, Seon Joo Kim

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图仅凭从不同角度拍摄的几张照片,来构建一个完美的 3D 房间模型。长期以来,实现这一目标的最佳方法就像雇佣一支艺术家团队,他们会花费数小时甚至数天的时间,仔细地绘制和雕刻房间的每一个微小细节,直到它看起来栩栩如生。这被称为“优化”(optimization),虽然结果非常惊人,但对于像电子游戏或虚拟现实这样需要即时呈现房间场景的应用来说,它的速度太慢了。

随后,科学家们发现了一个聪明的捷径,叫做“3D 高斯泼溅”(3D Gaussian Splatting)。与其进行绘画,不如使用数百万个微小的、模糊的 3D 气球(称为高斯体)来填充空间。通过调整这些气球的大小、颜色和位置,他们可以创建一个可以从任何角度实时查看且看起来非常真实的场景。然而,旧的“捷径”方法在尝试实现即时生成时有一个巨大的缺陷:它们过于僵化。它们会在任何地方都投放相同数量的气球,无论那里是一个无聊的空旷墙壁,还是一个复杂的精细雕像。这意味着它们在空白空间上浪费了大量的计算资源,却在复杂的部分由于气球不足而导致细节模糊或缺失。

于是,ATSplat 登场了,它是一种像智能、自适应施工队一样的新方法。ATSplat 不再盲目地根据照片网格放置气球,而是从一些“锚点”开始,并询问:“这个场景哪里实际上难以构建?”如果它看到一个复杂的角落或一个纤细精巧的物体,它会立即在那里长出更多的气球。如果它看到一面平坦的墙,它就会保持稀疏。这种“自适应”的方法让系统能够在不到 1 秒的时间内构建出高质量的 3D 场景,仅使用了 311,000 个气球,而旧的即时方法则需要超过 170 万个气球才能达到类似的效果。论文指出,通过聪明地决定在哪里放置气球,而不是到处乱放,我们可以兼得“即时速度”与“高质量细节”。

问题所在:“像素陷阱”

要理解为什么 ATSplat 如此重要,我们首先需要看看之前的“即时”方法是如何运作的。想象一下,你正试图通过观察相机屏幕上的像素网格来重建一个场景。旧的方法会说:“对于屏幕上的每一个像素,我都会创建一个 3D 气球并将其推向世界。”

这听起来很高效,但实际上是一个陷阱。如果你拍摄一个带有巨大空白白墙的房间,那面墙可能拥有数千个像素。旧方法会为那面空墙创建数千个气球,尽管这面墙并不需要任何细节。与此同时,如果角落里有一个微小而复杂的瓶子,该方法可能没有足够的“气球预算”来让它看起来很好,因为它把太多的资源浪费在了墙面上。

论文认为,这种“像素对齐”(pixel-aligned)的方法从根本上说是存在缺陷的,因为它将 3D 物体的数量与相机的分辨率挂钩,而不是与场景的实际复杂度挂钩。这就像是通过在蓝图的每平方英寸处放置一块砖头来盖房子,而不管那部分是坚实的基石还是精致的彩色玻璃窗。

解决方案:“自适应标记”策略

ATSplat 通过引入 自适应 3D 标记(Adaptive 3D Tokens) 改变了游戏规则。可以将这些标记视为聪明的侦察兵。

  1. 侦察队(稀疏初始化): ATSplat 不会向每一个像素都派出一名侦察兵,而是根据对深度的快速猜测,向 3D 空间的粗略、粗糙位置发送一些侦察兵。这些侦察兵构成了场景的“脚手架”或骨架。
  2. 扩张(自适应标记扩张): 这是神奇之处。随着系统构建场景,它会检查每个侦察兵的表现如何。如果一名侦察兵处于一个无聊的区域(如平坦的墙壁),它将保持原样。但如果一名侦察兵处于一个棘手的区域(如复杂的椅子或树枝),并且系统意识到它在处理该区域时感到吃力,它就会触发自适应标记扩张(Adaptive Token Expansion)
  3. 结果: “棘手”的侦察兵会分裂成多个新的侦察兵,每个新的侦察兵都携带更多详细的信息。这就像是一个建筑队意识到某个特定的角落很难建造,于是他们立即为那个特定位置派出了一个全新的工人团队,同时让简单的部分保持现状。

论文明确排除了“需要大规模、密集的物体云才能获得好结果”的观点。它指出,关键不在于你有多少个气球,而在于你把它们放在哪里。通过将 3D 物体的放置与相机的像素网格解耦,ATSplat 可以将资源精确地集中在需要的地方。

实际运作方式

该系统通过单次前向传递(forward pass)工作,这意味着它查看输入图像并几乎瞬间生成 3D 模型。以下是论文中描述的步骤流:

  • 第 1 步: 它获取场景的多张照片(例如 12 张图像)。
  • 第 2 步: 它使用神经网络创建一个粗略的 3D 地图,并放置一些“锚点标记”(侦察兵)。
  • 第 3 步: 它运行一个“解码器”来细化这些标记。在此过程中,**自适应标记扩张(ATE)**模块会检查“不确定性”。
  • 第 4 步: 如果系统对场景的某个部分感到不确定(高不确定性),它会将该标记扩展为多个新的标记。这些新标记随后被用于生成专门针对该困难区域的更多 3D 气球(高斯体)。
  • 第 5 步: 最后,它渲染场景。

论文指出,这个过程是由“渲染误差图”监督的。本质上,系统学会了在真正犯错之前预测自己会在哪里出错,从而使其能够主动扩展资源。

结果:速度与效率

作者在两个主要数据集上测试了 ATSplat:RealEstate10K(室内家庭视频)和 DL3DV(室内外混合场景)。结果令人瞩目:

  • 质量: ATSplat 达到了最先进的渲染质量,这意味着生成的图像看起来与之前的最佳方法一样好,甚至更好。
  • 效率: 它使用的 3D 高斯体比密集的、像素对齐的方法少了 5.7 倍。例如,在一次高分辨率测试(512 × 960)中,ATSplat 仅使用了 311,000 个高斯体,而竞争对手 DepthSplat 则需要近 600 万个。
  • 速度: 重建过程在单个商用 GPU 上耗时不到 1 秒。一旦构建完成,场景可以以 1136 帧每秒 (FPS) 的速度进行渲染,这非常快,适用于实时应用。

论文还强调,ATSplat 在具有细长结构或复杂几何形状的“挑战性区域”表现尤为出色,这些区域通常是其他即时方法的弱点。在一次相机角度远离输入照片(这是一个困难场景)的测试中,ATSplat 保持了高质量,而其他方法由于受限于原始相机射线而表现挣扎。

论文并未声称的内容

需要注意的是论文没有说的话。作者并未声称 ATSplat 目前已适用于所有场景。他们提到,该系统目前会扩展标记,但如果标记在后续过程中变得冗余,它并不会进行“剪枝”(pruning/移除)。他们建议,添加剪枝机制可以让它在未来变得更加高效。

此外,虽然该系统在所测试的数据集上表现良好,但论文并未声称它在无需特定训练的情况下能完美处理“野外”(in-the-wild)图像(即来自互联网的随机照片),尽管他们表示这是一个充满前景的未来研究方向。其结果是基于特定数据集的实测实验,而非仅仅是模拟或猜测。

核心启示

在 3D 重建领域,ATSplat 表明,“聪明”比“密集”更重要。通过使用一个稀疏的起点并仅在场景困难的地方进行自适应扩张,它能够眨眼间构建出高质量的 3D 世界。它证明了你不需要用数百万个气球来建造一座城堡;你只需要知道在哪里放置那些重要的气球。这种方法可以为游戏、虚拟现实和机器人技术提供更快、更高效的 3D 体验,让数字世界感觉像物理世界一样真实且响应迅速。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →