← 最新论文
💻 computer science

ImprovedVBGS: Real-time Continual Variational Bayes Gaussian Splatting

该论文介绍了 ImprovedVBGS,这是一个用于实时持续变分贝叶斯高斯泼溅(Variational Bayes Gaussian Splatting)的加速框架,通过空间截断变分推理和优化的重新分配,实现了每帧延迟 1680 倍的加速,从而在不牺牲质量的前提下实现了即时重建。

原作者: Damani Mguni-Coker

发布于 2026-07-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Damani Mguni-Coker

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教会一个机器人如何观察世界,并在行走时构建一个 3D 地图,而不是先给它看一张包含整个场景的巨型相册。这就是“即时(on-the-fly)”重建的挑战,对于需要通过探索新环境来导航而不发生碰撞的自动驾驶汽车和机器人来说,这是一项至关重要的技能。为了实现这一点,科学家们使用了一个聪明的技巧,叫做“高斯泼溅(Gaussian Splatting)”。你可以把这想象成不是用坚实的方块,而是用数百万个微小的、模糊的、有颜色的云团(高斯分布)来绘制一个 3D 场景。每个云团都有自己的位置、大小、旋转和颜色。通过堆叠足够多的这些模糊云团,计算机可以创造出一个极其逼真的画面,让你能从任何角度进行观察。

然而,这里有一个难点。通常情况下,为了让这些云团变得完美,计算机需要同时查看场景中的每一张照片,并反复调整这些云团。但对于一个在街上行走的机器人来说,它无法预见未来,它只能一次看到一帧画面。如果它试图仅从新的帧中学习,它往往会忘记之前学到的所有内容——这是一个被称为“灾难性遗忘(catastrophic forgetting)”的问题。一种名为 VBGS(变分贝叶斯高斯泼溅)的旧方法通过一种聪明的数学技巧解决了遗忘问题,这种技巧让机器人无需存储旧照片也能从新照片中学习。但它有一个巨大的缺点:速度极慢。这就像是每画一笔都要检查整个宇宙中的每一个像素一样。仅仅处理一帧画面就需要超过一分钟,这对于移动中的机器人来说是毫无意义的。

本文介绍了 ImprovedVBGS,这是一个全新的框架,它极大地加速了这个过程,使其在许多应用中变得切实可行,尽管距离完全的实时视频仍存在差距。研究人员将 VBGS 那种缓慢且谨慎的方法进行了大规模的改造,使其变得极其迅速。

首先,他们意识到当机器人看向一个新位置时,它并不需要检查整个 3D 世界中所有的模糊云团,以确定哪一个最合适。大多数云团都离得很远,并不相关。因此,他们增加了一个“空间截断(spatially truncated)”步骤。想象一下你在凌乱的房间里寻找丢失的钥匙。你不需要检查整个房子里的每一个抽屉,你只需要检查你当前所在的房间里的抽屉。ImprovedVBGS 正是这样做的:它构建了一个快速地图(KD-tree),并且只检查每个新数据点最近的邻居。这把工作量从检查数百万种可能性减少到了仅需检查寥寥数个。

其次,他们修复了一个被称为“重分配(reassignment)”的笨拙环节。在旧方法中,每当“坏”云团的数量发生变化时,计算机就会不断地停止、擦除并重写自己的代码(这个过程称为动态重编译)。这就像一位厨师每当决定加一小撮盐时,都要停下来重写整本食谱。新方法使用了“静态张量填充(static tensor padding)”,这就像是保留一本固定大小的食谱,其中空白位置只需留白即可。这阻止了计算机浪费时间去重写自己的指令。他们还发现了一种“前向(forward)”信息的方法,这意味着他们可以复用刚刚做过的计算,而不是做两次,从而用几乎不可察觉的微小画质损失换取了巨大的速度提升。

结果是令人震惊的。在标准的图形显卡(RTX 3070 Ti)上,原始方法处理单帧画面需要 84.0 秒。ImprovedVBGS 将所有场景的平均延迟降低到了 0.133 秒(大约每秒 7.5 帧)。虽然论文指出,如果不进行重分配的特定配置可以达到 0.050 秒,但维持高质量重建并处理重分配步骤的完整系统运行速度约为 7.5 fps。与原始方法相比,这实现了高达 1,680 倍 的加速。虽然旧方法对于移动中的机器人来说太慢了,但新方法已经显著加快,使其非常接近实时处理的能力,尽管可能仍比标准 30fps 视频稍慢。作者展示了尽管使用了这些大规模的速度优化技巧,3D 地图的质量依然保持在高水平,重建出的图像看起来与较慢的原始版本一样出色。他们在一组标准的 3D 场景(NeRF Synthetic 数据集)上进行了测试,发现新系统可以在不需要存储海量过去图像库的情况下处理工作负载,这使其非常适合机器人和内存受限的设备。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →