← 最新论文
💻 computer science

VkSplat: High-Performance 3DGS Training in Vulkan Compute

本文提出了 VkSplat,这是首个完全基于 Vulkan 的 3D 高斯泼溅训练流程,在确保跨厂商 GPU 兼容性的同时,相较于 CUDA+PyTorch 基线实现了 3.3 倍加速和 33% 显存减少,并达到了最先进的性能。

原作者: Jingxiang Chen, Mohamed Ibrahim, Yang Liu

发布于 2026-05-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Jingxiang Chen, Mohamed Ibrahim, Yang Liu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图用数百万个微小的、发光的、毛茸茸的气球(称为“高斯”)来构建一个令人惊叹的、照片级真实的 3D 世界。这就是**3D 高斯泼溅(3DGS)**所做的事情。这是一种从照片创建 3D 场景的流行方法,但到目前为止,构建这些世界就像试图用一把缓慢、沉重的画笔来绘制杰作,而这把画笔只能在一种特定品牌的电脑(NVIDIA)上运行。

这篇论文介绍了VkSplat,一种新工具,它就像一把高速、通用的画笔。它能更快地构建这些 3D 世界,占用更少的内存,并且几乎可以在任何显卡上运行,而不仅仅是 NVIDIA 的。

以下是他们是如何做到的,用日常类比来解释:

1. 问题:“交通堵塞”与“排他性俱乐部”

  • 交通堵塞:在旧的方法中,计算机必须将每一个像素与每一个气球进行比对,以查看它们是否接触。这造成了巨大的交通堵塞,成千上万个工人(计算机线程)都试图同时写入同一个剪贴板,导致它们互相等待。
  • 排他性俱乐部:完成这项工作的最佳工具是用一种语言(CUDA)编写的,这种语言只能在 NVIDIA 显卡上运行。如果你拥有 AMD 或 Intel 显卡,你就会被拒之门外,或者不得不使用一个更慢、更笨拙的版本。

2. 解决方案:VkSplat 的“通用工具箱”

作者使用Vulkan构建了VkSplat,这是一种通用语言,能同样良好地与几乎所有显卡(NVIDIA、AMD、Intel 等)对话。他们不仅仅是翻译了旧代码,而是从头开始重建了引擎,使其极其高效。

3. 秘密配方(优化措施)

A. “完美地图”(图块剔除)

  • 旧方法:想象一位送货员检查街道上的每一栋房子,看看他们是否有包裹,即使那栋房子显然在城镇的另一边。这浪费了时间。
  • VkSplat 方法:他们使用一种“扫描线”方法。就像在气球周围画一个完美、紧密的方框,只检查方框实际接触到的房子。他们通过数学计算得出结果,确保零错误(不检查不存在的房子,也不遗漏存在的房子)。这在交通堵塞发生之前就阻止了它。

B. “智能团队领导”(自适应调度)

  • 旧方法:想象一个工厂,每个工人被分配固定数量的任务,而不管实际上有多少任务在等待。一些工人闲置,而另一些则不堪重负。
  • VkSplat 方法:他们使用一位“智能团队领导”来监视工作队列。如果某个特定区域有很多气球,领导就会分配更多工人到那个位置。如果很少,就分配较少的人。他们甚至采用了一种“赌徒策略”(Thompson 采样),在训练期间尝试不同的工作调度,以找到针对该特定场景完成工作的绝对最快方式。

C. “一站式商店”(融合操作)

  • 旧方法:想象一位厨师切菜,把菜放进碗里,走到冰箱拿香料,走回来,混合它们,然后走到炉灶。这涉及大量的走动(将数据移入和移出内存)。
  • VkSplat 方法:他们建立了一个厨房,切菜、混合和烹饪都在一个单一的动作中完成。他们将“相机数学”(投影)和“学习步骤”(优化器)合并为一个单一步骤。这意味着数据永远不必离开“厨房台面”(内存),节省了巨大的时间和空间。

D. “智能排序”(32 位排序)

  • 旧方法:对数百万个项目进行排序通常需要为每个项目写下非常长、详细的地址(64 位数字)。
  • VkSplat 方法:他们意识到可以使用更短、更聪明的地址(32 位数字),这些地址仍然能保持所有项目的正确顺序。这就像使用邮政编码而不是完整的街道地址来分拣邮件——它更快,占用空间更少,且不会损失准确性。

4. 结果:更快、更精简、更通用

该论文在 NVIDIA RTX 3090 显卡上将这种新工具与当前的黄金标准(GSplat)进行了测试:

  • 速度:它快了3.3 倍。如果旧方法需要 23 分钟,VkSplat 大约需要 7 分钟。
  • 内存:它使用了33% 更少的视频内存(VRAM)。这就像把一辆巨大的搬家卡车塞进一辆紧凑型汽车里。
  • 质量:最终的 3D 图像看起来与高质量标准完全相同。
  • 兼容性:他们在AMD显卡(Radeon RX 7800 XT)上进行了测试。它成功了!虽然在 NVIDIA 上运行得更快(由于数据移动方式的硬件差异),但它证明了该工具可以在不同品牌之间工作,打破了“仅限 NVIDIA"的壁垒。

总结

VkSplat是一个新的、高度优化的引擎,用于创建 3D 世界。它用快速、通用且高效的系统取代了过去缓慢、排他且占用大量内存的方法。这就像从只能在鹅卵石上运行的马车升级到了可以在任何轨道上运行的高速列车,让你在携带更少行李的同时,以三倍的速度到达目的地。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →