想象一下,你正试图画一幅巨大的三维杰作,但你却被困在一个只有一个小书桌、没有任何架子的房间里。在计算机图形学的世界中,这就是“渲染”所面临的挑战:将一个数字化的 3D 场景转化为你在屏幕上能看到的平面图像。多年来,实现这一目标的标准方式就像雇佣一支庞大的工人军队(称为 GPU),他们可以根据需要,从一个巨大的共享仓库(称为 DRAM)中抓取绘画的任何部分。这种方式运行速度很快,但非常耗能,因为工人们大部分时间都花在往返于仓库之间,而不是在真正地画画。
这篇论文说“可以,但有一些有趣的规则”。作者使用了一种特殊的处理器,称为 IPU(智能处理单元),它就像是一个由 1,472 个微小的、独立的办公桌组成的网格,每个办公桌都有自己的小型存储盒(SRAM),并且没有连接到巨大的仓库。他们尝试在这个网格上运行 3D 高斯绘画过程。他们并没有让云团在任何地方漂浮,而是发明了一种系统,让云团在办公桌之间物理性地跳跃,就像在网格中玩“传热豆”(hot potato)游戏一样,不断传递,直到它们到达负责绘制该部分图像的特定办公桌。
结果既有奇迹,也有现实的检验。团队发现,对于变化不太剧烈的场景,这种“无仓库”的方法表现得惊人地好,生成的图像看起来与标准方法几乎一模一样。它消耗的功率要低得多,这对于机器人或眼镜等电池驱动的设备来说非常棒。然而,论文也揭示了系统的裂痕。当摄像机放大到场景中非常密集、拥挤的部分时,“传热豆”游戏就会发生堵塞。办公桌传递云团的速度跟不上,导致一些云团被丢弃,从而在最终的图像中留下小小的矩形空洞。作者指出,虽然这目前还不是现有计算机的完美替代品,但它证明了我们并不需要一个巨大的仓库来渲染 3D 场景。它表明,如果我们设计软件时能够尊重这些微型处理器的“邻里”特性——即只在必要时移动数据,并保持数据的近距离——我们就能构建出更高效、更省电的 3D 视觉观察方式。
技术摘要:在图处理器上渲染 3D 高斯体
问题陈述
3D 高斯泼溅(3DGS)已成为实现实时新视角合成的主流方法,具有照片级的渲染效果和完全的可微性。然而,目前的实现高度针对 GPU 架构进行了优化,这些架构依赖于大型片外 DRAM、高内存带宽和全局地址空间。在 GPU 上,3DGS 渲染受限于内存带宽;其主要成本是高斯数据在内存层级(从 DRAM 加载到共享内存)中的重复移动,而非算术计算。
这种对全局内存访问的依赖对于新兴的资源受限平台(如 AR 眼镜和移动机器人)而言效率低下,因为这些平台更倾向于使用仅包含局部内存的“传感器端”计算。本文旨在解决将 3DGS 适配到一种无 DRAM 架构的挑战,这种架构缺乏全局地址空间和随机访问内存,迫使数据移动必须是显式且局部的。