想象一下,你正透过一个钥匙孔观察一个房间。你能看到沙发的前面、一张咖啡桌和一个台灯。但你看不见沙发的背面、桌子后面的墙,也看不见台灯底下的地板。大多数试图“观察”这个房间的计算机程序只能画出钥匙孔正对着的部分。如果它们试图猜测剩余的部分,往往会画出杂乱的、漂浮的点,或者在画面中留下巨大的空洞。
VolFill 是一款旨在解决这一问题的全新计算机程序。它不仅仅是在进行猜测,而是仅凭一张照片,就能构建出一个完整的、实心的整个房间的 3D 模型,包括那些你看不见的部分。
以下是它的工作原理,我们使用了一些简单的类比:
1. 问题所在:“像素对齐”陷阱
把目前大多数 3D 扫描器想象成一位画家,他只能在光线照射到的画布上绘画。如果你看一张椅子,他能完美地画出前腿,但后腿呢?他要么留白,要么尝试去猜,这往往会导致形状摇晃或破碎。他们被困在了“可见表面”上,无法想象物体的其余部分。
2. 解决方案:“隐形墨水”地图 (TUDF)
VolFill 并不尝试猜测单个点(就像一团尘埃),而是将房间视为一个由微小立方体组成的巨大 3D 网格,就像一大块果冻。
- 窍门: 它使用了一种特殊的地图,称为 TUDF。想象一下,这张地图就像一个“距离表面”的传感器。网格中的每一个立方体都准确地知道自己距离最近的墙壁、地板或家具有多远。
- 为什么有效: 即使一面墙被沙发挡住了,沙发背后的立方体仍然知道自己距离那面隐藏的墙有多远。这使得计算机能够完美地“填补”不可见的部分,创建一个连续且实心的形状,而不是散乱的点云。
3. 引擎:“智能压缩器”与“梦想家”
为了实现这一点,VolFill 使用两个协同工作的工具:
4. 指导者:“双重检查”系统
为了确保“梦想家”不会幻觉出奇怪的形状(比如一个悬浮的天花板),VolFill 使用了 双重约束 (Dual-Conditioning) 策略。它像是一个拥有两个证据来源的侦探:
- 照片: 它观察图像的高层“氛围”(这是一个厨房?还是一个卧室?)。
- 可见几何结构: 它使用一个预训练的“专家”(称为 MoGe2)来获取精确的可见部分地图。
- 类比: “梦想家”是艺术家,但“可见几何结构”是一位拿着尺子的严厉监工。监工会说:“你可以想象沙发的隐藏背面,但你必须确保它与我们能看到的正面完美连接。”这保持了隐藏部分的物理真实性。
5. 结果:一个坚实、干净的模型
当 VolFill 完成工作时,它给你的不是一团杂乱的点云。因为它使用了“距离地图”(TUDF)方法,它可以立即将该网格转化为平滑、实心的网格模型(类似于 3D 打印的物体)。
- 对比: 其他方法可能会给你一个看起来像一袋弹珠(嘈杂的点)的沙发,或者一个在后面带有幽灵般第二层的沙发(伪影)。VolFill 则会给你一个干净、锐利、实心的沙发,其隐藏的背面与正面一样平滑。
简而言之: VolFill 接收一张照片,将世界压缩成一个智能摘要,利用受严格几何规则引导的 AI “梦想家”来构想隐藏的部分,然后将其展开为一个完美的、实心的 3D 房间,包含了所有你看不到的一切。
技术摘要:VolFill:基于体积流匹配(Volumetric Flow Matching)的单视角非全视(Amodal)3D 场景重建
1. 问题定义
本文研究了从单张 RGB 图像进行非全视(amodal)3D 场景重建的挑战。与仅恢复可见表面(如深度图或点图)的传统像素对齐方法不同,其目标是预测观测视锥体内的完整 3D 几何结构,包括被前景物体遮挡的表面。
由于缺乏隐藏结构的视觉证据,这一任务本质上是病态的(ill-posed)。现有方法面临显著局限性:
- 像素对齐方法(如 MoGe2、DepthPro)仅限于可见表面,无法推断被遮挡区域。
- 基于优化的方法需要密集的多视图采集,且每个场景需要数小时的计算时间。
- 以物体为中心的生成模型难以处理复杂的无边界场景。
- 场景级非全视基线模型(如 LaRI、NOVA3R)由于使用非结构化表示或固定的射线层约束,往往会产生破碎的网格、分层伪影(“多重墙”效应)或嘈杂、破碎的点云。
2. 方法论
VolFill 是一个生成式框架,旨在从单幅图像中预测完整的**截断无符号距离函数(TUDF)**体素网格,而非依赖确定性回归。该架构由三个核心组件组成:
A. TUDF 表示
场景几何被表示为一个连续标量场 V(p),定义为到最近表面(包括被遮挡表面)的距离,并截断至最大值 τ。
- 无符号公式化:使用无符号距离函数是因为室内场景通常是非封闭的(例如单面墙),这使得有符号距离函数(SDF)在几何上具有歧义。
- 动态离散化:该方法采用视锥对齐的离散化策略,根据可见几何体的包围盒计算动态、各向同性的体素大小,确保网格聚焦于即时捕获的场景。
B. 混合 3D VAE
为了弥合高分辨率 TUDF 网格(2563)与生成建模所需的潜空间之间的差距,本文提出了一个 混合稀疏-稠密 3D VAE:
- 编码器:处理稀疏 TUDF 输入,利用稀疏 3D 卷积将网格压缩为紧凑的稠密潜空间(163×C)。
- 解码器:采用混合稠密-到-稀疏的解码调度:
- 稠密上采样:通过转置卷积将潜空间上采样至 643。
- 结构预测:一个二值占用头(occupancy head)预测掩码以使特征图稀疏化,丢弃空区域。
- 稀疏上采样:利用稀疏卷积将特征上采样至最终的 2563 分辨率。
- 损失函数:VAE 使用复合损失进行训练,包括针对活跃体素的 L1 距离、针对占用的 BCE 和 Dice 损失,以及针对潜空间正则化的 KL 散度。
C. 基于流匹配的扩散 Transformer (DiT)
生成核心是一个使用整流流匹配(rectified flow matching)目标进行训练的扩散 Transformer (DiT)。它学习将噪声传输到场景 TUDF 潜分布。
- 双重条件策略:为了确保鲁棒的泛化能力和物理合理性,DiT 受两个来源的约束:
- 全局几何先验:通过交叉注意力机制注入来自冻结几何基础模型(MoGe2)的特征,以提供高层级的空间上下文。
- 可见-潜空间补全(Visible-Latent Inpainting):将来自 MoGe2 的可见点图编码为“可见潜变量”(zvis),并通过零初始化 MLP 与噪声潜变量融合。这既将生成过程锚定在观测到的几何结构上,又引导了对遮挡区域的补全。
- 推理:模型使用欧拉步(Euler steps)集成从 t=0 到 t=1 学习到的 ODE,随后通过 VAE 解码生成最终的 TUDF 网格。
3. 核心贡献
- VolFill 框架:一种利用体积流匹配从单视角图像恢复完整场景级几何结构的生成式框架,超越了像素对齐的回归方法。
- 混合 3D VAE:一种能够将高分辨率 TUDF 网格高效压缩为紧凑潜空间的架构,有助于实现复杂非全视结构的细节重建。
- 双重条件策略:一种利用几何基础模型(MoGe2)整合高层图像 Token 与显式可见几何的新颖方法,将非全视推理锚定在观测数据之上。
4. 实验结果
该方法在 SCRREAM 和 NRGB-D 数据集上进行了评估,性能优于当前的基线模型(包括 LaRI、NOVA3R 以及以物体为中心的模型如 TRELLIS 和 TripoSG)。
- 定量性能:VolFill 在 Chamfer 距离(CD)和 F-score(FS)指标上达到了最先进的结果,特别是在遮挡和完整几何方面。在 SCRREAM 数据集上,其完整场景的 CD 为 3.03,FS0.02 为 54.83,显著优于 NOVA3R(CD 3.43, FS 45.12)和 LaRI(CD 5.19, FS 30.85)。
- 度量尺度:在度量尺度评估中,VolFill 在 F-score 上显著超过基线(44.90 对比 NOVA3R 的 22.23),证明了其忠实的度量尺度重建能力。
- 定性质量:视觉对比显示,VolFill 生成的几何结构锐利、高保真,且具有平滑、拓扑一致的网格。相比之下,LaRI 存在分层伪影和空洞,而 NOVA3R 则产生嘈杂、无结构的点散射。
- 消融实验:
- 混合 VAE 设计相比于纯稠密或纯稀疏解码器,在重建质量、延迟和内存使用之间提供了最佳平衡。
- 双重条件(结合 MoGe2 特征与可见潜变量)的表现明显优于单一条件策略。
- MoGe2 被确定为优于 DINOv2 或 VGGT 的条件模型,凸显了显式 3D 空间锚点相对于通用语义特征的重要性。
5. 意义与主张
本文声称 VolFill 通过将重建从确定性的像素对齐估计转向结构化的生成流形,为整体空间理解提供了坚实的理论基础。
- 结构化表示:通过预测 TUDF 网格而非无结构的点云,VolFill 支持通过等值面提取直接生成表面,从而产生清晰、无伪影的网格,无需进行复杂的后处理(如 Poisson 重建)。
- 可扩展性:体积化方法能很好地适应场景复杂度,并且不像基于射线的模型那样对可恢复的遮挡层数进行限制。
- 物理合理性:在缺乏视觉证据的欠定区域,受强几何先验引导的生成框架能够合成符合物理规律的补全结果。
局限性:作者承认,由于缺乏视觉证据,在未观测区域偶尔仍会出现微小空洞,且由于迭代生成过程的存在,推理速度(在 RTX 4090 上为 1.4s)仍慢于基于回归的基线模型。未来的工作建议通过增加模型容量和数据多样性来解决拓扑间隙问题。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。