✨ 要点🔬 技术摘要
想象一下,你有一组从不同角度拍摄的房间照片。通常情况下,如果你想从这些照片创建一个 3D 模型,你有两种选择:
缓慢、完美的方法: 你花费数小时(甚至数天)手动调整 3D 模型,直到它看起来完美无瑕。这就像是用手雕刻一座雕像,一点点地凿去多余的部分。它很精确,但对于每一个新房间来说都太慢了。
快速、“扁平”的方法: 你使用一种智能 AI,它观察照片并瞬间生成一个 3D 模型。但这个模型通常只是一个涂了颜色的“皮肤”。它并不真正理解一个闪亮的球体是由金属制成的,或者一面墙是由粗糙的灰泥制成的。如果你尝试移动摄像机或改变光照,模型看起来会变得很奇怪或出现破绽。
InvSplat 是一种结合了第二种方法的快速特性与第一种方法深层理解能力的新方法。你可以把它想象成一个既拥有超快速度,又理解物理规律的即时 3D 雕塑家。
以下是它的工作原理,使用了几个日常类比:
1. “微型球体”构成的“魔法云”
InvSplat 不是用三角形来构建 3D 模型(像低多边形视频游戏角色那样),而是用数百万个微小的、隐形的 3D 云团 (称为高斯体/Gaussians)来构建场景。
想象一个充满雾气的房间,每一滴雾气都清楚地知道自己在哪里、有多大以及如何旋转。
在过去,这些“云团”只知道如何反射光线以呈现出一张图片。
InvSplat 的转折点: 现在的每一个微小云团都变得“聪明”了。它携带了一张包含特定属性的完整身份证:
反照率 (Albedo): 如果没有阴影,物体的颜色是什么?(比如红苹果的真实颜色)。
金属度 (Metallic): 它是像汽车一样闪亮,还是像岩石一样暗淡?
粗糙度 (Roughness): 它是像玻璃一样光滑,还是像砂纸一样凹凸不平?
几何形状 (Geometry): 它在哪里,以及是什么形状?
2. “一键式”配方
试图弄清楚这些属性(比如“这东西是不是闪亮的?”)的旧方法必须对每个场景进行缓慢的、分步的计算。这就像一位厨师在尝汤,加盐,再尝,然后重复一个小时的过程。
InvSplat 就像是一个高科技微波炉 。你放入照片(“食材”),按下按钮,它在 1.5 秒 内就能为你端出一顿烹饪完成的 3D 大餐。它不会反复试味;它利用一个庞大的知识库(经过数千个场景训练)来瞬间推测出配方。
3. 为什么“一致性”很重要
如果你看一张闪亮的勺子的照片,一个“扁平”的 AI 可能会把反射效果直接画在勺子上。但如果你移动头部,反射应该随之移动。扁平的 AI 在这里经常会产生混乱,让反射看起来像是一个不会正确移动的贴纸。
因为 InvS of Splat 构建的是一个真实的 3D 物体 ,拥有真实的材质,所以无论你站在哪里,反射和阴影都会表现得正确。
类比: 想象一幅镜子的平面绘画与一面真实的镜子。如果你走过绘画,绘画里的反射保持不变。如果你走过真实的镜子,反射会发生变化。InvSplat 构建的是“真实的镜子”,因此反射会随着你的移动自然更新。
4. “重光照”超能力
因为 AI 将材质 (物体是什么做的)与光照 (光从哪里来)分离开来,所以你可以做一些神奇的事情:重光照 (Relighting) 。
想象你拍了一张房间里开着台灯的照片。InvSplat 弄清楚了那面墙是“白色油漆”,而台灯是“明亮的黄色”。
一旦它知道了这些,你就可以告诉计算机:“好了,关掉那盏灯,打开一个蓝色的霓虹灯招牌。”
计算机会立即重新计算蓝色光线是如何照射在白色油漆上的,从而创造出一幅全新的、看起来符合物理真实的图像,而无需重新拍摄照片。
总结它的功能
输入: 几个具有已知相机位置的场景照片。
过程: 通过神经网络的一次快速处理(无需漫长等待)。
输出: 一个由“智能云团”组成的 3D 场景,这些云团知道自己的颜色、闪亮程度和粗糙度。
结果: 你可以游览这个 3D 场景,改变灯光,并实时看到真实的反射和阴影。
简而言之,InvSplat 是第一个能够通过几张照片,瞬间构建出一个你可以编辑和探索的物理准确的 3D 世界 的工具,它能在几秒钟内完成以往需要数小时甚至无法完成的任务。
技术摘要:InvSplat:逆向前馈场景高斯泼溅 (Inverse Feed-Forward Scene Splatting)
问题陈述
逆向渲染旨在从图像中恢复 3D 几何结构和具有物理意义的表面反射率,这是实现重光照、材质编辑和逼真 AR/VR 内容插入等应用的前提条件。现有方法在效率、物理可解释性和多视图一致性之间面临权衡:
基于优化的方法 (如 IRIS)能够实现高保真度,但需要昂贵的逐场景拟合计算,限制了其实用性。
基于学习的方法 (如 DiffusionRenderer, MVInverse)提供了更快的推理速度,但主要在图像空间内运行。它们缺乏显式的 3D 场景表示,导致多视图不一致,且无法支持鲁棒的新视角合成或具有物理基础的编辑。
前馈式 3D 重建方法 (如 pixelSplat, MVSplat)可以高效地生成显式的 3D 表示(如 3D 高斯),但侧重于合成 RGB 外观而非解耦内在材料属性(反照率、金属度、粗糙度)。它们往往无法重现锐利的镜面高光,也无法支持显式的重光照。
方法论
InvSplat 引入了一个前馈框架,能够通过单次前馈过程,直接从给定位姿的多视图图像中预测出具有内在材料属性的结构化 3D 高斯表示。
场景表示
场景由 M M M 个 3D 高斯原语表示。与使用球谐函数表示外观的标准 3DGS 不同,InvSplat 中的每个高斯 j j j 由以下参数化:
几何结构: 均值 (μ j \mu_j μ j )、旋转 (q j q_j q j )、缩放 (s j s_j s j )、不透明度 (σ j \sigma_j σ j ) 和表面法线 (n j n_j n j )。
内在材料: 漫反射反照率 (a j a_j a j )、金属度 (m j m_j m j ) 和粗糙度 (r j r_j r j )。
这实现了一种解耦的、具有物理基础的表示,其中照明与材料属性是分离的。
架构
该模型采用双分支前馈网络:
几何分支: 受 ReSplat 启发,使用 ResNet 主干提取多尺度特征。通过多视图几何编码器(Transformer)聚合跨视图信息,随后通过多视图特征匹配模块构建深度候选代价体积。
内在属性分支: 利用 DINOv2 ViT-L/14 主干对输入视图进行编码。通过一个 36 层的多视图内在转换器(Multi-view Intrinsic Translator)进行特征精炼,利用视图内和视图间的自注意力机制提取跨视图内在特征。
解码头: 两分支的特征由六个解码头进行处理:
深度: 通过结合特征的 DPT 头进行估计。
高斯参数: 使用 Point Transformer 对旋转、缩放和不透明度进行精炼,该模块根据预测的深度将 2D 特征提升到 3D 上下文中。
材料与法线: 通过 DPT 头预测反照率、金属度、粗糙度和法线。反照率预测包含指向高分辨率图像线索的跳跃连接。
反投影与渲染: 预测的深度图被反投影到 3D 空间以形成高斯中心。场景使用可微分高斯光栅化器进行渲染,生成反照率、金属度、粗糙度、法线和深度的图层。
训练
模型在 InteriorVerse 数据集上进行训练,结合了像素级和感知级损失:
材料监督: 用于反照率、金属度和粗糙度的 L 1 L_1 L 1 和 LPIPS 损失。
深度监督: 采用受 MoGe 启发的仿射不变损失以处理尺度歧义。
法线监督: 余弦相似度损失。 训练过程共同优化几何编码器、内在转换器和解码头。
核心贡献
首个前馈式逆向渲染框架: InvSplat 是第一个能够通过单次前向传播,从多视图图像中预测具有内在材料参数的物理基础 3D 高斯原语的方法,消除了对逐场景优化的需求。
统一的 3D 表示: 通过整合来自基于图像的材料估计和 3D 重建模型的先验知识,它能够生成高质量的 3D 材料属性,并对现实世界数据具有强大的泛化能力。
实现重光照与一致的新视角合成 (NVS): 解耦的 3D 高斯表示支持基于分解材料的新视角合成,从而实现物理基础的重光照以及在不同视角间保持一致的视角相关效应建模。
实验结果
实验在合成数据集(InteriorVerse, Structured3D)和真实世界数据集(RealEstate10K, DL3DV)上进行。
定量性能: 在 InteriorVerse 测试集上,InvSft 在反照率和法线的 PSNR、SSIM 和 LPIPS 方面达到了与 2D 基线(如 MVInverse)相当的性能,同时提供了显式的 3D 表示。
多视图一致性: 在 Structured3D 数据集上,InvSplat 展示了优于 2D 方法的跨视图一致性(较低的重投影 RMSE),特别是在处理金属度和粗糙度等挑战性属性时。
定性结果: 可视化结果显示,InvSplat 避免了将反射“烘焙”进反照率的问题,相比于容易在反射表面出现漂移的 2D 基线,它能产生更细粒度的细节并在视图间保持更一致的预测。
效率: 该方法实现重建仅需约 1.5 秒,支持实时渲染。
意义
本文声称 InvSplat 弥合了高效前馈推理与高保真逆向渲染之间的鸿沟。通过从图像空间的预测转向具有内在参数的显式 3D 高斯表示,该方法克服了以往基于学习的方法存在的多视图不一致问题,以及基于优化方法的计算瓶颈。这实现了瞬时的场景分解,为重光照和材质编辑等此前难以通过前馈模型实现的下游应用提供了便利。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。