← 最新论文
💻 computer science

InvSplat: Inverse Feed-Forward Scene Splatting

InvSplat 是一个前馈式多视图重建框架,它直接预测具有内在材质属性的结构化 3D 高斯表示,从而在单次前馈过程中实现基于物理的逆向渲染、准确的材质恢复以及稳定的新视角合成。

原作者: Polina Karpikova, Wenjing Bian, Haofei Xu, Hendrik Lensch, Andreas Geiger

发布于 2026-07-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Polina Karpikova, Wenjing Bian, Haofei Xu, Hendrik Lensch, Andreas Geiger

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一组从不同角度拍摄的房间照片。通常情况下,如果你想从这些照片创建一个 3D 模型,你有两种选择:

  1. 缓慢、完美的方法: 你花费数小时(甚至数天)手动调整 3D 模型,直到它看起来完美无瑕。这就像是用手雕刻一座雕像,一点点地凿去多余的部分。它很精确,但对于每一个新房间来说都太慢了。
  2. 快速、“扁平”的方法: 你使用一种智能 AI,它观察照片并瞬间生成一个 3D 模型。但这个模型通常只是一个涂了颜色的“皮肤”。它并不真正理解一个闪亮的球体是由金属制成的,或者一面墙是由粗糙的灰泥制成的。如果你尝试移动摄像机或改变光照,模型看起来会变得很奇怪或出现破绽。

InvSplat 是一种结合了第二种方法的快速特性与第一种方法深层理解能力的新方法。你可以把它想象成一个既拥有超快速度,又理解物理规律的即时 3D 雕塑家。

以下是它的工作原理,使用了几个日常类比:

1. “微型球体”构成的“魔法云”

InvSplat 不是用三角形来构建 3D 模型(像低多边形视频游戏角色那样),而是用数百万个微小的、隐形的 3D 云团(称为高斯体/Gaussians)来构建场景。

  • 想象一个充满雾气的房间,每一滴雾气都清楚地知道自己在哪里、有多大以及如何旋转。
  • 在过去,这些“云团”只知道如何反射光线以呈现出一张图片。
  • InvSplat 的转折点: 现在的每一个微小云团都变得“聪明”了。它携带了一张包含特定属性的完整身份证:
    • 反照率 (Albedo): 如果没有阴影,物体的颜色是什么?(比如红苹果的真实颜色)。
    • 金属度 (Metallic): 它是像汽车一样闪亮,还是像岩石一样暗淡?
    • 粗糙度 (Roughness): 它是像玻璃一样光滑,还是像砂纸一样凹凸不平?
    • 几何形状 (Geometry): 它在哪里,以及是什么形状?

2. “一键式”配方

试图弄清楚这些属性(比如“这东西是不是闪亮的?”)的旧方法必须对每个场景进行缓慢的、分步的计算。这就像一位厨师在尝汤,加盐,再尝,然后重复一个小时的过程。

InvSplat 就像是一个高科技微波炉。你放入照片(“食材”),按下按钮,它在 1.5 秒内就能为你端出一顿烹饪完成的 3D 大餐。它不会反复试味;它利用一个庞大的知识库(经过数千个场景训练)来瞬间推测出配方。

3. 为什么“一致性”很重要

如果你看一张闪亮的勺子的照片,一个“扁平”的 AI 可能会把反射效果直接画在勺子上。但如果你移动头部,反射应该随之移动。扁平的 AI 在这里经常会产生混乱,让反射看起来像是一个不会正确移动的贴纸。

因为 InvS of Splat 构建的是一个真实的 3D 物体,拥有真实的材质,所以无论你站在哪里,反射和阴影都会表现得正确。

  • 类比: 想象一幅镜子的平面绘画与一面真实的镜子。如果你走过绘画,绘画里的反射保持不变。如果你走过真实的镜子,反射会发生变化。InvSplat 构建的是“真实的镜子”,因此反射会随着你的移动自然更新。

4. “重光照”超能力

因为 AI 将材质(物体是什么做的)与光照(光从哪里来)分离开来,所以你可以做一些神奇的事情:重光照 (Relighting)

  • 想象你拍了一张房间里开着台灯的照片。InvSplat 弄清楚了那面墙是“白色油漆”,而台灯是“明亮的黄色”。
  • 一旦它知道了这些,你就可以告诉计算机:“好了,关掉那盏灯,打开一个蓝色的霓虹灯招牌。”
  • 计算机会立即重新计算蓝色光线是如何照射在白色油漆上的,从而创造出一幅全新的、看起来符合物理真实的图像,而无需重新拍摄照片。

总结它的功能

  • 输入: 几个具有已知相机位置的场景照片。
  • 过程: 通过神经网络的一次快速处理(无需漫长等待)。
  • 输出: 一个由“智能云团”组成的 3D 场景,这些云团知道自己的颜色、闪亮程度和粗糙度。
  • 结果: 你可以游览这个 3D 场景,改变灯光,并实时看到真实的反射和阴影。

简而言之,InvSplat 是第一个能够通过几张照片,瞬间构建出一个你可以编辑和探索的物理准确的 3D 世界的工具,它能在几秒钟内完成以往需要数小时甚至无法完成的任务。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →