Generalizable Sparse-View 3D Reconstruction from Unconstrained Images
GenWildSplat 是一种新颖的前馈框架,它通过利用学习到的几何先验、用于光照调节的外观适配器以及用于处理瞬态遮挡的语义分割,实现了从稀疏、无位姿的户外图像中进行无需逐场景优化的实时三维重建,并达到了最先进水平。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你拥有几张由不同游客在不同日期拍摄的著名地标的模糊随机快照。有些照片阳光明媚,有些阴云密布,还有些照片中有人或车正从建筑物前走过。你的目标是构建该建筑的完美 3D 数字孪生体,你可以围绕它行走、改变一天中的时间,并将游客从画面中移除。
通常,这样做就像试图解决一个巨大的 3D 拼图:你需要花费数小时(甚至数天)盯着碎片,试图弄清楚它们如何拼接,然后手动涂抹掉游客。如果你只有几张照片,这个拼图往往会分崩离析。
GenWildSplat 是一款全新的“魔法相机”,它能在 3 秒 内解决这个拼图,无需任何人工操作。以下是其工作原理,使用简单的类比来说明:
1. “通用翻译器”(泛化能力)
大多数以前的 3D 工具就像一个只死记硬背了某一次特定考试答案的学生。如果你给他们一个略有不同的问题(一座新建筑或不同的光照),他们就会卡住。
GenWildSplat 则像一位掌握了数千种语言的语言学家。它是在海量的合成(计算机生成)场景库上训练的。因为它学习了光线如何照射建筑物以及物体从不同角度看起来是怎样的“语法”,所以它能够瞬间理解一个它从未见过的、全新的、杂乱的现实世界场景。它不需要“学习”新场景;它只需识别模式即可。
2. “穿越时空的摄影师”(外观控制)
想象你有一张正午拍摄的建筑照片,但你想看看它在日落时是什么样子。
- 旧方法:它们试图逐像素地重绘整个建筑,往往导致画面看起来怪异或模糊。
- GenWildSplat:它将建筑与光线分离开来。把建筑想象成一个白色人体模型,把光线想象成一束彩色聚光灯。GenWildSplat 首先构建白色人体模型(即 3D 形状),然后它拥有一个特殊的“灯光开关”(外观适配器),可以瞬间改变聚光灯的颜色以匹配你想要的任何时间,而无需改变建筑的形状。
3. “幽灵消除器”(遮挡处理)
在你的游客照片中,经常有人或车遮挡了建筑物的部分区域。
- 旧方法:它们试图猜测人后面是什么,常常感到困惑,并在 3D 模型中产生“幽灵”或漂浮的伪影。
- GenWildSplat:它使用一个智能的“保安”(一个预训练的分割网络),能瞬间识别人和车。它给它们贴上“请勿触碰”的标签。在构建 3D 模型时,系统完全忽略这些移动物体,确保最终的 3D 建筑干净、坚实,没有幽灵。
4. “训练营”(课程学习)
你可能会问:“它如何能如此迅速地学会所有这些?”
论文解释说,他们为 AI 设计了一个三步训练营:
- 第一级:它学习处理单个完美计算机生成场景中的不同光照(没有人,只有光照变化)。
- 第二级:它学习识别许多不同的建筑和环境。
- 第三级:它学习忽略计算机生成场景中的“幽灵”(人和车)。
通过按此顺序学习,AI 不会感到不知所措。它先学习基础,然后增加复杂性,使其能够瞬间处理杂乱的现实世界照片。
结果
仅需 3 秒,GenWildSplat 就能将 2 到 6 张杂乱无章的照片转化为高质量的 3D 模型。你可以:
- 从你原本没有照片的角度围绕建筑行走。
- 将光照从明亮的正午变为金色的日落。
- 移除挡路的游客和车辆。
这一切都无需为每个特定场景花费数小时进行优化或微调模型。这是一个“一次成型”的解决方案,适用于你抛给它的几乎任何户外场景。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。