← 最新论文
💻 computer science

Difix3D-W: Distractor-Free Few-Shot 3D Gaussian Splatting in the Wild

Difix3D-W 是一种专为不受限真实场景设计的创新型少样本 3D 高斯泼溅(3D Gaussian Splatting)框架,它通过利用重新设计的扩散模型进行参考引导的视图细化、一种稀疏感知的高斯复制策略以及基于 LoRA 的正则化,在有效处理干扰物、遮挡和稀疏视角的同时,实现了高质量的渲染。

原作者: Wongi Park, Jordan A. James, Myeongseok Nam, Minjae Lee, Soomok Lee, Sang-Hyun Lee, William J. Beksi

发布于 2026-07-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Wongi Park, Jordan A. James, Myeongseok Nam, Minjae Lee, Soomok Lee, Sang-Hyun Lee, William J. Beksi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你想要构建一个繁忙城市街道的完美 3D 全息图,但你手里只有游客拍摄的几张模糊且随机的照片。有些照片里有人走过镜头,有些照片里有汽车驶过,而且光影也会随之变化。

这就是 Difix3D-W 所解决的问题。它是一个全新的计算机程序,可以将极少数、杂乱无章的真实世界照片,转化为高质量的 3D 虚拟场景,即使这些照片充满了“干扰因素”(比如移动的人或车)并且缺失了大量信息。

以下是它的工作原理,通过简单的概念进行拆解:

1. 问题所在:“缺失碎片”的拼图游戏

通常情况下,为了构建一个 3D 模型,计算机需要从各个角度拍摄数百张照片。如果你只有极少数的照片(即“稀疏”数据集),计算机就会感到困惑。它不知道物体后面是什么,也难以确定场景的形状。

此外,现实世界的照片是非常凌乱的。它们含有干扰物(distractors)——即那些会移动或变化的物体,比如走过画面的行人或飞过的鸟。如果计算机试图将这些移动的物体包含在 3D 模型中,最终的结果看起来就像是一个充满故障、损坏严重的混乱体。

2. 解决方案:一个“神奇编辑器”和一个“复制粘贴”策略

作者创造了 Difix3D-W,它利用两个主要技巧来解决这些问题:

技巧 A:“参考引导编辑器”(修复故障)

想象你正在画一幅公园的画,但你的画笔总是会把一只飞过画布的鸟也涂抹进去。

  • 旧方法: 你试图把鸟涂掉,但你不知道鸟下方的公园原本长什么样,所以你只能靠猜测。
  • Difix3D-W 的方法: 该程序充当了一个智能编辑器。它观察你的凌乱绘画(3D 渲染图),并将其与一张从略微不同角度拍摄的“参考”照片进行对比,而那张照片里并没有那只鸟。
  • 掩模(The Mask): 它使用一种特殊的工具(称为“瞬态掩模/transient mask”)来精确标出鸟的位置。然后它会说:“好的,忽略这个位置的鸟。观察参考照片,看看树木在鸟后真实的模样,然后把它复制到你的画作中。”
  • 结果: 它能瞬间清理 3D 模型,移除移动的人群,并在填补空隙时使用正确的背景细节,且无需从头开始重新训练整个系统。

技巧 B:“感知稀疏性的复制粘贴”(填补空洞)

想象你正在用砖块(计算机称之为“高斯/Gaussians”)砌一面墙,但你手里的砖块很少,导致墙上留下了巨大的空洞。

  • 旧方法: 计算机试图拉伸现有的少量砖块以覆盖整面墙。这会让墙看起来模糊且脆弱。
  • Difix3D-W 的方法: 程序会观察墙面并找到空缺处。它不再只是拉伸现有的砖块,而是智能地在稀疏区域复制砖块。
  • 秘诀所在: 它并不会随机复制。它会观察现有砖块的“不透明度”(即实心程度)。如果某个区域是透明的(稀疏的),它就会在那里添加更多砖块以使墙面变得坚实。这确保了即使原始照片拍摄的角度非常少,3D 模型依然能够保持密集且细节丰富。

3. 保持一致性

当你对一个拥有如此多移动部件的 3D 模型进行修复时,很容易让计算机产生混乱,导致场景看起来很诡异(比如像是在“融化”的脸部)。

  • 作者使用了名为 LoRA(低秩自适应/Low-Rank Adaptation)的技术。你可以把它理解为一个“微调”旋钮。它允许计算机对 3D 模型进行细微且精准的调整,以确保建筑物的左侧与右侧相匹配,从而保持整个场景的稳定与真实。

为什么这很重要(根据论文所述)

论文指出,以往的方法要么需要数百张照片(这需要漫长的收集时间),要么在面对现实世界的干扰时会彻底失效。

Difix3D-W 是首个能够成功利用稀疏(数量极少)且不受限(杂乱、真实世界)的照片,并将其转化为高质量 3D 场景的方法。它比以往的方法更快,且能产生更清晰的结果,实际上让你仅凭几张快照就能构建出 3D 世界,即便照片中有行人和车辆在移动。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →