← 最新论文
💻 computer science

One View Is Enough! Monocular Training for In-the-Wild Novel View Generation

该论文提出了 OVIE 模型,通过利用单目深度估计器作为训练时的几何脚手架并结合掩码训练策略,实现了仅使用 3000 万张无配对网络图像进行训练,从而在无需深度估计器或 3D 表示的情况下,实现了零-shot 设置下性能超越现有方法且速度快 600 倍的野外单目新视图生成。

原作者: Adrien Ramanana Rahary, Nicolas Dufour, Patrick Perez, David Picard

发布于 2026-03-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Adrien Ramanana Rahary, Nicolas Dufour, Patrick Perez, David Picard

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 OVIE 的新技术,它的核心思想非常大胆且简单:“一张照片就够了!”

以前,如果你想让电脑根据一张照片“脑补”出从其他角度看到的画面(比如你拍了一张房子的照片,想让电脑生成你走到房子侧面看到的画面),电脑通常需要很多张从不同角度拍摄的照片作为“老师”来教它。这就像学画画,以前老师必须给你看一堆参考图,你才能学会怎么画侧面。

但 OVIE 说:不需要那么多参考图,一张图就足够了。

下面我用几个生活中的比喻来解释它是如何做到的:

1. 核心魔法:用“深度眼镜”当临时拐杖

想象一下,你只有一张平面的照片(比如一张风景照)。

  • 以前的做法:需要很多张照片来拼凑出 3D 模型。
  • OVIE 的做法:它戴上了一副现成的“深度眼镜”(这是一个已经训练好的深度估计 AI)。
    • 当 OVIE 看到这张照片时,它先让这副眼镜帮它把照片“变厚”,想象出照片里每个物体离镜头有多远,从而在脑海里构建出一个粗糙的 3D 模型(点云)。
    • 然后,它在脑海里把这个 3D 模型“转个身”,模拟走到旁边去看的视角。
    • 最后,它把这个转好身的 3D 模型“拍”成一张新照片。

关键点来了:这张新照片(我们叫它“伪目标”)并不完美。因为原来的照片是平面的,转个身后,有些原本被挡住的地方(比如桌子底下)现在露出来了,但原来的照片里并没有这些信息,所以新照片上会有“空洞”或“马赛克”。

2. 聪明的“填空题”老师

既然新照片有漏洞,怎么训练 AI 呢?
OVIE 发明了一种聪明的训练方法:

  • 只学看得见的地方:在训练时,AI 只对比那些“有内容”的地方。如果新照片上某个地方是“空洞”的(因为原图没拍到),AI 就忽略那里,不强迫它去猜。
  • 只学纹理和感觉:对于那些看不见的地方(比如桌子底下露出的地板),AI 会学习“这种地板通常长什么样”,而不是死记硬背具体的像素。它通过一种“对抗训练”(就像让 AI 和裁判玩捉迷藏),让 AI 学会画出逼真的纹理,哪怕那里原本没有数据。

比喻:这就像你让一个画家临摹一张照片,然后让他想象自己走到旁边去画。如果画到被遮挡的墙根,画家不知道墙根长啥样,但他知道“墙根通常是灰色的”,于是他就凭经验填上灰色。OVIE 就是在这个过程中,学会了如何“凭经验”填补空白,而且填得非常逼真。

3. 为什么它这么厉害?

  • 海量“野”数据:以前的方法需要专门拍摄的、排列整齐的多角度照片(就像教科书里的标准图)。OVIE 直接在互联网上抓取了 3000 万张 乱七八糟的照片(有室内的、室外的、甚至画作的)。它不需要这些照片是成对出现的,只要有一张图,它就能自己生成“练习题”。
  • 不用 3D 建模,速度极快
    • 以前的方法在生成新视角时,往往需要先构建复杂的 3D 模型,再渲染,这很慢,就像用泥巴捏个模型再拍照。
    • OVIE 在“考试”(实际应用)时,完全不需要 那个“深度眼镜”,也不需要构建 3D 模型。它就像是一个经验丰富的老画家,看一眼照片,脑子里直接“唰”地一下画出新视角。
    • 速度对比:它比目前第二快的方法快 600 倍!这意味着它可以实现实时互动。你拿着手机拍张照,就能像在玩游戏一样,随意拖动鼠标,360 度无死角地“走进”照片里。

4. 它能做什么?

  • 老照片复活:给一张历史建筑的老照片,让你能“走”进去看看侧面。
  • 艺术创作:给一幅油画,让你能换个角度欣赏画中的世界。
  • 机器人导航:机器人只看到障碍物的一面,就能脑补出绕过障碍物的路径。

总结

OVIE 就像是一个拥有超强空间想象力的天才画家
以前,要教它画画,必须给它看一堆参考图(多视图数据)。
现在,OVIE 学会了自己给自己出题:它利用现有的深度技术把照片“立”起来,自己转个身,虽然转出来的图有瑕疵,但它通过观察海量的互联网图片,学会了如何完美地修补这些瑕疵。

最终,它不需要任何辅助工具,就能单凭一张照片,瞬间生成任何角度的逼真画面,而且速度快到可以实时互动。这标志着我们离“从单张照片理解整个 3D 世界”的目标又近了一大步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →