← 最新论文
💻 computer science

UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models

UniWorld-View 是一个将显式遮挡感知 3D 指导与视频扩散模型相结合的统一框架,旨在通过稀疏单目输入实现高保真、几何一致且精确可控的大基线新视角合成。

原作者: Haiyang Zhou, Wangbo Yu, Chaoran Feng, Xunyu Zhou, Yonghong Tian, Li Yuan

发布于 2026-08-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Haiyang Zhou, Wangbo Yu, Chaoran Feng, Xunyu Zhou, Yonghong Tian, Li Yuan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正拿着一部智能手机,一边走动一边快速拍摄客厅的视频。现在,想象一个魔术:你可以瞬间将这段视频“传送”到一个完全不同的角度——比如,漂浮在天花板附近,或者从一个你从未拍摄过的窗户缝隙中窥视——并以完美的清晰度看到那个新位置的房间。这就是“新视角合成”(novel view synthesis)的梦想,这是一个试图教会机器如何从扁平的 2D 图像理解 3D 空间的计算机科学领域。长期以来,计算机在这方面表现得很糟糕。如果你要求它们猜出照片中椅子后面是什么,它们经常会猜错,产生奇怪的、拉伸变形的色块或不可见的空洞。它们要么需要从每个角度拍摄数百张照片(这既枯燥又难以实现),要么尝试去“幻觉”出缺失的部分,而这往往会导致几何形状的噩梦,让墙壁像橡胶一样弯曲。但如果我们能结合两者的优点呢:既有严格的几何规则(让墙壁保持笔直),又有现代 AI 的创造力(让缺失的部分看起来真实)?这正是研究人员正在解决的大问题,旨在让虚拟现实、游戏和社交媒体变得真正具有沉浸感。

于是有了 UniWorld-View,这是由北京大学和 Rabbitpre AI 的研究人员开发的一种新方法,它就像是这些 3D 电影的超级聪明导演。它们解决的核心问题是,当你试图从一个与拍摄角度非常不同的角度观察场景时会发生什么。这就像是试图绘制一张你只在某个街角见过一次的城市地图。如果你试图猜测建筑物的另一侧是什么,你可能会不小心把建筑物的正门画在后墙上,或者把一棵树横跨在天空中。之前的 AI 方法经常会出现这些“撕裂”错误,因为它们不知道哪些部分是被遮挡的(occluded),哪些是可见的。

UniWorld-View 通过一种巧妙的两步策略解决了这个问题。首先,它从你的视频中构建一个粗略的 3D“点云”(代表场景的一团数字点)。但它不仅仅是将这些点投影到新屏幕上,而是使用了一种“三重重投影”(triple-reprojection)技巧。想象一下,先拍一张影子的照片,再拍一张那个影子反射的照片,最后通过比较这两者来确定物体后面究竟隐藏了什么。这使得 AI 能够创建一个完美的“掩模”(mask),准确地告诉它哪些像素是真实的,哪些只是空的洞。它还会检查“法线”(即表面所面向的方向),以确保不会意外显示出墙壁的背面。

一旦 AI 有了这张关于“那里应该有什么”的干净且符合几何学准确性的地图,它就会使用强大的“视频扩散模型”(一种通过将噪声逐渐转化为清晰图像来生成视频的 AI 类型)来填补空白。但关键在于:它并不只是在瞎猜。它使用了一个“双流”(dual-stream)系统。一条流观察几何地图,以确保摄像机按照你的意图精确移动;另一条流观察原始视频,以复制纹理和颜色。这确保了当你移动摄像机到新位置时,物体保持稳固,光影看起来真实,而不是融化成一滩像素汤。

研究人员在“WorldScore”基准测试上对它进行了测试,这是一个衡量 AI 控制摄像机运动和保持 3D 场景一致性的严苛测试。UniWorld-View 在“静态”场景中得分最高(85.53),并在动态场景中排名第二,击败了其他顶尖模型。它还展示了无需针对特定场景进行重新训练即可从单个视频生成高质量新视角的能力(零样本学习)。简而言之,UniWorld-View 教会了 AI 如何在尊重物理和几何规则的同时,依然具备想象幕布后景象的创造力,为更真实的虚拟世界铺平了道路——在这些世界里,即使原始视频只是一个快速的自拍,你也可以自由地环顾四周。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →