想象一下,你正在观看一段从厨房另一侧拍摄的人在烹饪的视频。你可以看到整个场景:炉灶、柜台以及厨师的动作。现在,想象一下你能够瞬间切换视角,精准地看到厨师所看到的景象,仿佛你正戴着他们的眼睛。这种将第三人称视角转化为第一人称视角的能力,是名为“外中心向内中心视频生成”(exocentric-to-egocentric video generation)这一全新科学研究领域的目标。这是为了构建能够通过观察人类视频进行学习的机器人,以及创造沉浸式虚拟现实体验(让用户能够从他人的视角重温时刻)而迈出的关键一步。然而,将从外部拍摄的视频转变为内部视角是非常困难的。标准的计算机视觉工具虽然在改变静态场景的角度方面表现良好,但在处理此类问题时往往会失效。当摄像机从宽阔视角移动到特写镜头时,计算机很难猜测被物体遮挡的部分,或者场景从完全不同的角度看过去应该是怎样的,这往往会导致图像出现扭曲、模糊或缺失的部分。
NVIDIA 的一个研究团队开发了一种名为 Grounded-Exo2Ego 的新系统来解决这个问题。该系统并没有依赖于那些试图在外部视角和内部视角之间强行进行几何拟合的常规方法,而是构建了一个既能理解房间形状,又能理解其中特定物体的框架。研究人员发现,以往的尝试之所以失败,是因为计算机对房间 3D 形状的最佳推测往往是错误的,尤其是对于原始摄像机无法看到的场景部分。当计算机试图使用这些有缺陷的 3D 地图来生成新视角时,生成的视频会出现漏洞百出和表面扭曲的问题。为了修复这一点,新系统采用了双分支方法。其中一个分支作为结构引导,利用场景的粗略 3D 地图来告诉计算机墙壁和地板应该在哪里。第二个分支则是核心创新点,它作为语义引导。它识别视频中的特定物体,例如人、自行车或烹饪锅,并告诉计算机这些物体应该长什么样以及它们应该位于何处,即使 3D 地图是不完整或破碎的。
研究人员还发现了一个在这些系统训练过程中存在的隐藏缺陷。在现实世界中,人佩戴的摄像机与计算机对房间进行的 3D 重建并不完全匹配。这种不匹配意味着,当计算机尝试从真实视频数据中学习时,它本质上是在尝试从一张与它试图模仿的现实并不一致的扭曲地图中学习。为了解决这个问题,团队创建了一个新的流程,在训练开始前,将摄像机的位置重新对齐到计算机那并不完美的 3D 地图中。这确保了计算机是从一个一致的图像中进行学习。此外,为了给系统提供完美的学习范例,他们构建了一个全自动引擎,用于生成数千个合成视频。在这些计算机生成的虚拟世界中,他们放置了各种房间里的动画 3D 角色,并从外部和内部两个视角进行记录,为模型提供了现实世界的摄像机难以轻易捕捉到的完美数据。