← 最新论文
💻 computer science

Grounded-Exo2Ego: Structured Semantic Grounding for Robust Exocentric-to-Egocentric Video Generation

本文介绍了 Grounded-Exo2E2E,这是一个双分支视频扩散框架,它通过结合几何锚定、一种新型语义接地分支以及一种相机重定位算法,能够从外视角输入鲁棒地生成第一视角视频,并通过改进的架构和全自动合成数据生成,在 EgoExo4D 数据集上实现了最先进的性能。

原作者: Shengze Wang, Michael Stengel, Tianye Li, Seonwook Park, Amrita Mazumdar, Koki Nagano, Alex Trevithick, Shalini De Mello

发布于 2026-08-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Shengze Wang, Michael Stengel, Tianye Li, Seonwook Park, Amrita Mazumdar, Koki Nagano, Alex Trevithick, Shalini De Mello

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在观看一段从厨房另一侧拍摄的人在烹饪的视频。你可以看到整个场景:炉灶、柜台以及厨师的动作。现在,想象一下你能够瞬间切换视角,精准地看到厨师所看到的景象,仿佛你正戴着他们的眼睛。这种将第三人称视角转化为第一人称视角的能力,是名为“外中心向内中心视频生成”(exocentric-to-egocentric video generation)这一全新科学研究领域的目标。这是为了构建能够通过观察人类视频进行学习的机器人,以及创造沉浸式虚拟现实体验(让用户能够从他人的视角重温时刻)而迈出的关键一步。然而,将从外部拍摄的视频转变为内部视角是非常困难的。标准的计算机视觉工具虽然在改变静态场景的角度方面表现良好,但在处理此类问题时往往会失效。当摄像机从宽阔视角移动到特写镜头时,计算机很难猜测被物体遮挡的部分,或者场景从完全不同的角度看过去应该是怎样的,这往往会导致图像出现扭曲、模糊或缺失的部分。

NVIDIA 的一个研究团队开发了一种名为 Grounded-Exo2Ego 的新系统来解决这个问题。该系统并没有依赖于那些试图在外部视角和内部视角之间强行进行几何拟合的常规方法,而是构建了一个既能理解房间形状,又能理解其中特定物体的框架。研究人员发现,以往的尝试之所以失败,是因为计算机对房间 3D 形状的最佳推测往往是错误的,尤其是对于原始摄像机无法看到的场景部分。当计算机试图使用这些有缺陷的 3D 地图来生成新视角时,生成的视频会出现漏洞百出和表面扭曲的问题。为了修复这一点,新系统采用了双分支方法。其中一个分支作为结构引导,利用场景的粗略 3D 地图来告诉计算机墙壁和地板应该在哪里。第二个分支则是核心创新点,它作为语义引导。它识别视频中的特定物体,例如人、自行车或烹饪锅,并告诉计算机这些物体应该长什么样以及它们应该位于何处,即使 3D 地图是不完整或破碎的。

研究人员还发现了一个在这些系统训练过程中存在的隐藏缺陷。在现实世界中,人佩戴的摄像机与计算机对房间进行的 3D 重建并不完全匹配。这种不匹配意味着,当计算机尝试从真实视频数据中学习时,它本质上是在尝试从一张与它试图模仿的现实并不一致的扭曲地图中学习。为了解决这个问题,团队创建了一个新的流程,在训练开始前,将摄像机的位置重新对齐到计算机那并不完美的 3D 地图中。这确保了计算机是从一个一致的图像中进行学习。此外,为了给系统提供完美的学习范例,他们构建了一个全自动引擎,用于生成数千个合成视频。在这些计算机生成的虚拟世界中,他们放置了各种房间里的动画 3D 角色,并从外部和内部两个视角进行记录,为模型提供了现实世界的摄像机难以轻易捕捉到的完美数据。

在针对包含运动、烹饪和自行车维修等活动的具有挑战性的真实世界视频数据集进行测试时,这一新系统显著优于现有方法。它生成的视频更加清晰、准确,并且在保持物体位置正确方面表现得更好。例如,旧方法经常无法完整重建人物或将人物放置在错误的位置,而新系统则能成功生成主体及其周围环境的清晰视图。结果表明,通过将对房间布局的粗略理解与对物体细节的理解相结合,并利用经过精心对齐和合成示例补充的数据进行训练,计算机终于能够弥合“观察一个场景”与“通过他人的眼睛看世界”之间的鸿沟。这项工作表明,如果机器想要真正理解并复制人类的体验,它们需要超越简单的几何学,去学习它们试图渲染的物体的含义。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →