← 最新论文
💻 computer science

OmniX: Any-view and Any-time 4D Reconstruction via Feed-forward Trajectory Fields

OmniX 是一个前馈式 4D 重建框架,通过使用紧凑的动态标记将动态运动建模与静态几何解耦,从而为具有大幅度相机运动的视频预测稠密 3D 点轨迹,并由新引入的大规模合成数据集提供训练支持。

原作者: Yanqin Jiang, Tengfei Wang, Zhengwei Wang, Chenjie Cao, Junta Wu, Wenhan Luo, Weiming Hu, Jin Gao, Chunchao Guo

发布于 2026-07-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Yanqin Jiang, Tengfei Wang, Zhengwei Wang, Chenjie Cao, Junta Wu, Wenhan Luo, Weiming Hu, Jin Gao, Chunchao Guo

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图在电子游戏中重建一个繁忙的城市广场,但你手里只有一段手持拍摄的晃动视频,画面中人们在走动,汽车在疾驰,太阳也在移动。摄像机剧烈摇晃、缩放并跳跃。以往尝试从这类视频构建 3D 模型的方法就像是在戴着眼罩解谜:它们要么会冻结移动的人物(忽略了动作),要么会在摄像机移动过大时感到困惑,导致结果变得模糊且破碎。

这时,OmniX 登场了。它是一个全新的“前馈式”(feed-forward)框架(可以把它想象成一个超级快速、一步到位的配方),终于能够重建这些动态场景的 4D 维度——这意味着它不仅捕捉了 3D 形状,还捕捉了每一个点随时间变化的运动方式,即使在摄像机疯狂移动的情况下也是如此。

核心魔术:分离静态与旋转

该论文指出,以往的方法之所以失败,是因为它们试图在没有将建筑形状和人物舞步进行分离的情况下,同时搞定两者。这就像是在没有调音台分离音轨的情况下,试图同时听清小提琴独奏和架子鼓独奏。

OmniX 通过显式地解耦(unmixing)这两个部分解决了这个问题。它将背景(静态几何体)和前景(动态运动)视为不同的成分:

  • 静态部分: 它确定墙壁和地面在哪里。
  • 动态部分: OmniX 并没有采用追踪每一个像素点运动的笨办法(那样既慢又耗费计算资源),而是使用了一个聪明的技巧。它识别出一组极小的、稀疏的“动态标记”(dynamic tokens)。你可以把它们想象成派出去绘制整个人群运动图谱的几名超级侦察兵。由于 3D 运动本质上是稀疏且有组织的(低秩性),这几名侦察兵就能生成一个“轨迹场”——即一张关于视频中每个像素如何从任何角度、在任何时刻移动的地图。

“单次通过”的超能力

旧的方法通常像是一个慢动作侦探,逐帧检查:“这个点去了哪里?”然后问:“它下一步又去了哪里?”如此循环往复。这种方法被称为“迭代式”(iterative),速度很慢。

OmniX 则不同。它能在单次通过中预测出每个点的完整路径。这就像是在看电影时,瞬间就能知道每个角色的未来路径,而不需要暂停或倒带。这得益于一种名为**稀疏时空注意力机制(Sparse Spatiotemporal Attention, SSA)的新机制。SSA 挑选出最重要的“动态标记”,将它们扩展到时间维度,并让它们与所有图像数据进行“交流”,从而推算出运动规律。随后,一个可变形轨迹采样头(Deformable Trajectory Sampling Head)**会利用这些稀疏的线索来填补空白,从而为整个场景提供密集且像素级的轨迹。

构建训练健身房:UE5 引擎

如果你从未见过舞池,你就无法教机器人跳舞。作者意识到,目前缺乏能够训练如此宏大模型的、带有“大幅度相机运动”和完美 3D 标签的真实世界数据。因此,他们构建了自己的“健身房”。

利用 Unreal Engine 5 (UE5),他们创建了一个自动数据引擎。他们提取静态环境,加入动态物体(如行驶的汽车和行人),并使用一套自定义摄像机系统进行疯狂旋转拍摄。

  • 结果: 他们生成了一个包含 80,000 个场景128 万个多视角视频的海量数据集。
  • 标注: 每一个视频都附带完美的“真值”(ground truth)标签:精确的深度、相机姿态以及密集的 3D 点轨迹。正是这些合成数据,让 OmniX 学会了如何处理那些会让以往模型感到困惑的、高达 180 度的剧烈相机摆动。

结果如何?表现如何?

论文对 OmniX 进行了多项测试,数据表明它成为了该领域的新领跑者。

  • 密集 3D 点轨迹: 在其自定义验证集上,OmniX 以显著优势击败了以往的最优方法(如 VDPM 和 TraceAnything)。例如,在“不相交视频对”(Disjoint Video Pairs,即两个在时间上不重叠的独立视频片段)任务中,OmniX 对所有点的 APD3D(平均点距离)为 0.444,而排名第二的 VDPM 为 0.306。(注意:在这种特定指标中,较高的 APD3D 表示性能更好)。误差率也显著下降,在某些设置下,OmniX 的 EPE(终点误差)为 0.101,而 VDPM 为 0.306
  • 3D 点追踪:TAPVid-3D 基准测试中,OmniX 在三个数据集(ADT, DriveTrack, PStudio)上均取得了最先进(state-of-the-art)的结果。例如,在 ADT 数据集上,它达到了 0.367APD3D,大幅超越了紧随其后的方法(VDPM 为 0.266)。由于此处 APD3D 越高越好,这代表了追踪准确性的实质性提升。
  • 其他任务: 它在视频深度估计和相机姿态估计方面也表现出色,在 KITTISintel 等数据集上达到或超越了顶尖竞争对手。

它“不是”什么(以及它排除了哪些可能)

基于实验,论文非常明确地指出了哪些做法是无效的:

  • 侦察兵不需要“自注意力”: 他们尝试在 Sparse Spatiotemporal Attention 模块中加入一个“自注意力”层(让动态标记彼此交流),结果发现这几乎没有任何影响。论文明确指出这是不必要的,并通过移除它节省了计算能力。
  • 拒绝“迭代猜测”: 论文反对传统的“迭代查询”点的方法。他们证明了这种“单次通过”的方法在进行密集预测时更快且更准确。
  • 没有“小幅度相机运动”限制: 以前预测密集轨迹的方法受限于相机几乎不动的情况。OmniX 则明确证明了它能够处理大幅度相机运动(高达 180 度)甚至是不连续的时间输入。

总结

OmniX 表明,通过将“什么是移动的”与“什么是静止的”进行分离,并利用包含 80,000 个场景和 128 万个视频的海量合成数据集进行训练,我们终于可以实现通过单次高效运行,从混乱的手持视频中重建动态的 4D 世界。这不仅仅是一个微小的进步;作者展示了它如何为预测场景中每个点的运动设定了新的行业标准(state-of-the-art),使其成为自动驾驶和 AR/VR 内容创作等领域的强大工具。

论文并未声称这已经解决了宇宙中“所有可能”的场景问题,但来自其 8 万个场景和 128 万个视频的证据有力地表明,这是目前处理复杂相机运动最稳健的方法。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →