← 最新论文
💻 computer science

Scene and Human in One World: Reconstruction in a Feedforward Pass

本文介绍了 SHOW,这是一个统一的前馈框架,通过利用参数化人体先验进行场景缩放以及利用场景几何进行人体对齐,从而实现从单目视频中联合重建米级尺度 3D 场景与人体网格,并利用可提示的掩码机制来处理遮挡与杂乱问题。

原作者: Boao Shi, Qiao Feng, Yiming Huang, Lingjie Liu

发布于 2026-06-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Boao Shi, Qiao Feng, Yiming Huang, Lingjie Liu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心问题:“悬浮头”现象

想象你正在观看一段一个人在公园里散步的视频。如果你仅凭一个摄像头,试图分别构建那个人的 3D 模型和公园的 3D 模型,你会遇到一个经典的难题:尺度歧义(Scale Ambiguity)

如果没有第二个摄像头或一把尺子,计算机并不知道这个人是一个走在微缩景观公园里的巨人,还是一个走在巨大公园里的微型人。

  • 旧方法试图通过先构建人,再构建公园,最后再尝试将它们粘合在一起的方法来解决这个问题。
  • 结果: 人往往会悬浮在半空中、陷入地面中,或者看起来与周围的树木和长凳比例完全不对。它们像是两个无法完美契合的拼图。

解决方案:SHOW(场景与人在同一世界中)

作者引入了一种名为 SHOW 的新方法。SHOW 不再是分别构建人和公园,而是在单个步骤中同时构建两者

这就像是在烘焙蛋糕时,将面糊和糖霜在一个碗里混合在一起,而不是先烤好蛋糕,涂上糖霜,然后再祈祷它们能粘在一起。因为它们是同时制作的,所以能保证完美契合。

它是如何工作的:三大“魔术技巧”

1. “荧光笔”(掩码提示/Mask Prompting)

在人群拥挤或背景杂乱的视频中,计算机很难知道应该专注于哪一个人。

  • 类比: 想象你正在嘈杂的人群中为一位朋友画肖像。与其盯着整个房间看,不如用一支荧光笔只在你的朋友身上涂抹。
  • 技术原理: SHOW 使用一个“掩码”(数字轮廓)来告诉计算机:“忽略背景和其他人;只关注这个特定的人。”这有助于计算机准确理解这个人的位置以及相对于场景的大小。

2. “双向奔赴”(相互学习/Mutual Learning)

这是核心创新点。在以往的方法中,“场景”和“人”之间并没有真正的交流。

  • 类比: 想象一对舞伴。如果其中一个舞伴(人)不知道另一个舞伴(场景)在哪里,他们就会互相踩脚或渐行渐远。
  • 技术原理:
    • 人辅助场景: 计算机知道人体结构的特征(它有一个标准尺寸)。它利用这种知识来告诉场景:“如果这个人站在这里,那么地面距离必须是这个距离。”
    • 场景辅助人: 计算机观察地面和墙壁。它告诉那个人:“你不能悬浮在这里;地面就在那里,所以你必须站在上面。”
    • 结果: 它们不断地互相纠正,确保人的尺寸正确且站立位置准确。

3. “统一蓝图”(统一度量空间/Unified Metric Space)

大多数 3D 模型都是在“归一化”空间中构建的(即所有东西只是 0 到 1 之间的数字,没有米等现实世界的单位)。

  • 类比: 想象你正在根据一张蓝图盖房子,但蓝图只说“门高 1 个单位”,却没说这个单位是英寸还是英里。
  • 技术原理: SHOW 强制要求人和场景共享同一份蓝图。它计算出一个“尺度因子(scale factor)”,将抽象数字转换为现实世界的测量值。这确保了如果场景中的长凳高 0.5 米,那么人的腿也是以米为单位进行测量的,从而实现完美契合。

为什么这种方法更好?

论文表明,通过一次性完成所有工作(“前馈传递/feedforward pass”),SHOW 解决了三个主要痛点:

  1. 不再悬浮: 人站在地面上,而不是悬在空中。
  2. 不再下沉: 人不会掉进地板里。
  3. 不再比例失调: 一个小孩不会被错误地建模成成年人的大小。

“消融实验”(如果去掉这些魔术会发生什么?)

作者通过关闭特定功能来测试其方法的有效性,以观察哪些部分会失效:

  • 没有“荧光笔”(掩码): 计算机会在人群中产生困惑,无法选出正确的人。
  • 没有“双向奔赴”(联合训练): 人与场景停止了交流,导致对齐失败(出现悬浮或下沉现象)。
  • 没有“统一蓝图”(尺度): 尺寸都会出错。

总结

SHOW 是一种将平面视频转化为 3D 世界的新方法。它不再是在事后猜测人如何融入场景,而是在构建人的同时构建场景——利用人的形状来定义场景的大小,并利用场景的几何结构来锚定人的双脚。其结果是一个人类与其环境自然融合的 3D 世界,不会出现悬浮或下沉的情况。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →