← 最新论文
💻 computer science

AHOY! Animatable Humans under Occlusion from YouTube Videos with Gaussian Splatting and Video Diffusion Priors

本文提出了 AHOY 方法,利用身份微调的视频扩散先验和独特的监督策略,从存在严重遮挡的野外单目视频中重建出完整且可驱动的 3D 高斯人体 Avatar。

原作者: Aymen Mir, Riza Alp Guler, Xiangjun Tang, Peter Wonka, Gerard Pons-Moll

发布于 2026-03-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Aymen Mir, Riza Alp Guler, Xiangjun Tang, Peter Wonka, Gerard Pons-Moll

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

你好!这篇论文介绍了一个名为 AHOY 的新技术,它的目标非常宏大:从普通的 YouTube 视频中,即使人物被遮挡得严严实实,也能“变”出一个完整、逼真且可以随意摆姿势的 3D 数字人。

为了让你轻松理解,我们可以把这项技术想象成一位拥有“读心术”和“超级画笔”的 3D 雕塑家

🎬 核心挑战:被挡住的“盲人摸象”

通常,如果你想用视频制作一个 3D 数字人,你需要人物在镜头前转圈,且不能有任何东西挡住身体(比如不能有人从前面走过,也不能有桌子挡住腿)。
但在 YouTube 上,99% 的视频里,人们都在做饭、聊天、运动,身体经常被家具、其他人或物体挡住。

  • 传统方法:就像试图拼一个被撕碎的拼图,如果缺了太多块(被遮挡的部分),就拼不出来了,或者拼出来也是残缺的。
  • AHOY 的做法:它不只看你“看见”了什么,它还能出你“没看见”的部分,并且猜得超级准!

🛠️ AHOY 的“四步魔法”

第一步:先捏个“粗糙的泥人” (Coarse Avatar)

  • 比喻:雕塑家先根据视频里露出来的部分(比如露出的脸和半只手),快速捏出一个大概的泥人模型。
  • 怎么做:系统会自动识别视频里的人,把露出来的皮肤和衣服纹理贴在这个泥人上。那些被挡住的地方(比如背对着镜头的背部),先留白或者用简单的颜色填补。这时候的泥人虽然有了形状,但细节很粗糙,而且背对着的部分是空的。

第二步:请“超级画家”来脑补 (Hallucination-as-Supervision)

这是 AHOY 最厉害的地方!

  • 比喻:雕塑家觉得泥人背部的细节不够,于是请来了一个看过无数人类视频、并且专门认识这个人的“超级画家”(视频扩散模型)
  • 怎么做
    1. 认脸:先让画家记住这个人的长相和穿衣风格(通过微调模型)。
    2. 脑补:让画家想象:“如果这个人转过身去,背对着镜头,衣服会怎么皱?皮肤会是什么样?”
    3. 生成:画家根据这些想象,画出了一系列原本不存在但在逻辑上完全合理的视频片段。这些片段填补了所有被遮挡的空白。
    • 注意:这里的“脑补”不是瞎编,而是基于大量数据学习到的“常识”,比如衣服在关节弯曲时的褶皱规律。

第三步:把“脑补”变成“真实细节” (Two-Stage Architecture)

  • 比喻:现在雕塑家手里有了“粗糙泥人”和“画家画的想象图”。他要把这两者结合起来,把泥人雕刻成真人大小的精细雕像
  • 怎么做
    • 系统利用画家生成的“想象视频”作为老师,指导泥人模型去修正细节。
    • 关键技巧(解耦):因为画家画的图可能每一帧都有细微的抖动或不一致(比如左边的手和右边的手位置稍微有点对不上),AHOY 发明了一种**“双轨制”**:
      • 轨道 A(静态纹理):负责记住这个人衣服和皮肤长什么样(不管怎么动,纹理是固定的)。
      • 轨道 B(动态变形):负责处理动作带来的变形(比如手抬起时衣服怎么拉伸)。
    • 这样,即使画家的图有点小瑕疵,系统也能自动修正,保证最终模型既连贯又逼真。

第四步:给“脸”单独开小灶 (Head/Body Split)

  • 比喻:虽然画家很厉害,但画人脸(尤其是表情和五官细节)容易画崩,导致“不像”本人。
  • 怎么做:AHOY 把身体分开处理。
    • 身体:继续用刚才的“超级画家”脑补,保证衣服和肢体动作自然。
    • 头部:专门用一个只负责画人脸的专家模型,确保无论身体怎么动,脸永远保持原样,眼神、五官细节都一模一样,不会变成“换头怪”。

🌟 最终成果:从 YouTube 到 3D 世界

经过这一套流程,AHOY 最终产出了一个完整的 3D 数字人

  1. 完整:哪怕原视频里人一直被桌子挡住,现在的模型也是全身完整的。
  2. 可动:你可以让他在 3D 场景里做任何动作(跳舞、跑步),衣服和身体都会自然变形。
  3. 逼真:可以直接把他放进用普通手机拍摄的 3D 场景里,看起来就像真人在那个房间里一样。

💡 总结

AHOY 就像是一个拥有“透视眼”和“想象力”的 3D 魔术师。 它不再依赖完美的拍摄条件,而是利用 AI 的“想象力”去填补现实视频中的缺失,把我们在 YouTube 上随手看到的、充满遮挡的日常视频,变成了可以随意玩耍的 3D 数字资产。

这意味着,未来我们可能不需要专业的摄影棚和绿幕,只需要在 YouTube 上找一段视频,就能把里面的主角“请”进我们的虚拟游戏或电影里!

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →