你好!这篇论文介绍了一个名为 AHOY 的新技术,它的目标非常宏大:从普通的 YouTube 视频中,即使人物被遮挡得严严实实,也能“变”出一个完整、逼真且可以随意摆姿势的 3D 数字人。
为了让你轻松理解,我们可以把这项技术想象成一位拥有“读心术”和“超级画笔”的 3D 雕塑家。
🎬 核心挑战:被挡住的“盲人摸象”
通常,如果你想用视频制作一个 3D 数字人,你需要人物在镜头前转圈,且不能有任何东西挡住身体(比如不能有人从前面走过,也不能有桌子挡住腿)。
但在 YouTube 上,99% 的视频里,人们都在做饭、聊天、运动,身体经常被家具、其他人或物体挡住。
- 传统方法:就像试图拼一个被撕碎的拼图,如果缺了太多块(被遮挡的部分),就拼不出来了,或者拼出来也是残缺的。
- AHOY 的做法:它不只看你“看见”了什么,它还能猜出你“没看见”的部分,并且猜得超级准!
🛠️ AHOY 的“四步魔法”
第一步:先捏个“粗糙的泥人” (Coarse Avatar)
- 比喻:雕塑家先根据视频里露出来的部分(比如露出的脸和半只手),快速捏出一个大概的泥人模型。
- 怎么做:系统会自动识别视频里的人,把露出来的皮肤和衣服纹理贴在这个泥人上。那些被挡住的地方(比如背对着镜头的背部),先留白或者用简单的颜色填补。这时候的泥人虽然有了形状,但细节很粗糙,而且背对着的部分是空的。
第二步:请“超级画家”来脑补 (Hallucination-as-Supervision)
这是 AHOY 最厉害的地方!
- 比喻:雕塑家觉得泥人背部的细节不够,于是请来了一个看过无数人类视频、并且专门认识这个人的“超级画家”(视频扩散模型)。
- 怎么做:
- 认脸:先让画家记住这个人的长相和穿衣风格(通过微调模型)。
- 脑补:让画家想象:“如果这个人转过身去,背对着镜头,衣服会怎么皱?皮肤会是什么样?”
- 生成:画家根据这些想象,画出了一系列原本不存在但在逻辑上完全合理的视频片段。这些片段填补了所有被遮挡的空白。
- 注意:这里的“脑补”不是瞎编,而是基于大量数据学习到的“常识”,比如衣服在关节弯曲时的褶皱规律。
第三步:把“脑补”变成“真实细节” (Two-Stage Architecture)
- 比喻:现在雕塑家手里有了“粗糙泥人”和“画家画的想象图”。他要把这两者结合起来,把泥人雕刻成真人大小的精细雕像。
- 怎么做:
- 系统利用画家生成的“想象视频”作为老师,指导泥人模型去修正细节。
- 关键技巧(解耦):因为画家画的图可能每一帧都有细微的抖动或不一致(比如左边的手和右边的手位置稍微有点对不上),AHOY 发明了一种**“双轨制”**:
- 轨道 A(静态纹理):负责记住这个人衣服和皮肤长什么样(不管怎么动,纹理是固定的)。
- 轨道 B(动态变形):负责处理动作带来的变形(比如手抬起时衣服怎么拉伸)。
- 这样,即使画家的图有点小瑕疵,系统也能自动修正,保证最终模型既连贯又逼真。
第四步:给“脸”单独开小灶 (Head/Body Split)
- 比喻:虽然画家很厉害,但画人脸(尤其是表情和五官细节)容易画崩,导致“不像”本人。
- 怎么做:AHOY 把头和身体分开处理。
- 身体:继续用刚才的“超级画家”脑补,保证衣服和肢体动作自然。
- 头部:专门用一个只负责画人脸的专家模型,确保无论身体怎么动,脸永远保持原样,眼神、五官细节都一模一样,不会变成“换头怪”。
🌟 最终成果:从 YouTube 到 3D 世界
经过这一套流程,AHOY 最终产出了一个完整的 3D 数字人:
- 完整:哪怕原视频里人一直被桌子挡住,现在的模型也是全身完整的。
- 可动:你可以让他在 3D 场景里做任何动作(跳舞、跑步),衣服和身体都会自然变形。
- 逼真:可以直接把他放进用普通手机拍摄的 3D 场景里,看起来就像真人在那个房间里一样。
💡 总结
AHOY 就像是一个拥有“透视眼”和“想象力”的 3D 魔术师。 它不再依赖完美的拍摄条件,而是利用 AI 的“想象力”去填补现实视频中的缺失,把我们在 YouTube 上随手看到的、充满遮挡的日常视频,变成了可以随意玩耍的 3D 数字资产。
这意味着,未来我们可能不需要专业的摄影棚和绿幕,只需要在 YouTube 上找一段视频,就能把里面的主角“请”进我们的虚拟游戏或电影里!
这是一份关于论文 AHOY (Animatable Humans under Occlusion from YouTube Videos with Gaussian Splatting and Video Diffusion Priors) 的详细技术总结。
1. 研究问题 (Problem)
现有的从单目视频重建可动画 3D 人类数字人(Avatar)的方法,通常假设输入是无遮挡的(即主体完全可见,通常处于标准姿态)。然而,现实世界(如 YouTube 视频)中的绝大多数 footage 都包含严重的遮挡(由家具、物体或其他人造成)。
- 核心挑战:
- 未观测区域:由于遮挡,人体的大片区域(如背部、被遮挡的手臂)在视频中从未被观察到,导致缺乏直接监督。
- 缺乏多视角监督:在单目视频中,无法获得同一姿态下的多视角数据,难以学习姿态相关的形变(Pose-dependent deformation)。
- 生成数据的不一致性:利用生成式模型(如视频扩散模型)“脑补”缺失部分时,生成的视频在不同视角和帧之间往往缺乏几何一致性,直接训练会导致伪影。
- 身份保持:扩散模型生成的面部往往无法保持原始人物的身份特征。
2. 方法论 (Methodology)
AHOY 提出了一套四阶段的流水线,旨在从严重遮挡的 YouTube 单目视频中重建完整、可动画的 3D 高斯(3DGS)数字人。
阶段一:粗略数字人构建 (Coarse Avatar Construction)
- 纹理映射与修复:利用 DensePose 将可见像素映射到标准姿态(Canonical Pose)的 UV 空间。对于从未被观测到的区域,使用预训练的 FLUX 模型进行图像修复(Inpainting),生成完整的标准姿态纹理图。
- 多视图生成:利用预训练的多视图扩散模型,从修复后的单张标准姿态图生成 4 个正交视角(前、后、左、右)的图像。
- 粗略 3DGS 训练:基于这些多视图图像和原始遮挡视频帧,训练一个**标准姿态无关(Canonical)**的 3D 高斯模板。此时仅使用线性混合蒙皮(LBS)进行形变,尚未学习姿态相关的细节。
阶段二:基于“幻觉”的监督生成 (Hallucinated Supervision Generation)
这是解决遮挡问题的核心创新点,即“将幻觉作为监督”。
- 身份微调 (Identity Finetuning):使用 LoRA 对视频扩散模型(Wan 2.2)进行微调,使其学习特定人物的身份、外观和服装特征。
- 结构化运动序列:设计特定的运动序列(如全身旋转、坐姿等),旨在系统性地暴露身体的所有表面。
- RF-Inversion (整流流反演):
- 将粗略数字人在结构化运动下的渲染结果编码到扩散模型的潜在空间。
- 利用微调后的扩散模型进行反向生成(Decoding)。
- 效果:扩散模型利用其先验知识,用符合人物身份的纹理“填充”了原本被遮挡或渲染错误的区域,生成了无遮挡、多视角的“幻觉”监督视频。
阶段三:全数字人学习与多视图不一致性吸收 (Full Avatar Learning)
利用生成的幻觉视频训练最终的高保真数字人。
- 从标准姿态到姿态相关 (Canonical-to-Pose-Dependent):
- 利用幻觉视频中同一姿态下不同视角的帧,提供密集的多视角监督,从而训练姿态相关的高斯图(Pose-dependent Gaussian Maps)。
- Map-Pose / LBS-Pose 解耦 (关键创新):
- Map Pose (θmap):输入给网络(StyleUNet)的姿态,用于生成高斯属性。它在同一序列的所有帧中保持不变,确保高斯属性的一致性。
- LBS Pose (θlbs):用于对生成的高斯进行线性混合蒙皮形变的姿态。它在每一帧独立优化。
- 作用:这种解耦允许网络在保持高斯属性一致的同时,通过优化 LBS 姿态来吸收扩散模型生成的视频中的几何不一致性(伪影),避免训练崩溃。
- 头部/身体分离监督:
- 由于扩散模型生成的面部往往不可靠,AHOY 将头部和身体分离。
- 身体:使用上述的扩散生成视频进行监督。
- 头部:使用专门的多视图面部扩散模型(如 CAP4D)生成身份一致的面部图像,并通过 FLAME 模型进行监督,确保**面部身份(Identity)**的保持。
阶段四:动画与场景合成
- 训练好的数字人可以通过任意 SMPL 姿态驱动。
- 结合 PCA 投影约束,将数字人合成到由手机视频重建的 3DGS 场景中,实现逼真的新视角渲染。
3. 关键贡献 (Key Contributions)
- 首个处理严重遮挡的 YouTube 视频重建方法:打破了现有方法需要无遮挡输入的限制,解锁了海量非受控视频作为 3D 人类资产来源的潜力。
- “幻觉即监督” (Hallucination-as-Supervision):提出利用身份微调的视频扩散模型和 RF-Inversion 技术,将不完整的渲染转化为包含缺失区域的高质量监督信号。
- 两阶段架构 (Canonical-to-Pose-Dependent):先构建粗略标准姿态模型,再利用生成的多视角数据升级到位姿相关模型,解决了单目遮挡下无法学习姿态形变的问题。
- Map-Pose / LBS-Pose 解耦机制:巧妙解决了扩散生成数据中固有的多视角几何不一致问题,使得从生成数据中学习高保真 3DGS 成为可能。
- 头部/身体分离策略:有效解决了扩散模型在面部身份保持上的缺陷,确保了数字人的可识别性。
4. 实验结果 (Results)
- 数据集:在包含严重遮挡的 YouTube 视频和 BEHAVE 数据集(多视角遮挡)上进行评估。
- 定量指标:在 PSNR、SSIM 和 LPIPS 指标上,AHOY 显著优于现有的 SOTA 方法(如 LHM, IDOL, PSHuman, SyncHuman 等)。特别是在遮挡输入和新姿态(Novel Pose)/新视角(Novel View)的重建质量上优势明显。
- 定性效果:
- 能够重建出完整的、无遮挡的 3D 人体,即使原始视频中被家具完全遮挡。
- 生成的数字人具有高度的真实感,且能够被驱动到未见过的姿态。
- 面部身份保持良好,没有扩散模型常见的“换脸”现象。
- 消融实验:证明了每个组件(RF-Inversion、Map/LBS 解耦、头身分离)对最终性能的关键作用。
5. 意义与影响 (Significance)
- 数据源的解放:AHOY 证明了无需专业的多视角捕捉设备或受控环境,仅凭普通的 YouTube 单目视频即可重建高质量的 3D 数字人。这极大地降低了 3D 内容创作的门槛。
- 技术范式创新:将生成式 AI(视频扩散模型)从单纯的“生成器”转变为 3D 重建中的“监督信号生成器”,并提出了处理生成数据几何不一致性的新架构(解耦机制),为未来的 3D 生成与重建提供了新思路。
- 应用前景:该方法可直接应用于游戏、虚拟现实(VR)、电影制作等领域,快速从海量网络视频中提取个性化 3D 资产,并实现逼真的场景合成。
总结:AHOY 通过巧妙结合 3D 高斯溅射(3DGS)的实时渲染能力和视频扩散模型的强大生成先验,成功攻克了“遮挡”这一长期阻碍单目 3D 人类重建的难题,实现了从“不完美”的遮挡视频中提取“完美”的可动画 3D 数字人的目标。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。