想象一下,你只有一张一个人站在公园里的单张照片。你想把这张平面的 2D 图片变成一个逼真的、可以用于视频游戏的 3D 角色,让你能够绕着它走动、放大观察,并从各个角度观看。这就是 PSHuman 所解决的挑战。
以下是该论文如何通过简单的概念和类比来解释其解决方案的:
问题所在:“魔镜”故障
现有的方法试图根据一张正面照片来猜测一个人的背面长什么样。但这些方法经常失败。
- 面部问题: 如果你试图仅凭一张微小的照片就推测全身,脸部往往会发生畸变或看起来像另一个人。这就像是试图仅用一小块模糊的颜料来绘制一幅精细的人物肖像。
- 姿态问题: 如果照片中的人正在弯腰或双手交叉,计算机就会感到困惑。它可能会“幻觉”出手臂悬浮在半空中,或者腿部扭曲成不可能的角度,因为它并不理解人体解剖结构。
解决方案:PSHuman 的三步配方
作者构建了一个名为 PSHuman 的系统,它就像一位配备了特殊工具的大师级雕塑家。
1. “缩放”相机(跨尺度扩散)
大多数 AI 模型试图同时生成全身和面部,这会导致面部模糊。
- 类比: 想象一名摄影师正在拍摄人群。如果他们试图在一次拍摄中既捕捉整个体育场,又捕捉其中一个人的具体微笑,那么脸部就会显得很小且充满像素感。
- 解决方法: PSHuman 使用了一种“跨尺度”(Cross-Scale)方法。它同时获取两张图片:一张是全身的远景图,一张是仅针对面部的近距离“缩放”图。然后将这两者融合在一起。这确保了脸部保持清晰且看起来与原图中的人完全一致,同时身体比例也保持协调。
2. “骨架指南”(SMPL-X 条件)
AI 模型擅长猜测,但不擅长理解物理和解剖学。
- 类比: 想象你在不知道关节位置的情况下尝试画一个人物。你可能会画出一只向后弯曲的手臂,或者一条长两倍的腿。
- 解决方法: 在生成新的视角之前,PSHuman 首先估算出一个符合照片中人物特征的数字骨架(称为 SMPL-X)。它强制要求 AI 使用这个骨架作为引导。即使照片中的人处于奇怪的姿势,AI 也会知道:“好吧,手臂必须连接在肩膀上,并且要这样弯曲。”这防止了 AI 创建出不可能的、扭曲的身体。
3. “数字雕刻”(显式重网格化)
一旦 AI 生成了人物的六个不同视角(正面、背面、左侧、右侧等)并拥有完美的色彩和阴影,它就需要将这些扁平图像转化为 3D 物体。
- 类比: 想象你有一块粘土(数字骨架)。你有六张照片,展示了完成后的雕像从不同角度看应该是什么样子。你不仅仅是在给粘土涂色,而是使用一种特殊的工具来“雕刻”这块粘土,削去那些不该存在的部分,并增加衣服上的褶皱。
- 解决方法: 该系统利用生成的图像来“雕刻”3D 网格。它不仅仅是猜测表面;它通过物理方式重新塑造数字粘土,以匹配在生成的照片中所看到的褶皱、折痕和细节。
结果
论文声称这一过程非常快速(大约耗时一分钟),并能产生以下结果:
- 几何准确: 身体形状和衣服褶皱看起来很真实,而不是像一个光滑的塑料模特。
- 身份保留: 脸部看起来像原作者,而不是一个扭曲的版本。
- 一致性: 如果你绕着 3D 模型行走,后脑勺和衣服背面看起来会很自然,并与正面相匹配。
失败之处(论文诚实的局限性)
作者承认该系统目前还不完美。它高度依赖于最初获取的骨架是否准确。如果计算机在开始时猜错了姿势,最终的 3D 模型也会出错。此外,它有时在处理非常棘手的细节(如散乱的头发或手部)时会显得有些吃力,最终结果可能会看起来有点凌乱。
简而言之: PSHuman 是通过使用面部“缩放”技巧、身体“骨架指南”以及构建最终模型的“数字雕刻”工具,在不到一分钟内将单张照片转化为 3D 角色的新方法。
技术摘要:PSHuman
问题陈述
从单张野外(in-the-wild)RGB 图像进行逼真的 3D 人体重建仍然是一个具有挑战性的开放性问题,原因在于复杂的身体姿态、复杂的自遮挡以及复杂的服装拓扑结构。现有方法通常依赖隐式函数或仅生成前视图/后视图以减轻歧义。然而,这些方法往往存在以下问题:
- 细节丢失与伪影: 隐式回归范式难以捕捉高保真几何与纹理细节,导致新视角下出现伪影。
- 空间歧义: 仅生成单一后视图无法提供足够的立体信息来解决空间歧义。
- 几何畸变: 将多视图扩散模型直接应用于单视图人体图像时,由于问题的病态性质和缺乏解剖学先验,往往会导致严重的几何畸变,特别是在面部特征和身体比例方面。
- 面部身份丢失: 预训练的扩散模型在处理全身输入时,由于面部在图像中占据的区域极小且分辨率较低,在经过 VAE 编码后,无法为精细的法线预测提供足够的信息,从而导致面部细节扭曲或不自然。
方法论
PSHuman 提出了一种全新的框架,通过利用来自多视图扩散模型的先验知识,显式地重建带纹理的人体网格。该流水线包含两个主要阶段:
1. 身体-面部跨尺度多视图扩散
PSHuman 不仅仅生成前视图/后视图,而是直接生成六个视图(前视图、左前视图、左视图、后视图、右视图、右前视图)的颜色图和法线图。为了应对特定挑战,引入了两个关键机制:
- SMPL-X 条件扩散: 为了防止由自遮挡引起的非自然身体结构和肢体不一致,扩散模型以参数化 SMPL-X 模型为条件。估计的 SMPL-X 参数从目标视角进行渲染,并与输入图像拼接作为潜在条件。这引导扩散过程遵循人体解剖结构,确保在复杂姿态下也能保持一致的新视角。
- 身体-面部跨尺度扩散: 为了解决面部畸变和身份变化问题,作者提出了一个联合概率分布建模框架 p(xB,xF),同时生成全局全身图像和局部高分辨率面部图像。
- 联合去噪: 在 UNet 的自注意力模块中采用了噪声混合层。面部分支的潜在向量被调整大小并混合到全局身体分支的面部区域。这使得面部信息可以通过跨视图注意力传输到新的身体视图中,从而在保持身份的同时,确保跨尺度和跨视图的一致性。
2. SMPLX 初始化的显式人体雕刻
不同于通过 MLP 将特征映射到表面的隐式方法,PSHuman 使用生成的多视图法线图和颜色图来显式地雕刻 3D 网格。
- 初始化: 该过程始于从输入图像中初始化的 SMPL-X 网格。
- 可微重网格化(Differentiable Remeshing): 使用可微光栅化对 SMPL-X 网格进行变形和重网格化。优化过程通过迭代调整顶点位置和面片边缘,以最小化渲染图与生成法线图及轮廓图之间的差异。这种方法不同于简单的顶点位移,它能够恢复如宽松衣物等复杂的细节。
- 外观融合: 一旦几何形状被恢复,多视图颜色图像就会被融合到网格上。通过可微渲染流水线优化每顶点颜色,以减轻生成过程中的不一致性。使用可见性掩码和基于 KDTree 的插值来处理未观测区域,确保全面的纹理覆盖。
核心贡献
- PSHuman 框架: 一种基于扩散的显式新方法,用于从单张图像实现细节丰富、逼真的 3D 人体建模,实现约一分钟内的重建。
- 跨尺度与条件扩散: 引入了身体-面部跨尺度扩散模型和 SMPL-X 条件多视图扩散模型。这些技术实现了保留面部身份和解剖一致性的高保真全身生成,即使在少样本训练数据(3,000 个扫描件)的情况下也是如此。
- 显式雕刻模块: 一个 SMPLX 初始化的显式人体雕刻模块,利用可微光栅化从生成的多视图跨域图像中快速恢复带纹理的网格,性能优于隐式基准方法。
实验结果
在 THuman2.1、CustomHumans 和 CAPE 数据集上进行了广泛的实验。
- 几何质量: PSHuman 在 Cham料距离 (CD)、点到表面距离 (P2S) 和法线一致性 (NC) 方面表现出优于最先进的隐式(PIFu, PIFuHD)和显式(ECON, GTA)方法的性能。在使用真值 SMPL-X 先验时,在 THuman2.1 子集上达到了最低的 CD (0.4399 cm) 和 P2S (0.4077 cm)。
- 外观质量: 该方法在 THuman2.1 子集上实现了最高的 PSNR (20.85) 和 SSIM (0.8636),以及最低的 LPIPS (0.0764),表明其具有高纹理保真度和新视角一致性。
- 面部重建: 定量比较显示,PSHuman 在面部几何和纹理指标上显著优于基准方法(ECON, SIFU, SITH),验证了跨尺度扩散的有效性。
- 鲁棒性: 即使在 SMPL-X 估计存在误差的情况下,该方法仍能保持稳健的性能,在噪声姿态/形状条件下表现优于其他基于模板的方法。
意义与主张
论文声称 PSHuman 在精度、效率和姿态鲁棒性之间取得了关键平衡。虽然最近基于 SDS 的方法可以实现高几何细节,但它们通常需要数小时的优化,并且在复杂姿态下表现不佳。相比之下,PSHum 在不到一分钟内即可生成高质量、细节丰富且和谐的新视角。
作者强调,他们的工作解决了将多视图扩散应用于人体时的特定失效模式:
- 通过 SMPL-X 条件化防止了“幻觉”出不可能的身体结构。
- 通过跨尺度扩散和噪声混合解决了面部身份和细节丢失的问题。
- 从隐式表示转向显式网格雕刻,从而更好地处理精细几何细节,如织物褶皱和面部特征。
论文总结道,PSHuman 代表了单幅图像 3D 人体重建领域的重要进步,为需要快速、高保真且具有姿态鲁棒性的人体建模应用提供了实用的解决方案。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。