← 最新论文
💻 computer science

PSHuman: Photorealistic Single-image 3D Human Reconstruction using Cross-Scale Multiview Diffusion and Explicit Remeshing

PSHuman 是一个新颖的框架,它通过结合用于实现细节丰富且保持身份特征的视图合成的跨尺度多视图扩散技术,以及用于确保解剖一致性和高保真几何结构的 SMPL-X 条件显式重网格化技术,实现了从单张 RGB 图像进行逼真的 3D 人体重建。

原作者: Peng Li, Wangguandong Zheng, Yuan Liu, Tao Yu, Yangguang Li, Xingqun Qi, Xiaowei Chi, Siyu Xia, Yan-Pei Cao, Wei Xue, Wenhan Luo, Yike Guo

发布于 2026-07-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Peng Li, Wangguandong Zheng, Yuan Liu, Tao Yu, Yangguang Li, Xingqun Qi, Xiaowei Chi, Siyu Xia, Yan-Pei Cao, Wei Xue, Wenhan Luo, Yike Guo

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你只有一张一个人站在公园里的单张照片。你想把这张平面的 2D 图片变成一个逼真的、可以用于视频游戏的 3D 角色,让你能够绕着它走动、放大观察,并从各个角度观看。这就是 PSHuman 所解决的挑战。

以下是该论文如何通过简单的概念和类比来解释其解决方案的:

问题所在:“魔镜”故障

现有的方法试图根据一张正面照片来猜测一个人的背面长什么样。但这些方法经常失败。

  • 面部问题: 如果你试图仅凭一张微小的照片就推测全身,脸部往往会发生畸变或看起来像另一个人。这就像是试图仅用一小块模糊的颜料来绘制一幅精细的人物肖像。
  • 姿态问题: 如果照片中的人正在弯腰或双手交叉,计算机就会感到困惑。它可能会“幻觉”出手臂悬浮在半空中,或者腿部扭曲成不可能的角度,因为它并不理解人体解剖结构。

解决方案:PSHuman 的三步配方

作者构建了一个名为 PSHuman 的系统,它就像一位配备了特殊工具的大师级雕塑家。

1. “缩放”相机(跨尺度扩散)

大多数 AI 模型试图同时生成全身和面部,这会导致面部模糊。

  • 类比: 想象一名摄影师正在拍摄人群。如果他们试图在一次拍摄中既捕捉整个体育场,又捕捉其中一个人的具体微笑,那么脸部就会显得很小且充满像素感。
  • 解决方法: PSHuman 使用了一种“跨尺度”(Cross-Scale)方法。它同时获取两张图片:一张是全身的远景图,一张是仅针对面部的近距离“缩放”图。然后将这两者融合在一起。这确保了脸部保持清晰且看起来与原图中的人完全一致,同时身体比例也保持协调。

2. “骨架指南”(SMPL-X 条件)

AI 模型擅长猜测,但不擅长理解物理和解剖学。

  • 类比: 想象你在不知道关节位置的情况下尝试画一个人物。你可能会画出一只向后弯曲的手臂,或者一条长两倍的腿。
  • 解决方法: 在生成新的视角之前,PSHuman 首先估算出一个符合照片中人物特征的数字骨架(称为 SMPL-X)。它强制要求 AI 使用这个骨架作为引导。即使照片中的人处于奇怪的姿势,AI 也会知道:“好吧,手臂必须连接在肩膀上,并且要这样弯曲。”这防止了 AI 创建出不可能的、扭曲的身体。

3. “数字雕刻”(显式重网格化)

一旦 AI 生成了人物的六个不同视角(正面、背面、左侧、右侧等)并拥有完美的色彩和阴影,它就需要将这些扁平图像转化为 3D 物体。

  • 类比: 想象你有一块粘土(数字骨架)。你有六张照片,展示了完成后的雕像从不同角度看应该是什么样子。你不仅仅是在给粘土涂色,而是使用一种特殊的工具来“雕刻”这块粘土,削去那些不该存在的部分,并增加衣服上的褶皱。
  • 解决方法: 该系统利用生成的图像来“雕刻”3D 网格。它不仅仅是猜测表面;它通过物理方式重新塑造数字粘土,以匹配在生成的照片中所看到的褶皱、折痕和细节。

结果

论文声称这一过程非常快速(大约耗时一分钟),并能产生以下结果:

  • 几何准确: 身体形状和衣服褶皱看起来很真实,而不是像一个光滑的塑料模特。
  • 身份保留: 脸部看起来像原作者,而不是一个扭曲的版本。
  • 一致性: 如果你绕着 3D 模型行走,后脑勺和衣服背面看起来会很自然,并与正面相匹配。

失败之处(论文诚实的局限性)

作者承认该系统目前还不完美。它高度依赖于最初获取的骨架是否准确。如果计算机在开始时猜错了姿势,最终的 3D 模型也会出错。此外,它有时在处理非常棘手的细节(如散乱的头发或手部)时会显得有些吃力,最终结果可能会看起来有点凌乱。

简而言之: PSHuman 是通过使用面部“缩放”技巧、身体“骨架指南”以及构建最终模型的“数字雕刻”工具,在不到一分钟内将单张照片转化为 3D 角色的新方法。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →