← 最新论文
💻 computer science

CrowdGaussian: Reconstructing High-Fidelity 3D Gaussians for Human Crowd from a Single Image

CrowdGaussian 提出了一种统一框架,通过自监督适应流程处理遮挡并引入自校准学习策略,实现了从单张图像直接重建高保真、几何连贯的多人群体 3D 高斯溅射(3DGS)模型。

原作者: Yizheng Song, Yiyu Zhuang, Qipeng Xu, Haixiang Wang, Jiahe Zhu, Jing Tian, Siyu Zhu, Hao Zhu

发布于 2026-03-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Yizheng Song, Yiyu Zhuang, Qipeng Xu, Haixiang Wang, Jiahe Zhu, Jing Tian, Siyu Zhu, Hao Zhu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 CrowdGaussian 的新系统,它的核心能力是:只给你一张普通的人山人海照片,它就能“变”出一个逼真、立体、甚至能 360 度旋转观看的 3D 人群场景。

想象一下,你手里有一张在拥挤的地铁站拍的照片,照片里的人互相遮挡,有的脸被挡住了,有的衣服看不清,而且照片可能还有点模糊。以前的技术要么只能把单个清晰的人变成立体模型,要么一遇到遮挡就“露馅”(比如身体中间出现透明的洞,或者五官扭曲)。

CrowdGaussian 就像是一位拥有“读心术”和“神笔马良”能力的超级 3D 雕塑家。它的工作流程可以分成两个精彩的阶段:

第一阶段:LORM —— “脑补大师”的透视眼

(解决遮挡问题:被挡住的部分怎么办?)

  • 痛点: 在人群里,A 挡住了 B 的半张脸,C 挡住了 D 的腿。以前的模型看到被挡住的地方就“死机”了,或者只能画个大概,导致 3D 模型中间是空的,像玻璃一样透明。
  • CrowdGaussian 的绝招: 它训练了一个叫 LORM 的模型。你可以把它想象成一个经验丰富的老侦探
    • 这个侦探看过成千上万张完整的人体照片(就像背熟了人体结构图)。
    • 当它看到一张被遮挡的照片时,它不会只盯着被挡住的地方发呆,而是利用它脑子里的“人体数据库”进行合理的脑补
    • 比喻: 就像你看到一个人只露出半个头,你知道他后面肯定还有半个头,而且长得什么样。LORM 就是利用这种“常识”,把被挡住的身体部分(比如被前面人挡住的背部、被遮挡的手臂)完整地“画”出来,确保每个人都是实心的、完整的,没有透明的漏洞。
    • 特别之处: 它不需要额外的 3D 数据来教它怎么补全,它是通过一种“自我教学”的方式(看着完整图,自己练习在被遮挡的图上找规律)学会的。

第二阶段:CrowdRefiner —— “美颜修图师”的点睛之笔

(解决模糊和细节问题:画出来了,但不够清晰怎么办?)

  • 痛点: 第一阶段虽然把身体“补全”了,但因为原图可能很模糊,或者人太小,补出来的模型看起来像一团模糊的橡皮泥,没有头发丝、没有衣服纹理,甚至脸是糊的。
  • CrowdGaussian 的绝招: 它引入了一个叫 CrowdRefiner 的模型,这就像一位顶级的 3D 修图师
    • 它基于一种叫“扩散模型”的 AI 技术(就是现在很火的生成式 AI 那种),但它是单步完成的,速度很快。
    • 核心技巧(SCL 策略): 这是最聪明的地方。普通的修图师可能会用力过猛,把原本画得还不错的地方也改坏了(比如把正常的鼻子修歪了)。CrowdRefiner 采用了一种**“自我校准”**的策略:
      • 它一边学习如何把模糊的地方变清晰(比如给模糊的头发加上发丝细节),
      • 一边时刻提醒自己:“别乱动那些本来就画得好的地方!”
    • 比喻: 就像给一幅素描上色。如果某块区域本来就是空白的,它就大胆地画上精美的细节;如果某块区域已经画得很完美了,它就小心翼翼地保持原样,绝不画蛇添足。
    • 最后,它把修好的高清图片“倒灌”回 3D 模型里,让原本模糊的橡皮泥瞬间变成了毛孔清晰、衣服纹理逼真的真人。

总结:它为什么厉害?

  1. 单图起死回生: 以前需要多张角度照片才能建 3D 模型,现在一张照片(哪怕是抓拍)就能搞定。
  2. 无视遮挡: 哪怕人挤人,它也能把每个人“还原”成完整的 3D 小人,没有透明漏洞。
  3. 无视画质: 哪怕原图很糊、分辨率很低,它也能通过 AI 的“想象力”把细节(如头发、衣服褶皱)补得清清楚楚。
  4. 群体作战: 它不是一个个单独处理,而是把整个场景当成一个整体来优化,保证大家站在一起时,光影和位置都很协调。

一句话概括:
CrowdGaussian 就像是一个拥有透视眼和神笔的 3D 魔术师,它能把一张拥挤、模糊、充满遮挡的普通照片,瞬间变成一个个细节丰富、结构完整、可以随意旋转观看的 3D 人群世界。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →