← 最新论文
💻 computer science

TGRHuman: Text-Guided Realistic 3D Human Generation via Diffusion Renderer

TGRHuman 是一种新颖的文本引导框架,它通过将几何与纹理的合成过程解耦,并利用带有扩散渲染器的显式多视图观测生成,从而高效地生成高质量且一致的 3D 人体几何与纹理,进而克服了传统基于 NeRF 方法的局限性。

原作者: Muxin Zhang, Chaohui Yu, Yuanwang Yang, Min Wei, Zhuo Su, Kun Li

发布于 2026-08-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Muxin Zhang, Chaohui Yu, Yuanwang Yang, Min Wei, Zhuo Su, Kun Li

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你是一位试图建造一个完美的、真人比例的人像雕塑的建筑师,但你手里只有一句描述他们的话,比如“穿着绿色外套的徒步旅行者”。在计算机图形学的世界里,这就是3D人体生成的圣杯。长期以来,制作这些数字人就像是戴着厚厚的冬用手套在雕刻粘土;结果往往是摇晃、模糊,或者从不同角度看时看起来完全不同。核心挑战在于平衡三件事:让人物看起来真实(高质量)、确保他们在各个角度看起来都一致(一致性),以及做得足够快以发挥其实用价值(效率)。

要理解这个新的解决方案,你需要了解两个基本工具。首先是扩散模型(diffusion),这是一种像数字艺术家一样的AI,它从一个充满静电噪声的电视屏幕开始,慢慢清理画面,直到出现清晰的图像。其次是NeRF(神经辐射场),这是一种通过学习2D图像来构建3D物体的方法,但它通常很慢,并且容易产生混乱,导致出现奇怪的“幽灵”伪影。研究人员一直问的核心问题是:我们能否利用扩散模型强大的、快速的图像生成能力,在不陷入旧方法那种缓慢、混乱陷阱的情况下,构建出一个完美的3D人体?

于是有了 TGRHuman,一种全新的方法,它像一位大师级的匠人,决定不再试图同时完成雕塑和上漆的工作。研究人员不再纠结于一个复杂且单一的过程,而是将工作拆分为两个截然不同的、易于管理的步骤:首先雕刻形状,然后绘制皮肤。

该论文介绍了一种将人类的几何结构(其3D形状)与其纹理(其皮肤和衣服)进行解耦(分离)的方法。在过去,许多方法试图使用一种被称为“分数蒸馏(score distillation)”的技术同时处理两者,作者将其比作一个缓慢、磨人的过程,仅为一个人的生成可能就需要数小时,且经常导致模糊、过度平滑的混乱结果。TGRHuman拒绝了这种缓慢的一体化方法。相反,它使用了一个巧妙的两阶段流水线。

首先,针对几何结构,系统会生成高分辨率的“法线贴图(normal maps)”。把法线贴图想象成一种特殊的蓝图,它告诉计算机表面上的每一个微小凸起是朝向哪个方向的,而不仅仅是显示颜色。AI会创建四张这样的蓝图(前、后、左、右),且分辨率极高。接着,它使用一种“几何雕刻”策略。想象一下拿一块粗糙的粘土(基于标准的真人模板),并使用这些蓝图来剔除多余的材料。由于系统同时从四个角度观察形状,它可以雕刻出复杂的细节,比如宽松、飘逸的外套,而不会导致形状坍塌或看起来很怪异。这一步速度很快,并能产生一个坚实的3D网格。

其次,针对纹理,系统面临着一个更难的问题:如何在给全身涂色时既不漏掉部位,又能确保当你绕着雕像走动时颜色不会发生冲突。作者意识到,仅仅看几张照片是不够的;你需要一个“纹理先验(texture prior)”,这就像是在开始绘画之前,脑海中已经有了整套服装应该长什么样的草图。他们首先生成一张粗略的正面视图,然后将其“展开”到一张2D地图上(就像剥开苏打水罐上的标签并将其铺平一样)。他们使用AI的图像修复工具来填补这张地图上的缺失部分。一旦准备好这张“主图”,他们就会使用一种特殊的扩散渲染器(diffusion renderer)。这个渲染器就像一个神奇的投影仪,可以将主图从任何角度投影到3D模型上,确保无论你是从正面、侧面还是背面看,图案都能完美对齐。

结果令人印象深刻。论文显示,TGRHuman可以在一台高性能计算芯片上,在大约 5分钟 内生成具有宽松衣物(如大夹克或飘逸裙子)的多样化、逼真的3D人体。相比之下,它所竞争的旧方法通常需要 1到2小时 或更长时间。新方法产生的细节更锐利,且减少了身体部位衔接处出现的“幽灵”伪影。作者将其与几种顶尖方法进行了测试,发现TGRHuman在视觉质量和3D模型与文本描述的匹配度方面始终得分更高。

然而,论文也诚实地指出了其局限性。虽然该系统非常擅长处理宽松的衣物,但有时在处理非常细微的高频细节(如手指或发丝)时会显得吃力,这些细节有时看起来会有些融合或模糊,尤其是在人物处于非常扭曲的姿势时。它还指出,如果姿势是AI从未见过的,结果可能会看起来有点奇怪。但总的来说,通过将形状制作与绘画分离,并使用智能的多视角方法,TGRHuman提供了一种更快、更干净的方式来将文本描述转化为3D现实,证明了有时构建复杂的数字人生的最佳方式就是循序渐进。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →