Agent-Driven Multi-View Facial Prior Learning for Identity-Preserving Pose-Guided Generation
该论文提出了 ADF-Pose,这是一个由代理驱动的框架,其特征是包含一个身份先验提取器和一个多模态身份转换器,旨在通过在姿态引导的人像生成中有效保留面部身份和细粒度细节,特别是针对现有方法难以应对的大幅度姿态变化情况。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图给一位朋友拍张照片,但你不是要求他们转头,而是要求计算机去想象如果他们面向不同的方向,会是什么样子。目标是创造出一张看起来完全像那个人的新照片,保留他们独特的面部、下颌轮廓以及皮肤纹理,同时将他们置于一个新的姿势中。这就是姿态引导图像生成的挑战。多年来,计算机在移动人体方面已经做得相当出色,能够调整手臂和腿部以匹配新的站姿。然而,当计算机尝试转动头部时,结果往往感觉不对劲。脸部可能会失去特定的形状,眼睛可能会移位,或者皮肤看起来像一个光滑的塑料面具。计算机之所以难以应对,是因为它通常将整个人视为一张大图,从而忽略了那些让一张脸真正具有独特性的微小而关键的细节,尤其是在那张脸背对相机时。
一组研究人员开发了一种新方法来解决这个问题,该系统以一种前所未有的细致程度来对待面部。他们的系统并不依赖于对脸部在新角度下可能呈现出的单一、模糊的猜测,而是从多个视角构建出一个详细的面部心理模型。他们将这种方法称为 ADF-Pose。它的工作原理是首先从原始照片中分离出面部,然后使用一个智能的自动化助手来想象面部缺失的部分。如果照片中的人稍微向左看,系统不仅仅是猜测右侧看起来是什么样子;它会构建一个逻辑严密、经过验证的该侧版本,并检查其工作,以确保鼻子、嘴巴和下颌线仍然属于同一个人。这个过程创建了一组“面部先验”(facial priors),它们本质上是该人从正面、左侧和右侧视角的经过验证的蓝图。
一旦这些蓝图准备就绪,系统会将它们与一段关于该人面部特征的文字描述相结合。然后,它将这些组合后的信息输入到一个强大的图像生成器中,这是一种以从零开始创建逼真图像而闻名的人工智能。生成器在绘画过程的每一个步骤中——从最初的草图到最后的皮肤纹理精调——都会使用这些详细的蓝图和描述。这确保了人物的身份被锁定在原位,防止脸部在身体移动时发生漂移或变形。研究人员在大量的时尚和街拍图像集上测试了这种方法,并将结果与现有的最佳技术进行了对比。他们发现,他们的系统在保持脸部看起来像原作者方面明显更好,即使在头部大幅转向侧面时也是如此。
结果显示,在保持身份一致性方面有了明显的提升。在利用时尚图像数据集进行的测试中,这种新方法在面部相似度方面达到了 0.312 的得分,比之前的最佳得分 0.275 有了显著的飞跃。它还产生了更清晰的细节,与领先的替代方案相比,面部纹理的模糊度降低了约 7.4%。当把图像放在一起进行对比时,差异是惊人的。旧的方法往往产生看起来合理但平庸的面孔,特征变得柔和或比例略有偏差。然而,新系统即使在人旋转到侧脸视图时,也能保持特定的下颌轮廓、精确的眼睛间距以及嘴角周围的细微线条。系统在保持这些细节的同时,并没有牺牲身体其他部分的真实感,使服装和姿态看起来依然自然。
研究人员还对他们的系统进行了拆解,以了解哪些部分起到了核心作用。他们发现,系统构建并验证面部缺失视角的步骤是最关键的。如果没有这一步,脸部就会失去其独特的形状。第二重要的部分是系统如何将视觉蓝图与文字描述相结合,确保计算机不仅理解脸部看起来是什么样,还理解其特征是如何相互关联的。最后,在图像生成过程的每个阶段都输入这些信息的方法,确保了身份细节不会随着图像变得清晰而丢失。虽然该系统并不完美,在原始面部被严重遮挡或太小而无法看清时仍会遇到困难,但它代表了一个重要的进步。它超越了仅仅移动像素的做法,转而真正理解并保留人类面部复杂的、独特的几何结构,从而允许计算机生成出那些让人感觉确实是原本那个人的新姿态。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。