← 最新论文
💻 computer science

Beyond Facial Consistency: Personalized Person Image Generation with Holistic Identity Preservation

本文引入了一种由动态平衡缩放(DBS)策略增强的双分支框架,旨在解决个性化人物图像生成中面部忠实度与整体外观一致性之间的权衡问题,并同步发布了用于全面身份评估的 Pexels-100 基准测试集。

原作者: Yuxuan Xiao, Shanshan Zhang, Jian Yang, Shengcai Liao

发布于 2026-07-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Yuxuan Xiao, Shanshan Zhang, Jian Yang, Shengcai Liao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一位电影制片厂的导演,但你雇佣的不是演员,而是一个神奇的摄像机,只要你描述出任何角色,它就能将其变幻出来。你想要一个英雄,看起来和你最好的朋友一模一样——同样的笑容、同样的眼神、甚至连那略显俏皮的鼻子都分毫不差——只不过他穿着宇航服站在火星上,或者正骑着一条巨龙穿梭在欧洲中世纪的森林里。这就是“个性化图像生成”的梦想。长期以来,AI艺术家必须在两个令人沮丧的选项中做出选择:要么让角色的脸部看起来完全像你的朋友,却忘记了他们穿着什么或身体形态如何;要么为他们穿上完美的服装和姿态,结果却变成了一个陌生人的脸。这就像是在烤一个蛋糕,你可以把糖霜做得完美无瑕,或者把海绵蛋糕做得完美无缺,但两者无法同时兼得。这篇论文深入探讨了人工智能中的这个特定领域,致力于解决一个棘手的问题:当AI被要求将一个人置于新场景时,如何保持其“完整的自我”的一致性——包括其面部特征以及整套服装和气质。

由 Yuxuan Xiao 及其同事领导的研究团队决定不再二选一。他们首先构建了一个“天真双分支”(Naive Dual-Branch)系统,这本质上是为AI设计的一条双车道高速公路。一条车道专注于宏观图景(衣服、体型、发型),而另一条车道则聚焦于面部的微小细节。他们发现,虽然这种双车道方法是一个不错的开始,但有点混乱。其中“面部车道”开得太快,几乎接管了整辆车,而“外观车道”则在后视镜中逐渐消失。结果呢?脸部很棒,但衣服有时会变形,或者体型会被挤压变形。

为了解决这个交通拥堵问题,团队发明了一个聪明的交通控制系统,叫做动态平衡缩放(Dynamic Balancing Scaling, DBS)。把它想象成一位聪明的管弦乐团指挥。这位指挥使用了两个主要技巧。首先,他们使用了自适应时间门控(Adaptive Temporal Gating),这就像一个调光开关,可以在歌曲的不同时刻改变面部和身体乐手的音量。在过程初期,指挥可能会让面部演奏一段稳定可靠的旋律以奠定身份基调,但随着歌曲的进行,他们会轻轻调高身体和服装的音量,以免它们被淹没。其次,他们引入了区域感知优化(Region-Aware Optimization)。想象一下AI正在画一幅画,而它通常用同样的笔触压力来绘制整个画布。这个新技巧告诉AI:“嘿,在画脸部时要超级小心且精准,但不要忘了给衣服和背景也投入同样的注意力。”这确保了AI不会过度痴迷于眼睛而忽略了衬衫。

团队在他们创建的一个名为 Pexels-100 的自定义基准测试集上测试了他们的新方法,该测试集包含100张不同的全身图像,旨在观察AI在不同场景下保持个人身份完整性的能力。结果非常理想。他们的方法比其他开源工具更好地实现了平衡,既保持了面部的辨识度,又确保了服装和身体形态的正确性。事实上,他们的方法表现出色,甚至可以媲美一些昂贵的闭源商业系统。然而,作者也谨慎地指出,这还不是解决所有问题的万能药。如果你要求AI画一个正在做复杂体操翻转或展示复杂手部动作的人,图像可能仍然会变得有些摇晃或扭曲,因为底层的AI模型在处理这些复杂的物理结构时仍然存在困难。但在大多数日常场景中,这个新的“指挥家”帮助AI终于实现了和谐共鸣,让整个人看起来依然是他们自己,而不仅仅是那张脸。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →