想象一下,你是一位电影制片厂的导演,但你雇佣的不是演员,而是一个神奇的摄像机,只要你描述出任何角色,它就能将其变幻出来。你想要一个英雄,看起来和你最好的朋友一模一样——同样的笑容、同样的眼神、甚至连那略显俏皮的鼻子都分毫不差——只不过他穿着宇航服站在火星上,或者正骑着一条巨龙穿梭在欧洲中世纪的森林里。这就是“个性化图像生成”的梦想。长期以来,AI艺术家必须在两个令人沮丧的选项中做出选择:要么让角色的脸部看起来完全像你的朋友,却忘记了他们穿着什么或身体形态如何;要么为他们穿上完美的服装和姿态,结果却变成了一个陌生人的脸。这就像是在烤一个蛋糕,你可以把糖霜做得完美无瑕,或者把海绵蛋糕做得完美无缺,但两者无法同时兼得。这篇论文深入探讨了人工智能中的这个特定领域,致力于解决一个棘手的问题:当AI被要求将一个人置于新场景时,如何保持其“完整的自我”的一致性——包括其面部特征以及整套服装和气质。
由 Yuxuan Xiao 及其同事领导的研究团队决定不再二选一。他们首先构建了一个“天真双分支”(Naive Dual-Branch)系统,这本质上是为AI设计的一条双车道高速公路。一条车道专注于宏观图景(衣服、体型、发型),而另一条车道则聚焦于面部的微小细节。他们发现,虽然这种双车道方法是一个不错的开始,但有点混乱。其中“面部车道”开得太快,几乎接管了整辆车,而“外观车道”则在后视镜中逐渐消失。结果呢?脸部很棒,但衣服有时会变形,或者体型会被挤压变形。
为了解决这个交通拥堵问题,团队发明了一个聪明的交通控制系统,叫做动态平衡缩放(Dynamic Balancing Scaling, DBS)。把它想象成一位聪明的管弦乐团指挥。这位指挥使用了两个主要技巧。首先,他们使用了自适应时间门控(Adaptive Temporal Gating),这就像一个调光开关,可以在歌曲的不同时刻改变面部和身体乐手的音量。在过程初期,指挥可能会让面部演奏一段稳定可靠的旋律以奠定身份基调,但随着歌曲的进行,他们会轻轻调高身体和服装的音量,以免它们被淹没。其次,他们引入了区域感知优化(Region-Aware Optimization)。想象一下AI正在画一幅画,而它通常用同样的笔触压力来绘制整个画布。这个新技巧告诉AI:“嘿,在画脸部时要超级小心且精准,但不要忘了给衣服和背景也投入同样的注意力。”这确保了AI不会过度痴迷于眼睛而忽略了衬衫。
团队在他们创建的一个名为 Pexels-100 的自定义基准测试集上测试了他们的新方法,该测试集包含100张不同的全身图像,旨在观察AI在不同场景下保持个人身份完整性的能力。结果非常理想。他们的方法比其他开源工具更好地实现了平衡,既保持了面部的辨识度,又确保了服装和身体形态的正确性。事实上,他们的方法表现出色,甚至可以媲美一些昂贵的闭源商业系统。然而,作者也谨慎地指出,这还不是解决所有问题的万能药。如果你要求AI画一个正在做复杂体操翻转或展示复杂手部动作的人,图像可能仍然会变得有些摇晃或扭曲,因为底层的AI模型在处理这些复杂的物理结构时仍然存在困难。但在大多数日常场景中,这个新的“指挥家”帮助AI终于实现了和谐共鸣,让整个人看起来依然是他们自己,而不仅仅是那张脸。
技术摘要:超越面部一致性:基于全方位身份保持的个性化人物图像生成
问题陈述
个性化人物图像生成旨在根据参考图像和文本提示词,合成符合用户身份特征的图像。现有方法面临着一个根本性的权衡:它们通常要么强调主体一致性(保留全局外观、服装和体型),要么强调面部一致性(保留局部面部结构和细节),但很少能同时实现两者。现有的方法在尝试结合这两者时往往表现出不稳定性,导致出现面部身份得到保留但整体外观受损,或反之亦然的情况。这种失衡源于不同身份分支之间异构的表示空间和注入机制,这些机制会导致在去噪过程中产生不协调的相互作用,并导致面部分支持续过度主导。
方法论
作者提出了一个基于 FLOC.1-dev 扩散 Transformer 主干网络的统一框架,引入了**天真双分支(Naive Dual-Branch, NDB)基准模型,并利用动态平衡缩放(Dynamic Balancing Scaling, DBS)**微调策略对其进行了优化。
天真双分支 (NDB) 基准:
该框架集成了两个不同的条件路径:
- 外观分支(Appearance Branch): 基于 InstantCharacter [23],该分支通过由 Q-Former 投影并经由交叉注意力注入的融合 DINOv2 和 SigLIP 特征,捕捉全局身份线索(发型、身体比例、服装)。
- 面部分支(Face Branch): 基于 InfiniteYou [10],该分支利用预训练的面部编码器,专注于细粒度的面部几何与纹理,并通过类 ControlNet 的残差路径进行注入。
虽然这种组合取得了初步成果,但它表现出一种不稳定性,即面部分支会主导生成过程,导致外观不一致。
动态平衡缩放 (DBS):
为了协调这两个分支并减轻面部分支的主导地位,DBS 引入了两个互补的组件:
- 自适应时间门控 (Adaptive Temporal Gating, ATG): 一种时间感知机制,能够在整个去噪轨迹中动态调节外观分支和面部分支的贡献强度。面部分支作为一个稳定的参考锚点,而外观分支的贡献相对于该锚点逐渐放宽。这防止了训练早期的不稳定优化,并确保了在不同时间步长下的平衡引导。
- 区域感知优化 (Region-Aware Optimization, RAO): 一种旨在解决空间不平衡问题的损失函数。由于面部区域较小而外观区域较大,标准的全局均方误差 (MSE) 提供的是均匀监督,无法有效优化特定区域。RAO 将去噪误差分解为三个区域目标:面部 (Lf)、外观 (La) 和全局 (Lg)。它采用了一种参考引导的帕累托式(Pareto-style)聚合方式,即只有当面部和外观损失相对于指数移动平均(EMA)参考值表现不佳时,才会激活相应的损失,而全局损失则作为持久的背景目标。这在保护特定区域身份线索的同时,防止了单一分支主导优化轨迹。
核心贡献
- 天真双分支 (NDB) 方法: 提出在共享生成框架内显式地分别对外观和局部面部特征进行建模,以解决全方位身份一致性的问题。
- 动态平衡缩放 (DBS): 一种包含自适应时间门控和区域感知优化的微调策略。该策略缓解了由 NDB 基准中强信号主导导致的整体一致性维持不足的问题,实现了面部保真度与外观一致性之间更好的权衡。
- Pexels-100 基准: 构建了首个专门用于评估个性化人物生成中全方位身份一致性的测试基准,利用全身图像和文本提示词来评估其在面部和外观维度的表现。
实验结果
该方法在 Pexels-100 基准上进行了评估,使用的指标包括面部相似度 (ArcFace)、人物重识别 (ReID)、DINOv2 得分和 CLIP-T。
- 定量性能: 所提出的方法在全方位身份一致性方面优于现有的开源基准(如 InstantCharacter, InfiniteYou, UNO, Kontext)。具体而言,它实现了 0.7875 的面部得分和 0.3202 的 DINOv2 得分,超过了大多数开源模型,并与闭源商业系统(如 GPT-Image-2)保持了竞争力。
- 定性性能: 视觉对比表明,虽然某些方法在面部相似度或服装一致性方面表现出色,但所提方法保持了更佳的平衡,在多种场景下都能同时保留面部身份和整体外观的连贯性。
- 消融实验: 实验证实了 ATG 和 RAO 均对性能提升有所贡献。完整的 DBS 模型实现了最佳的全方位一致性,验证了这些组件是互补而非冗余的。
意义与主张
本文声称提供了一个用于全方位身份建模的可控基础框架。通过解决面部保真度与外观一致性之间的内在权衡,所提出的方法与现有的开源解决方案相比,提供了一种更稳定且可解释的个性化人物生成方法。作者强调,其目标并非孤立地最大化面部相似度,而是提高整个身份表示的连贯性。虽然该方法依赖于基于门控的调制,并未改变主干网络的底层特征学习(这限制了其在复杂姿态或精细结构(如手部)上的表现),但它在统一基于扩散模型的全局与局部身份约束方面迈出了重要一步。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。