想象一下,你有一张心爱的爱犬照片,你想让 AI 在新的场景中画出同一只狗:比如玩接球游戏、在地毯上睡觉,或者戴着派对帽。
目前 AI 绘画工具面临的一个大问题是“悖论”。
- 如果你要求 AI 非常小心地确保画出的狗看起来和你的狗一模一样,它就会变得懒惰。它会每次都画出完全相同的姿势、完全相同的背景。这就像一台拒绝翻页的复印机。
- 如果你要求 AI 具有创造力去改变姿势,它往往会忘记你的狗长什么样。结果可能是一只可爱的狗,但那不再是你的那只狗了。
这篇论文的作者开发了一个名为 DivRL 的新系统来解决这个问题。他们希望 AI 既能完美保留你爱犬的特征,又能让它做各种有趣的新动作。
以下是他们如何实现的,我们使用简单的类比来解释:
1. 两位“教练”
AI 有两位不同的教练在给它反馈,但他们通常会互相争吵。
- 身份教练(“长相一致”教练): 这位教练负责检查:“这张新画作看起来像原来的那只狗吗?”如果鼻子不对,他们就会大喊:“不对!”
- 多样性教练(“派对”教练): 这位教练负责检查:“这太无聊了!是不是又是那个姿势?”如果狗只是坐在那里不动,他们就会大喊:“太无聊了!让它跳舞!”
通常,如果你试图同时听从这两位教练,AI 会感到困惑,导致两边都做不好。
2. 秘密武器:“负向镜像”(nSSM)
为了解决“无聊”的问题,作者发明了一个特殊的工具,叫做 nSSM(负向自相似度度量)。
把原照片看作一份蓝图。
- 旧的 AI 方法只是将整张图片与蓝图进行比较。如果狗移动了一条腿,整张图片看起来就不一样了,于是 AI 就会认为这是“错误”的。
- 新的 nSSM 工具观察的是狗各部分之间的内部关系。它会问:“在原图中,耳朵在眼睛上方。那么在这张新画作中,耳朵是否仍然在眼睛上方?”
- 如果答案是“是的,但狗现在正在奔跑”,这个工具就会说:“太棒了!结构虽然变了,但各部分之间的连接依然正确。”
- 这鼓励了 AI 去改变姿势(奔跑、跳跃、睡觉),而不会破坏狗的身份特征。
3. 策略:“探索与抑制”
作者意识到,如果他们告诉 AI 同时听从两位教练,AI 会陷入恐慌。因此,他们使用了一种名为**“探索与抑制”(Explore-and-Suppress)**的两步策略。
这就是神奇之处:AI 可以自由地探索任何具有创造性的路径,只要它不越过“忘记狗是谁”这条界限。这让两位教练从敌人变成了队友。
4. 结果
当他们在著名的基准测试(DreamBench++)上测试此方法时,结果令人印象深刻:
- 旧 AI: 要么看起来完全像那只狗,但每次姿势都一模一样;要么看起来很有变化,但不再是那只狗了。
- DivRL(他们的的方法): 狗看起来完全就是那只真实的狗,但它正在做各种各样的新事情:下棋、漂浮在云端,或者在星空中绘画。
总结
论文声称,通过将“保持创造力”的任务与“保持不变”的任务分离,并使用一个智能“门卫”来过滤掉糟糕的尝试,他们解决了“身份-多样性悖论”。他们不仅让 AI 更擅长绘画,还教会了它如何在不丢失记忆的情况下发挥创造力。
技术摘要:DivRL —— 用于多样化主题驱动生成的解耦自相似性奖励
1. 问题陈述:身份-多样性悖论 (The Identity-Diversity Paradox)
主题驱动的图像生成旨在合成特定主题的新颖图像,同时在多样化的上下文、姿态和风格中保持其视觉特征。尽管基于扩散的模型已具备极高的保真度,但仍存在一个被称为“身份-多样性悖论”的基本张力。
- 冲突: 强力执行身份保持的模型往往会陷入生成与参考图近乎重复的图像的困境,表现出僵化的姿态、视角和表情。相反,鼓励结构多样性的方法经常遭受“身份漂移”的影响,即生成的角色失去了其核心特征。
- 根本原因: 这一悖论源于身份定义的视觉属性与参考图像中的空间结构是纠缠在一起的。当模型试图保持身份时,会无意中保留了这些纠缠的空间结构信息,从而降低了多样性。当模型试图改变结构时,则面临修改身份定义属性的风险。
- 现有奖励机制的局限性: 现有的基于身份的奖励通常会鼓励结构模仿,因为模型可以通过复制参考图像的精确空间配置来最大化身份得分,而不是去探索新颖且符合身份一致性的变化。
2. 方法论:DivRL 框架
作者提出了 DivRL,这是一个基于强化学习(具体为 Flow-GRPO)的后训练框架,旨在联合优化身份一致性和结构多样性。其核心创新在于通过特定的奖励设计和“探索-抑制”(Explore-and-Suppress)优化策略来解耦这两个目标。
2.1 奖励设计
该框架利用从解耦视觉特征(具体使用来自鲁棒相似性模型的 MTG 视觉特征)中提取的两种截然不同的奖励信号:
用于身份一致性的视觉语义匹配 (VSM):
- VSM 通过计算参考图像与生成图像之间的语义和视觉相似度矩阵来评估身份保持情况。
- 它识别语义一致的区域(即语义相似度超过阈值 τs 的区域),并评估这些区域内的视觉一致性。
- 更高的 VSM 得分意味着在不同条件下对主体身份的保持效果更好。
用于结构多样性的负自相似性度量 (nSSM):
- 不同于全局特征差异度量,nSSM 通过分析视觉特征的内部关系来量化多样性。
- 它计算参考图像和生成图像视觉特征网格的自相似性矩阵 (SSM)。这些矩阵捕捉了物体部件的内在空间组织。
- nSSM 定义为 1−ρ,其中 ρ 是参考图像与生成图像 SSM 之间的皮尔逊相关系数。
- 逻辑: 高相关性意味着相似的结构布局(低多样性),而较低的相关性则对应于结构多样化的上下文(例如不同的姿态或视角)。最大化 nSSM 鼓励模型探索结构上不同的配置。
- 稳定性: 为了防止高频纹理伪影(一种模型模仿局部相关性而非改变全局结构的奖励作弊行为),在计算 SSM 之前,视觉特征通过 2×2 平均池化进行了下采样。
2.2 优化策略:“探索-抑制” (Explore-and-Suppress)
通过线性加权直接同时优化这两个目标会导致训练不稳定和奖励作弊。相反,DivRL 采用了两阶段门控优化策略:
- 第一阶段(探索): 模型仅使用 nSSM 作为奖励进行训练。这鼓励模型自由探索潜在空间,生成结构多样化的配置,从而打破预训练模型的僵化性。
- 第二阶段(抑制): 模型使用门控奖励公式进行训练。
- VSM 起到约束(门控)的作用。
- 如果样本的 VSM 得分高于阈值 s,则给予 nSSM 奖励。
- 如果 VSM 得分低于 s,则应用二次铰链损失惩罚:R=nSSM−λ(s−VSM)2。
- 效果: 这将身份保持从一个竞争性目标转变为一个可行性约束。只要保持在身份一致的区域内,模型就可以自由地探索多样化的结构。这种解耦使得 nSSM 和 VSM 能够共同提升,而不会出现一个目标的梯度破坏另一个目标的情况。
3. 核心贡献
本文概述了三个主要贡献:
- nSSM 指标: 引入了负自相似性度量,这是一种特征空间指标,通过分析解耦视觉特征的自相似性相关性来量化结构多样性,而非仅仅关注全局特征差异。
- “探索-抑制”策略: 一种新型优化方法,通过门控奖励公式将多样性探索与身份保持解耦,有效地将身份保持从一个冲突的目标转变为一个约束。
- 实证验证: 在 DreamBench++ 基准测试中使用 Flux-Kontext 作为骨干网络进行了验证,结果表明该方法在保持竞争力的身份一致性的同时,提升了结构多样性。作者指出,nSSM 公式和两阶段优化策略是与骨干网络无关的。
4. 实验结果
该方法在 DreamBench++ 基准测试上进行了评估,对比的强基线模型包括 Flux-IP-Adapter、OmniGen、OmniGen2、UNO 和 PaCo-RL。
定量性能:
- 平衡性: 与基线相比,DivRL 在身份一致性和结构多样性之间实现了卓越的平衡。虽然仅优化 VSM 会提高一致性但损害多样性,而仅优化 nSSM 会提高多样性但损害一致性,但结合后的方法在保持高一致性(与 Flux-Kontext 相当)的同时,显著提升了多样性指标(MTG-nSSM, DINO-nSSM)。
- 提示词遵循能力: 有趣的是,该方法提升了提示词对齐度。作者将其归功于对预训练诱导的“几何僵化”的缓解;通过鼓励结构多样性,模型能更有效地使主题适应上下文提示指令。
- 一致性 vs. 多样性的权衡: “一致性比率 vs. 多样性/一致性比”的图表显示,DivRL 占据了高实用性区域,即两个目标共存的区域,优于那些无法同时提升两个目标的线性组合奖励方法。
定性观察:
- 基线模型如 Flux-Kontext 和 PaCo-RL 经常产生僵硬的输出,或者无法遵循提示词交互(例如,无法将主题置于特定场景中)。
- 其他模型(如 OmniGen)虽然能产生多样化的输出,但存在身份漂移的问题。
- DivRL 成功生成了具有多变姿态、视角和表情的图像,同时保留了参考主体的细粒度视觉细节。
5. 重要性与局限性
重要性:
本文识别了结构模仿是现有主题驱动生成方法的一个关键失效模式。通过显式地分离结构多样性与身份保持,DivRL 解决了“身份-多样性悖论”。“探索-抑制”策略表明,将身份视为一个可行性约束而非竞争性目标,可以让模型探索高质量的潜在空间,使身份与新颖性并存。
局限性:
作者谦虚地承认了一些限制:
- 指标范围: 多样性指标 (nSSM) 侧重于结构变化(姿态、视角),可能无法完全捕捉更高层级的语义多样性或复杂的组合变化。
- 计算成本: 依赖强化学习进行后训练,与纯前馈方法相比,引入了额外的计算开销。
- 输入约束: 基础模型 (Flux-Kontext) 接受单张参考图像,这可能会限制在参考图像包含模糊身份线索或复杂遮挡时的有效性。
论文最后指出,未来的工作可以通过更丰富的多样性指标、更高效的优化策略以及多参考条件来实现这些改进。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。