← 最新论文
💻 computer science

DivRL: Disentangled Self-Similarity Rewards for Diverse Subject-Driven Generation

该论文提出了 DivRL,这是一个通过采用带有门控约束的“探索与抑制”策略来共同优化结构多样性与身份一致性的后训练框架,从而解决了主题驱动生成中的身份-多样性悖论。

原作者: Qian Wang, Zhenyu Li, Abdelrahman Eldesokey, Peter Wonka

发布于 2026-06-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Qian Wang, Zhenyu Li, Abdelrahman Eldesokey, Peter Wonka

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一张心爱的爱犬照片,你想让 AI 在新的场景中画出同一只狗:比如玩接球游戏、在地毯上睡觉,或者戴着派对帽。

目前 AI 绘画工具面临的一个大问题是“悖论”。

  • 如果你要求 AI 非常小心地确保画出的狗看起来和你的狗一模一样,它就会变得懒惰。它会每次都画出完全相同的姿势、完全相同的背景。这就像一台拒绝翻页的复印机。
  • 如果你要求 AI 具有创造力去改变姿势,它往往会忘记你的狗长什么样。结果可能是一只可爱的狗,但那不再是你的那只狗了。

这篇论文的作者开发了一个名为 DivRL 的新系统来解决这个问题。他们希望 AI 既能完美保留你爱犬的特征,又能让它做各种有趣的新动作。

以下是他们如何实现的,我们使用简单的类比来解释:

1. 两位“教练”

AI 有两位不同的教练在给它反馈,但他们通常会互相争吵。

  • 身份教练(“长相一致”教练): 这位教练负责检查:“这张新画作看起来像原来的那只狗吗?”如果鼻子不对,他们就会大喊:“不对!”
  • 多样性教练(“派对”教练): 这位教练负责检查:“这太无聊了!是不是又是那个姿势?”如果狗只是坐在那里不动,他们就会大喊:“太无聊了!让它跳舞!”

通常,如果你试图同时听从这两位教练,AI 会感到困惑,导致两边都做不好。

2. 秘密武器:“负向镜像”(nSSM)

为了解决“无聊”的问题,作者发明了一个特殊的工具,叫做 nSSM(负向自相似度度量)。

把原照片看作一份蓝图

  • 旧的 AI 方法只是将整张图片与蓝图进行比较。如果狗移动了一条腿,整张图片看起来就不一样了,于是 AI 就会认为这是“错误”的。
  • 新的 nSSM 工具观察的是狗各部分之间的内部关系。它会问:“在原图中,耳朵在眼睛上方。那么在这张新画作中,耳朵是否仍然在眼睛上方?”
    • 如果答案是“是的,但狗现在正在奔跑”,这个工具就会说:“太棒了!结构虽然变了,但各部分之间的连接依然正确。”
    • 这鼓励了 AI 去改变姿势(奔跑、跳跃、睡觉),而不会破坏狗的身份特征。

3. 策略:“探索与抑制”

作者意识到,如果他们告诉 AI 同时听从两位教练,AI 会陷入恐慌。因此,他们使用了一种名为**“探索与抑制”(Explore-and-Suppress)**的两步策略。

  • 第一步:疯狂探索(“派对”阶段)
    首先,他们告诉 AI:“放开手脚去创作吧!尝试所有可能的姿势、角度和表情。现在还不用追求完美。”

    • 为什么? 这让 AI 能够找到所有有趣且具有创造性的画法。
    • 风险: AI 可能会不小心画出一个看起来完全不像那只狗的怪物。
  • 第二步:保镖(“门卫”阶段)
    现在,他们请来了 身份教练 担任严格的保镖。他们设置了一个关卡。

    • AI 继续尝试进行创意创作,但每当它生成一张图片时,保镖都会检查:“这看起来还是你的狗吗?”
    • 如果是: 图片保留下来。
    • 如果不是: 图片会被丢弃(抑制),并且 AI 会因为尝试了那条特定的路径而受到惩罚。

这就是神奇之处:AI 可以自由地探索任何具有创造性的路径,只要它不越过“忘记狗是谁”这条界限。这让两位教练从敌人变成了队友。

4. 结果

当他们在著名的基准测试(DreamBench++)上测试此方法时,结果令人印象深刻:

  • 旧 AI: 要么看起来完全像那只狗,但每次姿势都一模一样;要么看起来很有变化,但不再是那只狗了。
  • DivRL(他们的的方法): 狗看起来完全就是那只真实的狗,但它正在做各种各样的新事情:下棋、漂浮在云端,或者在星空中绘画。

总结

论文声称,通过将“保持创造力”的任务与“保持不变”的任务分离,并使用一个智能“门卫”来过滤掉糟糕的尝试,他们解决了“身份-多样性悖论”。他们不仅让 AI 更擅长绘画,还教会了它如何在不丢失记忆的情况下发挥创造力。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →