← 最新论文
📊 statistics

Towards More General Control of Diffusion Models Using Jeffrey Guidance

本文引入了 Jeffrey 指导(Jeffrey guidance),这是一个利用 Jeffrey 规则将扩散模型的控制能力从标准条件采样扩展开来的原则性框架,通过将边缘分布向预设目标更新,同时最大限度地减少对联合分布的扰动,从而实现更高的图像质量和公平性。

原作者: Raphaël Razafindralambo, Rémy Sun, Frédéric Precioso, Jes Frellsen, Pierre-Alexandre Mattei

发布于 2026-06-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Raphaël Razafindralambo, Rémy Sun, Frédéric Precioso, Jes Frellsen, Pierre-Alexandre Mattei

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一位极具天赋的艺术家(一个扩散模型),他能从无到有地画出精美的画作。这位艺术家很棒,但有时你只想微调他的作品,而不想重新雇佣一位新艺术家,也不想让他从头开始重新学习。你只是想说:“嘿,把天空变得更蓝一点,”或者“确保人群中男女比例相等。”

通常,艺术家有一种简单的实现方式:你给出一个特定的标签,比如“猫”,然后他尝试画一只猫。这被称为分类器引导(Classifier Guidance)。但如果你不想使用特定的标签呢?如果你想改变绘画的整体氛围,比如让色彩风格匹配某本相册,或者确保人群不会偏向某一性别。标准的指令在处理这些模糊的、“大局观”式的目标时显得力不从心。

这篇论文介绍了一种新方法,叫做 Jeffrey 引导(Jeffrey Guidance)。你可以把它想象成一个控制艺术家想象力的“万能遥控器”。

核心思想:“Jeffrey 规则”

要理解其中的奥妙,想象你有一本食谱指南(联合分布),它告诉你如何根据现有的食材(属性,如性别或年龄)来制作一道菜(图像)。

  • 旧方法(贝叶斯/标准引导): 如果你想要特定的菜肴,你会说:“我要做‘意大利面’的食谱。”艺术家会查找“意大利面”并开始烹饪。这是僵化的。
  • 新方法(Jeffrey 引导): 想象你并不在乎具体的食谱,但你希望最终餐点的“风味特征”符合某个特定目标(比如“我希望人群中是 50% 的男性和 50% 的女性”)。Jeffrey 规则是一个数学技巧,它说:“保持烹饪方法完全不变,但通过更换食材来匹配你想要的新风味特征。”

它更新了“边缘分布”(食材的整体混合比例)以匹配你的目标,同时保持了“条件分布”(艺术家如何绘制细节)完好无损。这是实现目标所能做出的最微小的改变。

类比 1:DJ 与播放列表(嵌入引导)

想象艺术家是一位 DJ。这里的“嵌入(embedding)”就像是他们正在播放的音乐流派。

  • 问题: DJ 播放的混音效果通常与原始热门歌曲(训练数据)略有不同。“FID”得分就像是一个音乐评论家,用来评价 DJ 的混音与原始热门歌曲的接近程度。
  • Jeffrey 的修复方案: 作者使用 Jeffrey 引导来告诉 DJ:“不要只随便放首歌;要让整个播放列表听起来完全像原始的 Top 40 热单一样。”
  • 结果: DJ 并没有改变他们的混音风格(神经网络没有被重新训练)。他们只是在表演过程中调整了某些曲目的音量。结果如何?播放列表听起来比原来更像那些热门单曲了(FID 得分显著下降),尽管单曲本身听起来仍然保留了 DJ 的风格。

类比 2:座位表(公平性与去相关性)

想象艺术家正在举办一场派对,并正在生成一份宾客名单。

  • 问题: 在原始的宾客名单中,艺术家不小心邀请了过多的“年轻女性”,而几乎没有“老年男性”。此外,“年轻”和“男性”之间存在奇怪的关联(也许艺术家只把年轻男性联想为“运动员”,而把年轻女性联想为“舞者”)。
  • 目标: 主办方希望举办一场公平的派对。他们希望:
    1. 性别平等: 正好 50% 的男性和 50% 的女性。
    2. 去相关性: “年轻”不应该自动意味着你是“男性”或“女性”。它们应该是相互独立的。
  • Jeffrey 的修复方案: 作者并没有告诉艺术家“画一个男人”或“画一个女人”,而是使用 Jeffrey 引导来说:“调整宾客名单,使得男女性别的整体比例为 50/50,并打破年龄与性别之间的联系。”
  • 结果:
    • 平等性: 派对变得完美平衡(50/50),且没有破坏邀请函的质量(图像看起来依然很好)。
    • 去相关性: “年轻”与“男性”之间的奇怪联系被打破了。艺术家开始以一种自然且独立的方式邀请年轻男性、年轻女性、老年男性和老年女性,而不是遵循某种隐藏的偏见。

为什么这很重要?

  1. 即插即用: 你不需要重新训练艺术家。你只需要在艺术家工作时添加一个小的“修正项”。
  2. 灵活性高: 你不局限于像“猫”或“狗”这样简单的标签。你可以瞄准复杂的目标,例如“匹配特定数据集的统计分布”或“消除两个特定特征之间的偏差”。
  3. 有理有据: 这不仅仅是一个随机的猜测或临时补丁。它是基于一个坚实的数学规则(Jeffrey 规则),该规则保证了你在实现新目标时,是对原始模型做出了最小程度的改变。

潜在的局限

论文指出,虽然这种方法在“统计数据”(数字层面)上表现出色,但有时人类肉眼并不会注意到图像本身的巨大变化。这就像调收音机:信号(统计特性)非常完美,但对于普通听众来说,歌曲(图像)本身听起来可能基本没变。然而,对于处理公平性或匹配特定数据分布等任务,这种“隐形微调”恰恰是所需要的。

简而言之,Jeffrey 引导为我们提供了一种精确的数学方法,可以引导 AI 艺术生成器朝着特定的统计目标(如公平性或匹配数据集)前进,而无需从头构建引擎。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →