← 最新论文
🤖 machine learning

Adversarial Learning of Classifier-Free Guidance Schedules

本文提出了一种对抗学习框架,该框架通过将问题构建为密度比估计,将无分类器指导调度动态优化为扩散时间、条件和噪声样本的函数,从而在文本生成图像任务中超越了静态和启发式方法。

原作者: Ashwini Pokle, Alexandre Galashov, Arnaud Doucet, Mauricio Delbracio, Valentin De Bortoli

发布于 2026-08-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Ashwini Pokle, Alexandre Galashov, Arnaud Doucet, Mauricio Delbracio, Valentin De Bortoli

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个机器人根据你的口头描述来画画。你告诉它:“画一只在地图上睡觉的黑狗”,它开始于一张看起来像电视雪花一样的空白画布。随后,机器人开始缓慢地清理这些噪声,一步步将这些“雪花”变成清晰的图像。这就是现代“扩散”(diffusion)模型的工作原理。但棘手的部分在于:机器人需要一点“推力”来确保它能听从你的话,而不是只画出一只随机的狗或一张随机的地图。这种推力被称为“引导”(guidance)。把它想象成一个牵着绳子的导游。如果导游拉得太轻,机器人就会走神并忽略你的指令;如果导游拉得太重,机器人就会感到困惑,图像会变得色彩过饱和且怪异,或者看起来像是现实世界的卡通版本。

长期以来,科学家们一直使用一种“一刀切”的方法:他们为整个绘画过程设定一个单一的、固定的引导强度。这就像是告诉导游,从走路的第一秒到最后一秒都要用完全相同的力气去拉绳子。虽然这效果还可以,但往往会导致混乱的结果,因为绘画的不同阶段需要不同程度的帮助。图像的某些部分需要轻微的推动,而另一些部分则需要强有力的掌控。这个领域的重大问题在于:我们能否教会导游根据它在特定时刻正在进行的具体工作,动态地改变其拉绳的力量?

本文提出了一种巧妙的新方法,来教机器人的导游如何“拉绳”。这种方法不是由人类手动设计一个何时用力或何时放松的计划,而是让机器人通过一场“猜猜看真东西”的游戏来学习。我们建立了一个系统,其中一个“判别器”(一个聪明的裁判)试图分辨出一张真实的照片和机器人当前正在绘制的照片之间的区别。机器人的导游则通过学习来调整其拉力强度,使得机器人的绘画看起来如此接近真实照片,以至于裁判无法分辨它们。通过玩这场游戏,导游学会了在每一个步骤中如何调整拉力,并针对特定的图像和你给出的特定词汇进行定制。结果表明,这种方法创造出的图像不仅更加逼真,而且比旧的固定方法更贴近你的原始描述。

“一刀切”式牵引绳的问题

想象一下,你正在公园里遛狗。有时狗很安静,你可以松松地牵着绳子。其他时候,狗发现了松鼠,你需要握紧绳子以防它冲出去。如果你在整个过程中始终保持绳子同样的紧度,你可能会要么让狗冲进车流(太松),要么勒到狗(太紧)。

在 AI 图像生成领域,这种“牵引绳”就是引导权重(通常称为 ω\omega)。多年来,研究人员一直使用一个恒定值,通常在 7.5 左右,贯穿 AI 创建图像的全过程。这虽然有效,但并不完美。有时 AI 会变得过于兴奋,导致颜色变得霓虹般鲜艳且过度饱和;其他时候,它又会忽略你提示词中的细节。

科学家们曾尝试通过创建“计划表”(schedules)来解决这个问题——即手动制定规则,例如“开始时用力拉,中间时轻一点”。但这些规则就像是一张通用的地图:它们不知道你的狗是一只吉娃娃还是一只大丹犬。无论提示词多么复杂,或者图像当前看起来如何,它们都应用同样的规则。

新策略:一场“真与假”的游戏

本文的作者决定不再靠猜测规则,而是让 AI 通过一场游戏来学习。他们使用了对抗学习(adversarial learning)的概念,这就像是两个网络之间的猫鼠游戏:

  1. 生成器(艺术家): 这是创建图像并决定在每一步中如何拉动牵引绳(引导权重)的部分。
  2. 判别器(裁判): 这是一个经过训练的聪明批评家,它通过观察一张图像来判断:“这是一张来自数据集的真实照片,还是 AI 当前的尝试?”

这里有一个神奇的技巧:作者希望 AI 的“引导”图像在每一个时刻都能完美匹配真实照片的分布。他们称之为边缘一致性(marginal consistency)。

为了训练“艺术家”,他们建立了一个循环:

  • 裁判观察一张真实照片和 AI 当前的“引导”照片。
  • 裁判试图分辨它们。
  • 艺术家尝试调整其引导权重以迷惑裁判。
  • 如果裁判无法分辨,说明艺术家做得很好。

通过玩这场游戏,艺术家学会了一个动态计划。它学会了对于像“一只猫”这样简单的提示词,它可能只需要轻微的拉力;但对于像“一只在地图上睡觉的黑狗”这样复杂的提示词,它需要根据正在形成的狗毛或地图细节,以不同的方式进行拉动。

他们的发现

团队在一个标准的文本到图像任务数据集(MS-COCO)上测试了这种新方法,并使用了不同规模的模型。他们将这种“学习型导游”与旧的恒定牵引绳以及手动计划进行了对比。

结果令人振奋。他们的方法(他们称之为 GAN + MC,即带有边缘一致性的生成对抗网络)生成的图像在人类看来一致更受欢迎。具体而言:

  • 对齐度更好: 图像更好地匹配了文本提示词。例如,当被要求画“一只躺在地图书上的黑狗”时,使用该方法的 AI 实际上画出了狗与书的互动,而其他方法有时会忽略这个细节,或者让狗看起来很普通。
  • 更高的审美得分: 在人类评估者眼中,图像看起来更美观、更自然。
  • 权衡之处: 存在一个小小的代价。与某些基准模型相比,该方法的“FID”得分(一个衡量图像统计特性与真实照片接近程度的指标)略高(即表现较差)。作者解释说,这是使用对抗训练和奖励信号的一个已知副作用:模型优先考虑看起来“酷”和匹配提示词,而不是匹配训练数据的精确统计特征。然而,在人类实际“喜欢”看到什么方面,他们的方法胜出了。

为什么这很重要

这篇论文表明,我们不需要亲自设计 AI 应该如何绘画的规则。相反,我们可以建立一个系统,让 AI 通过一场“真与假”的游戏,学会每一步创作中最完美的“牵引绳张力”。

作者指出,虽然这种方法效果很好,但也存在一些局限性。他们训练的“导游”是针对特定类型的 AI 模型进行训练的;你不能直接把这个导游拿去用在完全不同的机器人身上而不进行重新训练。此外,训练过程比较复杂,需要精细的平衡。但就目前而言,这表明让 AI 通过游戏学习自己的引导计划,是让 AI 艺术既听从我们的语言又符合我们审美的一种强大方式。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →