← 最新论文
💻 computer science

Representation Distribution Matching for One-Step Visual Generation

本文介绍了改进型表示分布匹配(iRDM),这是一种单步视觉生成范式,它在 ImageNet 上实现了最先进的性能,并通过利用大批量进行分布匹配以及使用鲁棒的多编码器评估指标来防止博弈,从而增强了像 FLUX.2 这样的多步模型。

原作者: Lan Feng, Wuyang Li, Eloi Zablocki, Matthieu Cord, Alexandre Alahi

发布于 2026-07-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Lan Feng, Wuyang Li, Eloi Zablocki, Matthieu Cord, Alexandre Alahi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心思想:从慢火炖汤到速食面

想象一下,你想创作一幅完美的画作。

  • 旧方法(扩散模型/Diffusion Models): 这就像一位厨师在慢火炖一锅复杂的炖菜。他们从一锅噪声(随机静态图)开始,一步步添加食材,搅拌并品尝 20 或 30 分钟(步数),直到味道刚刚好。做出一碗汤需要很长时间。
  • 目标: 作者们想要制作一种“神奇速食面”,它的味道能和慢火炖的炖汤一样好,但只需要一步就能完成。

这篇论文介绍了一种名为 iRDM(改进的表示分布匹配)的新方法,它实现了这一目标。它训练一个模型,使其能够瞬间生成高质量图像,而不需要一个“教师”模型来分步引导。

他们是如何做到的:机器上的两个“旋钮”

作者们意识到,以往尝试制作这些“即时”生成器的尝试之所以失败,是因为它们转错了“旋钮”。他们确定了控制质量的两个主要“旋钮”(设计轴):

1. “如何比较”旋钮(比较轴)

为了教导生成器,你必须将其输出与真实的图片进行比较。

  • 旧有的错误: 以前的方法试图使用模糊、低分辨率的尺子(如 Fréchet 距离)或只观察真实照片中极小样本的尺子来比较图像。这就像试图通过仅听一秒钟的一位小提琴手演奏,来评判整个管弦乐队。
  • 修复方案(Nyström 引力): 作者们意识到经典的“最大均差”(MMD)指标其实非常好,但人们用错了。他们通过以下方式修复了它:
    • 冻结参考基准: 他们不再每次只看随机的几张真实照片,而是将包含 128 万张图像的整个数据集压缩成一张完美的“总结图”(称为 Nyström 参考),并将其冻结。这就像拥有一个关于“真实”长什么样的完美且不变的蓝图。
    • 大批次(Big Batches): 他们意识到生成器需要一次观察数千张图像(批次为 2,000+)才能获得清晰的图像。小批次太嘈杂,就像在拥挤的房间里试图听清一声耳语。

2. “测量什么”旋钮(表示轴)

一旦有了比较的方法,你就需要决定测量哪些特征。

  • 陷阱(钻空子/Gaming the System): 如果你只使用一个“评委”(单个 AI 编码器)来给图像评分,生成器就会作弊。它会学会欺骗这个特定的评委。这就像一个学生背下了某个特定老师考试题目的答案,却根本不会做数学题。学生得到了满分,但图像在人类看来仍然是假的。
  • 修复方案(平衡评审团): 作者们使用了一个“评审团”(14 个不同的 AI 编码器)。他们不仅是平均这些分数,还使用了一个特殊的“拉格朗日控制器”(一种智能平衡系统)。
    • 类比: 想象一个由木板(评委)箍在一起的水桶。水位的水平(质量)取决于那块最短的木板。如果有一个评委说这张图像是假的,那么整张图像就被视为假的。该系统迫使生成器去满足那个最挑剔的评委,而不仅仅是满足最容易应付的评委。这防止了作弊行为。

结果:“神奇速食面”

通过结合这些修复措施,他们创造了 iRDM。以下是发生的事情:

  1. 在 ImageNet(标准图片)上: 他们将一个现有的模型转化为了一个单步生成器。根据他们提出的更难被欺骗的新指标(SWr14),它成为了世界上最好的单步生成器。

    • 指标: 他们创建了一个新的测试方法叫做 SWr14。它就像一个“人类偏好模拟器”,通过 14 种不同的视角来观察图像。真实照片的得分是完美的 1.0。他们的模型得分是 1.30,这与现实极其接近,击败了所有其他的单步模型。
    • 人类口味: 当他们要求另一个 AI(PickScore)在他们的图像和旧的最佳模型之间进行选择时,人类(通过 AI 代理)71% 的时间更喜欢新模型。
  2. 在 FLUX.2(文本生成图像)上: 他们将一个著名的、高质量的 4 步模型 FLUX.2 进行“后训练”(post-trained),使其成为一个 1 步模型。

    • 惊喜: 这个新的 1 步版本在遵循指令方面甚至比原始的 4 步版本还要(GenEval 得分从 0.794 提升到 0.826)。
    • 速度: 他们在强大的 GPU 上大约用了 90 小时完成了这次训练。

为什么这很重要(根据论文观点)

  • 拒绝作弊: 他们最大的突破在于阻止了模型“钻空子”。通过使用多样化的冻结编码器和平衡的优化策略,模型无法仅仅通过欺骗某个特定指标来获胜;它必须真正看起来像真的。
  • 无需教师: 不同于其他需要缓慢、复杂的教师模型来引导的快速方法,这种方法通过直接将其输出与一张冻结的“现实地图”进行比较来学习。
  • “单步”的现实性: 他们证明了你不需要 20 步就能做出伟大的图像。你只需要有正确的方法来衡量“真实感”。

总结类比

想象你正在试图教一个机器人画出一个完美的苹果。

  • 旧方法: 你给机器人看一张图片,然后是一个稍微模糊的版本,然后是一个更模糊的版本,然后问它在每一步中如何还原原始图像。
  • 论文的方法: 你给机器人一个完美的、冻结的“苹果蓝图”(Nyström 参考)和一个由 14 位专家艺术评论家组成的评审团。你告诉机器人:“画一个苹果。如果 14 位评论家中有任何一位说它看起来是假的,你就失败了。如果你能让最挑剔的评论家满意,你就赢了。”
  • 结果: 机器人学会了用一次性的、瞬间的笔触画出一个完美的苹果,而且它画得如此之好,以至于即使是最挑剔的评论家也无法分辨它与真实照片的区别。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →