← 最新论文
🤖 AI

MixFlow Training: Alleviating Exposure Bias with Slowed Interpolation Mixture

本文介绍了 MixFlow,这是一种通过利用“慢速插值混合”策略来更好地对齐训练与测试条件,从而缓解扩散模型中曝光偏差问题的创新训练方法,并在 ImageNet 上实现了最先进的图像生成结果。

原作者: Hui Li, Fu-Yun Wang, Haoyuan Xia, Jiayue Lyu, Kaihui Cheng, Siyu Zhu, Jingdong Wang

发布于 2026-07-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Hui Li, Fu-Yun Wang, Haoyuan Xia, Jiayue Lyu, Kaihui Cheng, Siyu Zhu, Jingdong Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人通过缓慢转动旋钮来画图,这个旋钮能将一团静态噪声变成一张清晰的图像。这正是现代“扩散”(diffusion)模型的工作原理。它们通过观察一张照片,向其中添加静态噪声,然后尝试通过逐步去除这些噪声来还原原始图像来进行学习。

这里有一个问题:在训练(学习阶段)期间,这个机器人有点“作弊”。每当它尝试预测下一步时,它都会看到前一个步骤中那个“完美版本”的噪声图像。这就像一个学生在参加考试,老师在学生写下答案之前,就先在他耳边低声透露了上一道题的正确答案。

但在测试(机器人真正画图)期间,老师停止了低声提示。机器人必须利用它自己上一步的预测来推断下一步。如果它在早期犯了一个微小的错误,这个错误就会被传递下去,不断放大,最终导致生成的图像看起来很奇怪或模糊。这被称为“曝光偏差”(exposure bias)——机器人在学习时接触的是完美的数据,但在独自工作时面对的是混乱的数据。

“慢流”(Slow Flow)的发现

论文的作者们在观察机器人画图时,注意到了一些奇怪的现象。他们发现,当机器人在某个时刻(我们称之为“时间 T”)生成一张带噪声的图片时,那个噪声的“完美版本”(即机器人本该观察的版本)实际上属于过程中的一个更早的时间点,一个噪声更多的时刻。

可以这样理解:想象你正在参加一场赛跑。当你跑到 10 秒标记处时,你回头一看,发现你“完美位置”的实际情况其实发生在 8 秒标记处。你实际上比“地面真值”(ground truth)要“慢”。机器人的生成路径落后于完美的路径,陷入了一种被“减速”的状态,带有比预期更多的噪声。

MixFlow 解决方案

作者们并没有试图在比赛结束后去纠正机器人的跑步风格(其他方法尝试过这样做),而是决定改变机器人“学习比赛”的方式。他们引入了一种新的训练方法,称为 MixFlow

在标准训练中,机器人只观察处于其应有时刻的完美噪声。而在 MixFlow 中,机器人被训练去观察一种“混合”后的完美噪声。它不仅观察当前时刻的完美噪声,还会观察那些处于“减速”状态、具有更多噪声的时刻的完美噪声。

类比:
想象你在学习骑自行车。

  • 标准训练: 你只在完全平坦、光滑的路上练习。当你进入现实世界遇到颠簸和强风时,你会因为没有为这种“滞后感”做好准备而摔倒。
  • MixFlow 训练: 你在平滑的路上练习,但同时也会在一条稍微颠簸、呈现“减速”感的路上练习,这模拟了你稍后会感受到的滞后感。通过这种方式,你在处于安全训练阶段时,就能学会应对这种“减速”的感觉。

通过在这种“减速插值混合”(slowed interpolation mixture)上进行训练,机器人学会了如何处理其自身的预测会比完美的地面真值更“慢”、噪声更大的情况。它不再会在依赖自己的前一步预测时感到困惑。

他们排除了什么

作者们非常谨慎地测试了哪些方法是无效的。他们尝试了一种名为“输入扰动”(Input Perturbation)的方法,即通过添加随机噪声来模拟错误。他们发现,如果只是盲目地添加随机噪声而不理解其中的“慢流”模式,你可能会误导机器人,让它使用与现实不符的“更快”(噪声更少)或“更慢”(偏离太远)的数据。实验表明,盲目添加噪声往往会让情况变得更糟,而他们特定的“减速”混合才是关键。

他们还将该方法与在绘画过程中(推理阶段)通过调整步骤来解决问题进行了对比。他们发现,虽然这些调整会有所帮助,但它们就像是在试图修正一辆已经发生漂移的汽车;不如从一开始就改进“引擎”(即训练阶段)来得有效。

结果:我们有多确定?

作者们不仅仅是凭直觉猜测;他们在真实的图像数据集上进行了大规模实验。

  • 证明: 他们在包括 120 万张包含 1,000 个不同物体类别的 ImageNet 数据集在内的多个顶级图像生成器(如 SiT、REPA 和 RAE)上测试了 MixFlow 方法。
  • 数据: 在 256 × 256 像素的图像上,他们的 MixFlow 模型在无引导(without guidance)时达到了 1.43 分,在有引导(with guidance)时达到了 1.10 分。在更大的 512 × 512 像素图像上,无引导得分达到 1.55,有引导得分达到 1.10
    • 注: 在这个领域中,较低的“FID”分数代表更好。这些数字非常低,意味着生成的图像与真实照片几乎无法分辨。
  • 文本生成图像: 他们还在文本生成图像模型(SD 3.5)上进行了测试。当被要求绘制复杂场景时,例如“五块咸鲜可口的披萨”或“时钟左侧的一只鸟”,MixFlow 版本在遵循指令方面表现得比标准版本好得多,能够准确掌握数量和位置。

论文指出,这种方法之所以是一个重要的进步,是因为它直接解决了误差累积的根源。它不是一个魔术,而是一种更聪明的练习方式。通过让机器人练习处理“减速版”的真相,它在独自生成图像时会变得更加稳健。

简而言之,论文表明,通过将训练“食谱”改为包含“减速”数据,扩散模型可以停止在自己的脚步上绊倒,从而开始一场更加平滑的赛跑。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →