← 最新论文
🤖 machine learning

Reinforce Adjoint Matching: Scaling RL Post-Training of Diffusion and Flow-Matching Models

本文介绍了强化伴随匹配(RAM),这是一种用于扩散模型和流匹配模型的可扩展强化学习后训练方法,它通过推导一种简单的一致性损失来修正预训练目标,从而实现对奖励的更优对齐,且无需昂贵的随机微分方程轨迹 rollout、反向伴随扫描或奖励梯度。

原作者: Andreas Bergmeister, Stefanie Jegelka, Nikolas Nüsken, Carles Domingo-Enrich, Jakiw Pidstrigach

发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Andreas Bergmeister, Stefanie Jegelka, Nikolas Nüsken, Carles Domingo-Enrich, Jakiw Pidstrigach

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一位大师级艺术家,他花了数年时间通过临摹成千上万张照片来学习绘画。这位艺术家在重现所见之物方面技艺超群,但他们未必懂得如何遵循具体而棘手的指令,比如“在蓝色卡车旁画一只红色的斑马”,或者“在盾牌上清晰地写下‘HELLO'这个词”。

为了教会这位艺术家这些新技能,我们通常使用一种称为**强化学习(RL)**的方法。这就像一位严厉的艺术评论家,审视画作,给出评分,并告诉艺术家:“下次要做得更好。”

旧方法:昂贵且缓慢的评论家

过去,用评论家来训练这些 AI 艺术家,就像试图通过把某人扔进大海并观察他们挣扎来教他们游泳。

  • 过程:AI 会生成一幅完整的图像(即“游泳”),评论家对其进行评分,然后系统试图弄清楚究竟是哪一笔导致了高分或低分。
  • 问题:为了做到这一点,AI 必须从头到尾模拟整个绘画过程,一遍又一遍,仅仅为了获得一次反馈。这种方法既缓慢,计算成本又高,而且往往不稳定(就像试图在船沉没时计算风速)。

新方法:RAM(强化伴随匹配)

这篇论文的作者是 Andreas Bergmeister 及其团队,他们意识到有一种更聪明的方法。他们发现了一个“捷径”,能够像最初的预训练阶段一样保持训练的快速与简洁。

以下是RAM的工作原理,使用一个简单的类比:

1. “干净终点”技巧
想象绘画过程就像一部倒放的电影。电影从空白画布(噪声)开始,以一幅完成的画作结束。

  • 旧方法:AI 必须观看整部电影,对结局进行评分,然后逐帧倒放电影,以查看哪里出了问题。
  • RAM 方法:作者们意识到,如果你知道最终的画作(即“干净终点”),你就不需要观看整部电影来理解过程。你只需拿那幅完成的画作,在数学上瞬间对其“添加噪声”,生成一个混乱的版本,就像原始训练所做的那样。

2. “一次完成”的反馈
RAM 不再模拟整个绘画过程来获取反馈,而是这样做:

  1. 生成:AI 画出一幅完成的图像(终点)。
  2. 评分:评论家给出评分(例如:“文字部分做得很棒!”)。
  3. 瞬间倒带:与其模拟倒带,数学方法会瞬间创建该图像的“噪声”版本。
  4. 学习:AI 学习如何将那个特定的噪声版本重新转化为高分图像。

神奇的洞察
论文证明,即使你试图让图像变得更好,“如何给图像添加噪声”的规则也不会改变。唯一改变的是 AI 最初决定绘制哪些图像。由于“噪声规则”保持不变,AI 可以使用与原始训练期间相同的简单数学方法,只是目标不同。

为什么这很重要

  • 速度:论文声称,RAM 比之前的方法快34 到 50 倍。它能在极短的时间内达到相同的技能水平。
  • 简洁性:它不需要复杂且不稳定的计算(如"SDE 展开”或“反向伴随扫描”)。它只是一个简单的回归任务,类似于原始训练。
  • 质量:当他们在Stable Diffusion 3.5M上测试时,AI 在以下方面有了显著提升:
    • 组合性:将物体放置在正确的位置(例如,卡车在冰箱的左侧)。
    • 文本渲染:在图像中清晰地书写单词。
    • 人类偏好:生成人类真正喜欢观看的图像。

总结

RAM想象成给艺术家一把“魔法橡皮擦”和一张“魔法评分卡”。与其强迫艺术家重画整幅画布以查看哪里出了问题,魔法橡皮擦会瞬间向他们展示他们最佳作品的混乱版本,而评分卡则确切地告诉他们如何修复那个特定的混乱。这使得 AI 能够在没有先前方法那种高昂计算成本的情况下,学习复杂的新技能。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →