← 最新论文
📊 statistics

dFlowGRPO: Rate-Aware Policy Optimization for Discrete Flow Models

本文介绍了 dFlowGRPO,这是一个统一的强化学习框架,通过将去噪过程构建为马尔可夫决策过程,将 GRPO 风格的优化扩展至通用离散流模型,并在文本到图像生成和多模态理解方面展现出优于现有方法的性能。

原作者: Zhengyan Wan, Yidong Ouyang, Panwen Hu, Qiang Sun

发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhengyan Wan, Yidong Ouyang, Panwen Hu, Qiang Sun

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人画画或回答问题。通常,我们通过向机器人展示数百万个示例,并让它一次一个微小步骤地猜测下一步来训练它。这就像一位画家一笔接一笔地作画,等待颜料干透后再添加下一笔。

但有一种更新、更快的方法叫做离散流模型(Discrete Flow Models, DFMs)。这些模型不是像画笔那样一笔一划地作画,而是从一个混乱、杂乱的初始状态(就像一袋混合打乱的拼图碎片)开始,试图一次性将其“解乱”成清晰的图像或正确的答案。它们通过许多小步骤来清除噪声,从而实现这一过程。

然而,就像一个学生靠运气猜对答案一样,这些模型有时需要一位更好的老师来学习如何持续地获得正确答案。这就是**强化学习(Reinforcement Learning, RL)**发挥作用的地方。它就像一位教练,在机器人完成绘画后给出评分:“眼睛画得不错,但鼻子错了。”

问题:“一刀切”的教练

此前,研究人员尝试使用强化学习来指导这些“解乱”机器人,但他们主要专注于一种非常特定的机器人类型(称为dLLMs),其工作方式类似于简单的“掩码”游戏(隐藏图像的某些部分并进行猜测)。

问题在于,更新、更灵活的机器人(通用 DFMs)工作方式不同。它们不仅仅是隐藏碎片;它们使用复杂的规则来决定如何从混乱状态过渡到清晰状态。旧的教练方法无法理解这些复杂规则,因此无法提供有效的反馈。这就像试图用跳棋的规则来指导国际象棋选手。

解决方案:dFlowGRPO(“速率感知”教练)

本文的作者引入了dFlowGRPO。你可以将其理解为一位超级聪明的教练,它懂得这些机器人如何“解乱”数据的具体“物理机制”。

以下是其工作原理,使用一个简单的类比:

  1. “速率”是限速:想象机器人正驾驶一辆车,从混乱的城市(噪声)驶向干净的城市(答案)。“转移速率”就是每个路口的限速和交通规则。有些道路快,有些道路慢。
  2. “后验”是 GPS:这是机器人对目的地当前位置的猜测。
  3. 旧教练:只关注最终目的地。“你到了,干得好!”它并不关心机器人是否走了危险的捷径或是否遵守了规则。
  4. dFlowGRPO 教练:同时查看GPS(机器人的猜测)和限速(转移速率)。它根据道路规则,精确计算出机器人采取该路径的可能性有多大。

通过结合这两条信息,dFlowGRPO 可以告诉机器人:“你得到了正确答案,但你走了一条统计上极不寻常的奇怪路径。下次请走主干道。”这为机器人提供了更清晰的改进指令。

他们测试了什么

作者在一个名为FUDOKI的机器人上测试了这种新的教练方法,该机器人擅长两件事:

  1. 绘画:将文字描述转化为图像。
  2. 理解世界:回答关于图像的问题(例如科学测验)。

结果:

  • 绘画:当使用 dFlowGRPO 指导 FUDOKI 时,机器人的绘画能力显著提高。在检查图像是否与描述匹配(例如“一只猫坐在垫子上”)的测试中,它的得分更高。它从“尚可”的分数提升到了“优秀”的分数,且没有作弊或死记硬背测试答案。
  • 理解:当将其用于科学问题时,机器人的准确率大幅提升。它从答对约 75% 的问题跃升至超过 81%。
  • 对比:他们将这种新教练与其他方法进行了比较。旧方法要么不稳定(机器人会困惑并停止学习),要么提升幅度不大。dFlowGRPO 是最稳定且最有效的方法。

核心结论

本文提出了一种新的、统一的训练方法,用于训练灵活的“解乱”AI 模型。通过创建一个能够理解这些模型如何从混乱过渡到秩序的具体规则(速率)的教练系统,作者使模型在生成图像和理解复杂问题方面都取得了显著进步。他们证明,当你根据 AI 的具体机制给予其正确类型的反馈时,它学习得更快,表现也更好。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →