← 最新论文
💻 computer science

OP-GRPO: Efficient Off-Policy GRPO for Flow-Matching Models

本文提出了 OP-GRPO,这是首个针对流匹配模型的离线 GRPO 框架,通过引入高质量轨迹回放、序列级重要性采样校正以及晚步截断策略,有效解决了传统在线 GRPO 样本效率低的问题,在图像和视频生成任务中以仅约 34.2% 的训练步数实现了与 Flow-GRPO 相当甚至更优的性能。

原作者: Liyu Zhang, Kehan Li, Tingrui Han, Tao Zhao, Yuxuan Sheng, Shibo He, Chao Li

发布于 2026-04-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Liyu Zhang, Kehan Li, Tingrui Han, Tao Zhao, Yuxuan Sheng, Shibo He, Chao Li

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇文章介绍了一种名为 OP-GRPO 的新方法,它能让 AI 画图(生成图像和视频)变得更快、更聪明,而且更“省料”。

为了让你轻松理解,我们可以把训练 AI 画师的过程想象成教一个学徒画画

1. 背景:以前的方法太“浪费”了

以前的方法(叫 Flow-GRPO)就像是一个极其严格的老师,但他有个坏习惯:

  • 只教新课,不复习旧课:老师让学徒画一张画,画完立刻打分。如果画得好,老师就记下“这次画得好”;如果画得不好,就扔进垃圾桶。
  • 用完即弃:第二天,老师又让学徒重新画,哪怕昨天那张画里有一笔特别精彩,因为那是“昨天”画的,今天就不许用了。
  • 结果:学徒进步很慢,因为老师总是让他从零开始,浪费了无数张已经画了一半的好画。而且,如果任务太难(比如画复杂的文字),学徒经常画不出东西,老师就得不到任何反馈,教学就卡住了。

2. 核心创新:OP-GRPO 的“三个法宝”

OP-GRPO 给这个教学系统加了三个聪明的机制,让学徒能利用过去的经验,快速升级。

法宝一:建立“优秀作业库”(Replay Buffer)

  • 比喻:老师不再把画完的画直接扔了,而是建了一个**“荣誉墙”**。
  • 做法:每次学徒画完,老师挑出画得最好的那几张贴在墙上。下次上课,老师不仅让学徒画新画,还会从墙上摘几张以前的“神作”拿出来,让学徒参考,甚至直接作为今天的作业素材。
  • 好处:好画不再浪费,学徒可以反复学习那些成功的技巧,进步速度大大加快。

法宝二:聪明的“翻译官”(Sequence-level Importance Sampling)

  • 问题:墙上的画是“昨天”画的(旧策略),今天的画是“现在”画的(新策略)。直接拿旧画来教,可能会让学徒困惑:“老师,这画的是昨天的风格,为什么让我按今天的标准改?”这会导致教学混乱(分布偏移)。
  • 比喻:OP-GRPO 请了一位**“翻译官”**。
  • 做法:当老师用墙上的旧画教学时,翻译官会告诉学徒:“虽然这张画是昨天画的,但我们要把它‘翻译’成今天的标准。如果昨天的画和今天的标准差别太大,我们就只参考它,不强行修改;如果差别不大,我们就好好利用它。”
  • 好处:既利用了旧画,又不会让学徒学偏,保证了学习过程稳定不乱套。

法宝三:只学“精华部分”(Trajectory Truncation)

  • 问题:AI 画画是一个从“一团乱麻”(全是噪点)慢慢变成“清晰图像”的过程。
    • 前期:从乱麻到大概轮廓,这时候变化很大,有很多可以学的。
    • 后期:从轮廓到最后的细节(比如头发丝、文字笔画),这时候画面已经非常清晰了,几乎不需要怎么改。这时候如果强行用旧画来对比,数据会变得非常不稳定,像是一个精密的仪器被强行扭曲,容易出错。
  • 比喻:这就像修车
    • 在修车的大框架(换引擎、修底盘)时,我们可以参考旧车的维修记录。
    • 但在最后抛光打蜡(最后几步)时,每辆车的情况都太特殊了,旧记录不仅没用,还可能误导你。
  • 做法:OP-GRPO 决定,只利用旧画的前半段(从乱麻到轮廓),后半段(最后几步)让学徒自己重新画。
  • 好处:避开了最不稳定、最容易出错的环节,让训练过程既快又稳。

3. 最终效果:事半功倍

通过这三个法宝,OP-GRPO 取得了惊人的效果:

  • 效率翻倍:以前 Flow-GRPO 需要走 100 步才能达到的水平,OP-GRPO 只需要走 34 步(大约 1/3 的时间)。
  • 质量更高:不仅画得快,画出来的图在文字识别、物体数量控制、人类审美偏好等方面,都比以前的方法更好。
  • 适用广:无论是画静态图片,还是生成复杂的视频,这个方法都管用。

总结

简单来说,OP-GRPO 就是给 AI 画师配了一个**“会存作业、会翻译旧经验、知道何时该放手”**的超级助教。它不再让 AI 重复造轮子,而是让 AI 站在过去的肩膀上,用更少的时间,画出更完美的作品。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →