← 最新论文
🤖 machine learning

MeanFlowNFT: Bringing Forward-Process RL to Average-Velocity Generators

该论文介绍了 MeanFlowNFT,这是一个创新的框架,它通过构建一个诱导瞬时速度预测器,将前向过程强化学习方法 DiffusionNFT 适配到 MeanFlow 生成器上,从而在实现高效奖励优化的同时保留了快速少步采样能力,并在图像和视频生成方面显著超越了现有的少步甚至多步强化学习微调模型。

原作者: Yushi Huang, Xiangxin Zhou, Jun Zhang, Liefeng Bo, Tianyu Pang

发布于 2026-07-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Yushi Huang, Xiangxin Zhou, Jun Zhang, Liefeng Bo, Tianyu Pang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个机器人艺术家画出一幅“一辆流线型汽车行驶在霓虹闪烁的赛博朋克街道上”的画作。在人工智能的世界里,目前顶尖的艺术家们使用一种叫做**扩散(diffusion)流(flow)**的技术。你可以把它想象成雕刻家从一块大理石中凿去碎石的过程。他们从一个粗糙的、充满噪声的石块(随机静态噪声)开始,通过一步步细微而谨慎的调整,最终显现出完整的雕像。问题在于,这个过程非常缓慢。为了得到一张真正好的图片,机器人可能需要进行 50 甚至 100 个微小的步骤,每凿一下都要检查一次进度。这就像是通过迈一英寸的小碎步来穿过房间;你最终能到达目的地,但那实在太慢了。

为了让这个过程更快,科学家们最近发明了一个新窍门,叫做 MeanFlow。与其采取细碎的小步,不如让机器人学会预测它在一段完整的时间跨度内需要行驶的“平均速度”。这就像是机器人学会了在房间里大步流星地自信跨越,而不是挪动脚步。这使得它只需很少的几步就能创造出高质量的图像。然而,这里有一个难点:这些快速移动的机器人很难学习人类真正“喜欢”的东西。通常,为了教 AI 变得更有创意或更好地遵循规则,我们会使用一种叫做**强化学习(RL)**的方法。但我们目前拥有的最好的 RL 方法是为那些缓慢、循序渐进的机器人设计的,而不是为这些快速跨越的机器人设计的。尝试用旧的、针对慢速机器人的教训来教这个快速机器人,就像是试图通过给一只猎豹提供专门给乌龟准备的指令来教它奔跑;其中的数学逻辑根本对不上。

这正是新论文 MeanFlowNFT 的切入点。研究人员提出了一个简单但棘手的疑问:我们能否利用我们用于训练慢速机器人的那些高效 RL 方法,在不降低速度的前提下,让这个快速跨越的机器人变得更好?

答案是肯定的,以下是他们的做法。团队意识到,尽管机器人的训练目标是预测“平均速度”(以实现那些大跨步),但在这种“平均速度”与旧版 RL 方法所需的“瞬时速度”(即在任何一个极小瞬间的速度)之间,存在着一种隐藏的数学联系。他们构建了一个巧妙的桥梁,称为诱导瞬时速度预测器(induced instantaneous-velocity predictor)。你可以这样理解:机器人的大脑被训练用来规划一场长途旅行(平均速度)。研究人员创建了一个特殊的“翻译官”,这个翻译官可以观察那份长途旅行计划,并瞬间计算出汽车在任何特定秒数时的时速表读数(瞬时速度)。

随后,他们利用这个翻译官,使用旧有的高效 RL 方法来教导机器人。机器人根据翻译官提供的时速表读数(反馈/奖励)来进行学习,但一旦课程结束,机器人就会回到它原本的“平均速度”大脑模式来生成图像。这意味着机器人变得更聪明、更符合人类偏好,同时又没有失去它的超高速。

结果令人印象深刻。当他们在图像生成器(如 Stable Diffusion 3.5-Medium)和视频生成器(如 Wan2.1)上测试时,新的 MeanFlowNFT 模型始终优于之前的顶级快速模型。事实上,在图像生成方面,它在 8 项不同的质量指标中有 6 项都超越了其他顶尖模型。更令人惊讶的是,在视频生成方面,一个 4 步生成的 MeanFlowNFT 模型在名为 VBench 的质量测试中得分高达 84.33。这甚至超过了一个要慢得多的 50 步模型(LongCat-Video RL),后者的得分仅为 82.57

这篇论文证明了该方法不仅在理论上可行,在实践中也同样有效。通过使用这个“翻译官”的小窍门,他们成功地保持了训练过程的高效与快速(无需计算复杂的概率),同时又获得了先进强化学习带来的好处。机器人学会了如何进行更好的跨越,从而在极短的时间内创造出更美观、更准确的图像和视频。这有点像是通过给猎豹一份更好的地形地图,让它知道确切地在哪里落下巨大的脚掌,从而教它跑得更快,而不是强迫它走路。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →