← 最新论文
🤖 machine learning

DreOPD: Degraded-Reference Extrapolative On-Policy Distillation for Flow-matching Models

本文提出了 DreOPD,一种针对流匹配模型的创新在策略蒸馏方法,该方法将隐式奖励外推转换为闭式速度回归,并利用退化参考来实现稳定且高性能的后训练,其表现优于标准的在策略蒸馏和多任务强化学习基线。

原作者: Mingfeng Lin, Chengfei Cai, Lin Xu, Yuxiang Wei, Liang Han

发布于 2026-08-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Mingfeng Lin, Chengfei Cai, Lin Xu, Yuxiang Wei, Liang Han

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个计算机正在学习绘画、写作和做梦的世界。长期以来,科学家们一直通过一种被称为“流匹配”(Flow-Matching)的方法来教导这些机器。你可以把它想象成一位雕塑家从一块充满噪声和静电感的大理石块开始,通过一点点凿去混沌,直到一尊完美的雕像显现出来。计算机学习在每一步中精确地预测如何去除噪声,从而根据文本描述创造出一幅美丽的图像。但问题在于:虽然这些数字雕塑家擅长做出“某些东西”,但它们并不总是擅长做出你“想要的东西”。它们可能在遵循复杂指令、在图片中写出正确的文字或让场景看起来具有美感方面表现挣扎。

为了解决这个问题,研究人员通常会尝试两种主要技巧。第一种是“强化学习”(Reinforcement Learning),这就像雇佣了一位严厉的艺术评论家,在每一次尝试后给计算机打分。计算机不断尝试,希望能获得更高的分数。问题是,这是一个混乱的过程。计算机可能会被反馈搞糊涂,或者如果你要求它同时学习三种不同的技能(比如写字、画动物和变得好看),这些指令就会发生冲突,导致计算机陷入停滞。第二种技巧是“蒸馏”(Distillation),这就像是一位大师级画家(老师)站在学生身边说:“完全照着我做。”这种方法稳定且安全,但学生永远无法超越老师;他们仅仅成为了一个副本。大问题在于:科学家们在问——我们能否教会一个学生不仅去模仿大师,而且去超越他们,尤其是当我们拥有多个不同专长的老师时?

这篇论文介绍了一种名为 DreOPD(退化参考外推式在策略蒸馏,Degraded-reference Extrapolative On-policy Distillation)的巧妙新方法来解决这个谜题。研究人员发现了一种结合了“模仿老师的稳定性”与“超越老师的野心”的方法。DreOPD 不仅仅是告诉学生去模仿老师的笔触,而是给了学生一个略微“不完美”或“退化”的老师版本进行对比。想象一下,一名学生在观察大师画作的同时,也在观察那幅画的一份略微模糊、低质量的复印件。通过测量模糊副本与清晰原件之间的差异,学生可以弄清楚应该向哪个方向推动自己的绘画,使其甚至比原作还要更好。

论文指出,通过使用这种“退化参考”,计算机可以计算出一条精确的数学路径,从而超越老师的能力。这就像拥有一个 GPS,它不仅告诉你老师在哪里,还指向远离老师“糟糕版本”的方向,引导学生直接走向一个新的、更优的目标。研究人员在强大的图像生成器(SD3.5-M)上测试了该方法,发现他们的算法使学生模型在大多数领域都超越了专门化的老师。例如,在正确计数物体(GenEval)或在图像中书写文本(OCR)等任务中,DreOPD 学生模型的得分高于其训练所用的专家模型。

论文明确排除了“仅仅复制老师就足以获得最佳结果”这一观点,同时也论证了标准的强化学习在尝试同时学习多种技能时往往过于不稳定且容易出错。相反,作者建议他们的“外推”方法——即利用优秀的老师与稍差的参考版本之间的差距——才是关键。他们通过具体的数值衡量了这一点:例如,在文本渲染测试中,他们的方法将得分从 0.9239 提升到了 0.9364,击败了老师。他们还展示了如果“退化参考”太弱,学生就得不到足够的推动;但如果太乱,学生就会感到困惑。他们发现,其中的平衡点在于轻微的退化,比如对老师输出进行 8 位量化(8-bit quantization),这提供了恰到好处的对比度,引导学生攀登新的高度。

简而言之,DreOPD 是一种全新的 AI 艺术家训练方式,它将“模仿”的概念转化为了“超越”。通过将一个略有瑕疵的老师版本作为跳板,学生学会了比老师跳得更远,创造出的图像不仅是优秀的,而且比其组成部分的总和更加出色。作者认为,这可能会成为让 AI 变得更可靠、更善于遵循指令以及创造更美艺术的变革性技术,且无需承受传统训练方法的混乱不稳定性。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →