← 最新论文
💻 computer science

Sample-Adaptive Latent Rewards for Uncertainty-Guided Diffusion Post-Training

本文提出了 \textsc{SURE},这是一个统一的潜空间框架,通过学习带有样本自适应不确定性估计的奖励分布,在无需像素空间解码的情况下,为扩散模型的后训练提供可靠且稠密的反馈,从而增强其优化过程。

原作者: Rui Li, Yuanzhi Liang, Ke Hao, Ziqiao Weng, Haibin Huang, Chi Zhang, XueLong Li

发布于 2026-08-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Rui Li, Yuanzhi Liang, Ke Hao, Ziqiao Weng, Haibin Huang, Chi Zhang, XueLong Li

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在教一个机器人艺术家如何绘画。你不想等到机器人完成一整幅杰作后才对它说:“不,那只狗看起来像个土豆。”你希望在它还在画布上调色时,就在旁边轻声给予提示。这就是**扩散模型(diffusion models)**的世界——一种通过将静态噪声逐步转化为清晰图像来创建图像和视频的 AI 类型。为了让这些机器人画出人类真正喜欢的作品,我们需要一个“奖励系统”——一位能为好的艺术品打分、为坏的艺术品扣分的老师。

传统上,这位老师会等待机器人完成绘画,观察最终的图像,然后给出评分。但这既慢又昂贵,因为机器人必须完成整个图像过程才能得到一个提示。更新的方法允许老师窥视那些混乱的、半成品状态的草图(称为“潜变量”或 “latents”),从而更早地给出反馈。然而,这里有一个陷阱:这些老师通常只是大声喊出一个单一的数字,比如“8 分(满分 10 分)”,却不告诉机器人它们有多确定。如果老师在胡乱猜测却依然大喊高分,机器人可能会感到困惑,并为了追求那个虚假的高分而开始画出奇怪的东西。这篇论文解决了如何教机器人去信任它的老师,以及何时该忽略它的问题。


问题所在:过度自信的老师

想象一位严厉的美术老师正在给你的草图评分。在过去,这位老师会看着你半成品的画作,仅仅说:“做得好!”或“做得不好!”,并给出一个数字。问题在于,老师有时并不清楚自己在说什么。也许草图非常模糊,以至于老师只是在瞎猜,但他们仍然大喊高分。如果你,作为学生,盲目地跟随这个高分,你可能会不断重复同样的错误,认为自己做得很好,而实际上你已经走偏了。在 AI 领域,这被称为“奖励黑客攻击”(reward hacking),即 AI 找到了一个漏洞,无需真正提升艺术水平就能获得高分。

这项研究背后的研究人员开发了一个名为 SURE(基于样本自适应潜变量奖励的确定性引导扩散后训练)的系统,他们意识到现有的老师缺少了一个关键信息:置信度(confidence)。他们需要一种方式让老师能够表达:“我有 90% 的把握认为这是一幅好画,”或者“我只有 20% 的把握,所以别太听我的。”

解决方案:懂得承认怀疑的老师

作者构建了一个两部分的系统来解决这个问题。

第一部分:具备不确定性感知能力的老师(SURE-LRM)
首先,他们创建了一种新型的奖励模型。这个模型不再仅仅给出一个分数,而是同时给出一个分数和衡量该分数有多“摇摆不定”的指标。这就像天气预报:普通的老师说:“会下雨。”而新的 SURE-LRM 老师会说:“会下雨,我有 95% 的把握,”或者“可能会下雨,但我只有 40% 的把握,因为云层看起来很奇怪。”

他们使用一种特殊的方法来训练这位老师,让它观察成对的图像(一张好的,一张坏的),并不仅学习哪张更好,还学习“好度”的变化程度。如果老师看到一张混乱、模糊的草图,它会学会给出较高的“不确定性”分数。如果它看到一张清晰、明显的杰作,它会给出较低的不确定性分数。至关重要的是,论文表明,这位老师只需通过观察标准的“好 vs 坏”示例,就能学会这种置信度水平,而不需要人类显式地标注它们有多自信。

第二部分:聪明的学生(SURE-REFL)
接下来,他们构建了一种名为 SURE-REFL 的训练方法来使用这位新老师。当 AI 艺术家学习时,它会在绘画过程的许多不同阶段向老师寻求反馈。通常情况下,AI 会接受每一条反馈并试图盲目遵循。但在 SURE-REFL 中,AI 会先查看老师的“置信度计”。

如果老师说:“分数:8/10,置信度:低,”AI 会想:“好吧,我会听,但我不会根据这个改变我的整幅画作。”如果老师说:“分数:8/10,置信度:高,”AI 会想:“明白了!我一定会多做这类动作。”该系统本质上是在权衡反馈:高置信度的反馈权重很大,而低置信度的反馈权重很轻。这防止了 AI 被老师的猜测所迷惑。

研究发现

研究人员在针对图像生成器(如制作猫的图片)和视频生成器(如制作短视频剪辑)的测试中测试了这个系统。

  • 更好的老师: 新的 SURE-LRM 老师比以往的方法更能预测人类的偏好。在一项包含 2,000 对图像的测试中,当他们仅保留那些老师最自信(即不确定性最低的 50%)的预测结果时,准确率从约 79.4% 跳升至 90.1%。这证明了老师的“置信度计”确实能真实反映哪些预测是可靠的。
  • 稳定的学习: 当他们使用 SURE-REFL 来训练 AI 时,学习过程变得更加稳定。在旧方法的测试中,AI 的得分虽然上升了,但实际的艺术质量却下降了(这是奖励黑客攻击的迹象)。而在使用 SURE-REFL 时,得分与实际质量长时间保持同步。
  • 顶尖表现: 在最终结果中,SURE-REFL 方法在图像和视频的标准基准测试中都取得了最高分。对于视频生成,它达到了 0.8357 的总质量得分,超过了排名第二的方法 0.0109

为什么这很重要

这篇论文表明,教 AI 创作更好艺术的关键不仅仅在于拥有一个更聪明的老师,而在于拥有一个知道自己“不知道”的老师。通过让 AI 忽略老师摇摆不定的猜测,转而专注于那些确定的反馈,该系统避免了为了追求高分而陷入制造怪异、破碎艺术的陷阱。这是迈向让 AI 艺术家不仅具有创造力而且更加可靠的一步——它们可以从反馈中学习,而不会被噪声所迷惑。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →