← 最新论文
🤖 AI

Beyond VLM-Based Rewards: Diffusion-Native Latent Reward Modeling

本文介绍了 DiNa-LRM,这是一种计算高效且基于扩散原生的潜在奖励模型,它直接在含噪扩散状态上构建偏好学习,以克服基于视觉 - 语言模型的奖励方法所存在的领域不匹配和高成本问题,从而在显著降低资源需求的同时实现了更优的对齐性能。

原作者: Gongye Liu, Bo Yang, Yida Zhi, Zhizhou Zhong, Lei Ke, Didan Deng, Han Gao, Yongxiang Huang, Kaihao Zhang, Hongbo Fu, Wenhan Luo

发布于 2026-05-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Gongye Liu, Bo Yang, Yida Zhi, Zhizhou Zhong, Lei Ke, Didan Deng, Han Gao, Yongxiang Huang, Kaihao Zhang, Hongbo Fu, Wenhan Luo

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一位机器人艺术家根据你的描述作画。这位机器人使用一个复杂的内部系统(称为扩散模型),该系统从模糊、充满噪点的静态画面开始,逐步清理噪点,直到清晰的图像显现出来。

为了教会这位机器人画出你真正喜欢的作品,你需要一位“导师”(即奖励模型)来审视机器人的草稿,并说出“做得好!”或“再试一次”。

问题:旧导师过于笨重且格格不入

目前,最优秀的“导师”是庞大的视觉 - 语言模型(VLM)。你可以将它们想象成超级智能的巨型图书馆,它们阅读过世界上所有的书籍,看过世界上所有的图片。

  • 问题所在:这些巨型图书馆非常沉重。运行它们需要大量的计算资源,而且速度很慢。
  • 不匹配之处:机器人艺术家在一个“压缩的、抽象的世界”(潜在空间)中工作,而这位巨型图书馆导师却审视最终的高清照片(像素空间)。这就像要求一位厨师在食材煮熟后,通过品尝生食材来评判汤的味道,而不是在汤炖煮时进行品尝。这种不匹配使得教学效率低下且令人困惑。

解决方案:DiNa-LRM(原生导师)

本文的作者创造了一种名为DiNa-LRM的新型导师。他们不是聘请一个庞大的外部图书馆,而是将机器人艺术家自身的内部大脑转化为导师。

以下是其工作原理,使用了简单的类比:

1. “噪声校准”之眼

机器人艺术家通过从噪声(静态)开始并随时间清理噪点来生成图像。

  • 旧方式:导师只查看最终清理干净的图像。
  • DiNa-LRM 方式:这位新导师习惯于在图像仍然充满噪点和模糊时进行审视。
  • 类比:想象一位音乐制作人在教导一支乐队。传统的导师会等到歌曲完全混音和母带处理完成后才进行点评。而 DiNa-LRM 则像是一位在录音期间就坐在录音棚里的制作人,聆听着原始、充满噪点的音轨。因为这位导师天生理解“噪声”,所以它确切知道在每个阶段应预期多少不确定性。如果图像非常模糊,导师会说:“我目前还无法 100% 确定,所以我会稍微谨慎一些地评分。”如果图像清晰,导师则会以高度自信进行评分。

2. “时间旅行”集成

当导师需要为一张完成的图像给出最终评分时,它不会只看一次。

  • 类比:想象你试图猜测一部电影的剧情。你可以只看最后一场戏,但这可能会产生误导。或者,你可以在电影完成 10%、50% 和 90% 时观看,并结合这些视角以获得更好的理解。
  • DiNa-LRM 的做法:它在图像处于不同“清洁度”阶段(不同噪声水平)时进行观察,并将所有这些观点整合成一个最终、超精准的评分。这被称为噪声集成。这使得导师在没有更大“大脑”的情况下,变得更加稳健和可靠。

3. 结果:更快、更便宜、更智能

本文将这位新导师与旧有的巨型图书馆及其他尝试进行了测试对比。

  • 性能:DiNa-LRM 在判断人类更偏好哪些图片方面,几乎与最好的巨型图书馆一样出色。
  • 效率:因为它生活在机器人自身的“压缩世界”中,所以它不需要将图像解码为完整照片即可进行评判。
    • 它使用的内存减少了 51%(就像你的计算机只需要一半的内存)。
    • 它用于实际评判的计算资源减少了 71%
  • 训练:当用于训练机器人艺术家时,机器人学得更快,并且不会因导师视角与艺术家视角之间的不匹配而感到困惑。

总结

本文介绍了DiNa-LRM,这是一种奖励模型,它使用与被教导的图像生成器相同的“语言”。DiNa-LRM 不是强迫一个庞大的外部专家将其思想翻译成生成器的语言,而是利用生成器自身的内部结构来评估其工作。它更擅长处理不确定性(噪声),能够审视进行中的作品以做出更好的最终判断,并且所有这些都是在显著减少计算资源消耗的情况下完成的。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →