Entropy Aware Reward Guidance for Diffusion Language Model Alignment
本文介绍了 EntRGi,这是一种新颖的方法,它基于预测熵在连续令牌松弛与硬令牌之间进行动态插值,从而为离散扩散语言模型实现有效的奖励引导,并在测试时适应以及通过奖励引导强化学习(RGRL)的后训练方面,展现出相较于最先进方法的持续改进。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你有一位才华横溢但略显困惑的艺术家,名叫Diffusion。这位艺术家试图通过从一块完全被静态噪声覆盖的画布(就像没有信号的电视)开始,并逐渐清除噪声以显露图像,来创作一幅画(或撰写一个故事)。
通常,这位艺术家在一个“连续”的世界中工作,就像混合颜料一样,你可以混合出任何色调的蓝色。但在这篇论文中,这位艺术家使用的是离散 token——可以将它们想象成 distinct、独立的乐高积木。你无法将一块“红色”积木与一块“蓝色”积木混合成“紫色”;你必须在两者之间做出选择。
作者们要解决的问题是:如何利用奖励模型(一位评判最终画面的评论家)来告诉这位艺术家:“不,不是那块红色的积木!把它变成一块更好的红色积木”。
核心问题:“翻译器”的失效
在旧有的方法(连续模型)中,艺术家和评论家说着同一种语言。评论家可以说:“把画笔稍微向左移动一点”,艺术家就能确切地知道如何调整。
但在这些乐高积木模型中,评论家只知道如何评判已完成的、坚硬的积木。
- “期望”方法:有些人尝试给评论家提供积木的“模糊”版本(红色和蓝色的混合),以便艺术家能获得平滑的指令。但评论家仅是在尖锐、真实的积木上训练过的。这就像要求一位美食评论家去评判由胡萝卜和芹菜混合而成的冰沙;他们不知道该说什么,因为他们从未品尝过这种东西。反馈是不可靠的。
- “APS"方法(之前的最佳方案):其他人尝试向评论家展示一块真实、尖锐的积木以获得高分,然后告诉艺术家假装这块积木仍然是模糊的,以便获得平滑的指令。这就像向法官展示一块完美的牛排,然后告诉厨师:“想象这块牛排是液态汤”的同时给出指令。指令与现实不匹配,导致困惑。
解决方案:EntRGi(“置信度计”)
作者们引入了EntRGi(熵感知奖励引导)。将其想象为艺术家的一台智能置信度计。
随着艺术家的工作,他们有时非常确定该选择哪块积木(低熵/高置信度),有时则完全在猜测(高熵/低置信度)。
- 当艺术家自信时:置信度计会说:“你知道自己在做什么!向评论家展示真实的、坚硬的积木。”这确保了评论家能给出可靠、准确的评分,因为他们评判的是自己理解的东西。
- 当艺术家在猜测时:置信度计会说:“你不确定!让我们向评论家展示可能性的模糊混合。”这允许艺术家获得平滑、连续的指令来改进,而不会破坏创作流程。
魔力所在:EntRGi 根据艺术家的确定程度,逐块积木自动在这两种模式之间切换。它集两者之长:既获得了评论家可靠的反馈,又为艺术家提供了平滑、准确的指令。
结果:更好的作品与新训练
论文表明,这种方法在两个层面上优于之前的尝试:
- 测试时适应(“实时编辑”):当艺术家正在创作画面时,EntRGi 帮助他们引导过程以生成更好的最终图像,而无需从头重新训练艺术家。这就像在片场有一位导演,确切地知道何时给予温和的提示,何时让演员即兴发挥。
- RGRL(奖励引导强化学习):作者们还创造了一种新的训练配方,称为RGRL。他们不再仅仅是向艺术家展示一幅完成的画作并说“做得好”或“做得差”(这很模糊),而是利用来自 EntRGi 的平滑反馈来教导艺术家如何变得更好。这就像一位教练根据球员当前的状态提供具体、详细的训练,而不仅仅是记分。
结论
论文声称,通过使用这种“置信度计”(EntRGi),他们能够引导这些离散的乐高积木模型产生比以往更高质量的结果。他们在大型模型(70 亿参数)上进行了测试,发现无论是在生成过程中仅引导模型,还是将其用于训练模型使其更智能,该方法始终优于之前的最佳方法。
他们还指出,即使艺术家和评论家使用略有不同的“词汇表”(不同的乐高积木集合),该方法依然有效,这是一个常见的现实世界问题。
简而言之:他们找到了与这位困惑的乐高艺术家沟通的方法,既让评论家满意,又让艺术家不断学习,从而创作出更好的故事和图像。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。