Beyond Mode-Seeking RL: Trajectory-Balance Post-Training for Diffusion Language Models
本文介绍了 TraFL,这是一种针对扩散语言模型的轨迹平衡后训练方法,它通过将策略与奖励倾斜的目标分布对齐,克服了奖励最大化方法中“轨迹锁定”的失效模式,从而在数学推理和代码生成基准测试中实现了持续的性能提升。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是用通俗易懂的语言和富有创意的类比,对论文《超越模式寻求型强化学习:扩散语言模型的轨迹平衡后训练》的解释。
宏观图景:一种训练 AI 的新方法
想象你有一位才华横溢的艺术家(AI 模型),他可以通过从一块充满噪点和杂讯的画布开始,慢慢将其清理,直到一幅清晰的图像显现出来。这就是扩散语言模型的工作原理:它们不像旧式 AI 模型那样像打字机一样逐字逐句地写作;相反,它们从一堆杂乱的字母开始,逐渐将这些字母“去噪”,形成连贯的句子。
这篇论文指出,目前我们训练这些艺术家去解决难题(如数学或编程)的方法存在缺陷。作者提出了一种名为TraFL(轨迹流平衡,Trajectory Flow baLancing)的新方法,旨在修复一种被称为**“轨迹锁定”**(Trajectory Locking)的具体缺陷。
问题所在:“单一路径”陷阱(轨迹锁定)
要理解这个问题,请想象一个迷宫。
- 目标:迷宫有许多不同的正确出口(对应数学问题的不同有效解)。
- 旧方法(奖励最大化强化学习):想象你在训练一只狗寻找出口。每次狗找到一个出口时,你就给它一个奖励。
- 缺陷:狗并不关心它走了哪条路才得到奖励,它只在乎是否得到了奖励。
- 结果:如果狗碰巧在早期发现了一条通往奖励的特定路径,它就会得到奖励。它记住了那条路。下次,它会尝试那条路。它再次得到奖励。它对那一条路变得更加自信。
- 轨迹锁定:最终,狗完全停止探索迷宫。它只沿着那条狭窄的路径奔跑,即使还有 50 个其他有效的出口它本可以找到。它已经“锁定”在单一解决方案上,忘记了如何找到其他路径。
在论文中,作者将这种现象称为轨迹锁定。因为 AI 仅因最终答案而获得“奖励”(分数),它忽略了通往那里有许多不同方式(路径)的事实。它将所有的创造力坍缩到一条狭窄的路径上,导致当你要求它再次尝试时,它难以找到替代性的正确答案。
解决方案:“指南书”方法(TraFL)
作者提出了TraFL,它改变了训练规则。不再仅仅因为找到任何出口就给予奖励,而是给 AI 一本指南书(一个冻结的参考模型)和一张地图。
- 指南书(参考模型):这是 AI 的一个版本,尚未针对特定奖励进行训练。它代表了一种“健康”且多样化的思维方式。它知道解决问题有多种方法。
- 地图(奖励倾斜目标):我们告诉 AI:“你想要找到能获得奖励的出口(正确答案),但是你必须保持你的移动模式与指南书相似。”
类比:
想象你在教一名学生解决数学问题。
- 旧方法:你说:“用任何你能想到的方法得到正确答案!”学生发现了一个奏效的窍门,将其死记硬背,并拒绝学习任何其他方法。
- TraFL 方法:你说:“找到正确答案,但保持你的思维过程多样且灵活,就像一位知道多种不同策略的优等生那样。”
TraFL 迫使 AI 平衡两件事:
- 获得奖励:找到正确答案。
- 保持多样性:不坍缩成单一、重复的路径。它将“概率质量”(选择某条路径的可能性)分散在多个不同的有效解上,并以指南书为锚点。
他们是如何实现的
论文指出,扩散模型很棘手,因为它们不像旧模型那样逐步展示其“思维过程”。为了解决这个问题,作者发明了两个工具:
- 代理分数:由于他们无法看到每一步的确切数学计算,他们创建了一个“代理”分数来估算完整答案的好坏,从而允许他们在不需要完美观察每一个微小步骤的情况下训练模型。
- 学习到的归一化器:他们教会 AI 一个特殊的“计算器”,根据具体问题(提示词)调整任务的难度,确保训练保持公平和平衡。
结果:它真的有效吗?
作者在数学(解决文字题)和代码(编写计算机程序)上测试了这种新方法。
- “单一路径”陷阱被打破:与其他有时在找到一个解决方案时变好、却在找到不同解决方案时变差的方法不同,TraFL 在每一项测试中都有提升。
- 更多样本 = 更好结果:当他们要求 AI 生成 16 个不同答案而不是仅仅 1 个时,TraFL 的表现显著提高。这证明它实际上找到了更多不同的正确答案,而不仅仅是一个幸运的猜测。
- 它适用于新事物:AI 不仅仅是死记硬背训练问题。当在从未见过的全新数学问题(Minerva Math)和新的编程挑战(LiveCodeBench)上进行测试时,TraFL 表现最强。
- 多样性检查:他们使用了一个“裁判”(另一个 AI)来审视答案。裁判确认,TraFL 不仅仅是用不同的措辞给出相同的答案;它实际上使用了不同的推理策略和不同的算法来解决相同的问题。
总结
这篇论文指出了一个缺陷,即 AI 模型会“卡”在解决某种问题的单一方式上,而忽略了其他有效的解决方案。他们通过TraFL修复了这一问题,该方法教导 AI 在寻求正确答案的同时,保持对不同路径的多样化“探索”,并由参考模型引导。其结果是,AI 不仅更聪明,而且在被要求生成多个解决方案时,也更具创造力和可靠性。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。