The Mirage of Optimizing Training Policies: Monotonic Inference Policies as the Real Objective for LLM Reinforcement Learning
本文指出大语言模型强化学习中的训练-推理失配是导致不稳定的关键原因,并提出了一种名为单调推理策略更新(MIPU)的新型框架,旨在通过单调优化目标确保训练阶段的改进能直接转化为更好的推理性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正在训练一名才华横溢的学生(AI 模型)来解决复杂的数学问题。你拥有两个不同的环境来进行这种训练:
- 教室(训练引擎): 这是学生练习的地方。这是一个拥有完美光照、超高速计算机,且老师能洞察学生每一个念头的尖端实验室。
- 考场(推理引擎): 这是学生在现实世界中真正参加考试的地方。这里的环境有点混乱,计算机速度稍慢,光照也不同。
问题:“两界”脱节
论文指出,在现代 AI 训练中,我们经常将这两个世界视为完全相同的。我们告诉学生:“做得好!你在教室里的成绩提高了 10%!”并假设这意味着他们在考场上的成绩也会提高 10%。
但问题在于:教室和考场实际上是不同的。
由于技术差异(例如计算机处理数字的方式),即使使用的是完全相同的“大脑”(模型参数),学生在考场上的表现也可能与在教室里略有不同。
- 在教室里,学生可能会说:“我有 90% 的把握这个答案是正确的。”
- 在考场里,同一个学生可能实际上只有 70% 的把握,或者犯了一个在实验室里不会犯的微小计算错误。
论文将此称为**“训练-推理失配”(Training-Inference Mismatch)**。
危险在于,AI 会根据它在教室里的表现不断进行更新。但如果这些更新无法转化为考场中的表现,AI 可能会开始做出更糟的现实决策,尽管其训练数据看起来非常完美。这就像一名飞行员在完美的模拟器中练习,却因为实际风力条件不同而在驾驶真飞机时坠毁。
解决方案:“单调推理策略改进”(MIPI)
作者为训练提出了一条新规则:不要只问,“学生在教室里进步了吗?”要问,“学生在考试中真的进步了吗?”
他们称之为 MIPI(单调推理策略改进)。这意味着我们只有在确定更新确实提升了现实世界性能的情况下,才会接受该训练更新,而不仅仅是看教室里的表现。
他们是如何实现的:“MIPU” 两步走过程
为了实现这一点,他们构建了一个新的训练框架 MIPU(单调推理策略更新)。你可以将其视为对学生新知识的一种两步质量控制流程:
第一步:“演练”(采样引用更新)
与其仅仅根据教室规则告诉学生去进步,老师首先会问:“如果你现在使用当前的大脑参加考试,你会表现如何?”
- 他们调整学生的学习方式,使“教室”的练习能更好地与“考场”的现实对齐。
- 这产生了一个候选更新——一个理论上应该变得更好的新版本学生。
第二步:“现实检查”(感知推理差距的接受机制)
在允许学生带着这些新知识进入现实世界之前,老师会进行一次快速测试。
- 他们模拟学生带着新知识参加考试的过程。
- 他们将结果与学生之前的表现进行比较。
- 决策:
- 如果新知识在考场模拟中确实有所帮助?接受它。 学生进入下一阶段。
- 如果新知识在教室里看起来很好,但在考场模拟中导致了混乱或错误?拒绝它。 学生回退到之前的版本。
为什么这很重要
论文在数学问题上测试了这一点,并使用了“低精度”设置(这使得教室与考场之间的差异变得非常明显,就像尝试用按键损坏的计算器来解数学题)。
- 旧方法: AI 会因为在教室里获得了高分而感到兴奋,应用更新,然后由于教室的分数是一个“海市蜃楼”,导致在现实世界中突然崩溃或表现不佳。
- MIPU 方法: AI 保持稳定。它可能会学得慢一些,因为它会拒绝错误的更新,但它能持续地在实际任务上取得进步。它避免了“崩溃”,并保持稳步上升。
核心结论
论文声称我们一直在优化错误的目标。我们一直试图让 AI 变得更擅长“训练”,而实际上我们应该让它更擅长“部署”。
通过增加一个简单的“现实检查”步骤(第二步)并将训练规则与现实世界的规则相对齐(第一步),AI 变得更加可靠。它不再盲目追求虚假环境中的高分,而是开始在现实世界中实现真正、稳定的进步。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。