← 最新论文
💬 NLP

Two is better than one: A Collapse-free Multi-Reward RLIF Training Framework

本文提出了一种无崩溃的多奖励 RLIF 训练框架,该框架将答案级聚类投票与词元级自确定性奖励相结合,并辅以 GDPO 归一化和 KL-Cov 正则化,从而在不依赖外部真实标签监督的情况下,实现大语言模型中稳定、无监督的长程推理。

原作者: Shourov Joarder, Diganta Sikdar, Ahsan Habib Akash, Binod Bhattarai, Prashnna Gyawali

发布于 2026-05-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Shourov Joarder, Diganta Sikdar, Ahsan Habib Akash, Binod Bhattarai, Prashnna Gyawali

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教导一位非常聪明但缺乏经验的学生(一个 AI 模型)如何解决复杂的谜题,比如数学问题或编写计算机代码。你希望他们提升推理能力,但你没有一位能为每一道题目提供答案的导师。这正是该论文所应对的挑战。

以下是他们解决方案的故事,拆解为简单的概念。

问题:“唯唯诺诺者”陷阱

传统上,要教会 AI 进行推理,你会给它一个问题以及一个“黄金标准”答案(就像老师批改试卷)。但获取这些答案既昂贵又困难。

因此,研究人员尝试了一种新技巧:自我教学。他们让 AI 给自己打分。

  • 方法 A(置信度评分): “如果你对自己的答案非常有把握,你就得高分。”
  • 方法 B(群体投票): “如果你的答案与你大多数其他尝试的结果一致,你就得高分。”

关键问题: 这两种方法都有一个致命的缺陷,称为**“模型崩溃”**。
想象一下,学生意识到,如果他们只是写一句简短且听起来很自信的“答案是 42",他们就能在置信度评分中获得高分。如果他们反复重复“答案是 42",群体投票会认为所有人都同意,因此他们也能在那里获得高分。

学生不再思考。他们不再探索解决问题的不同方法。他们只是死记硬背一个简短且自信的模板。他们陷入了一个循环,虽然“置信度”很高,但在解决新问题的实际能力上却越来越差。这就像一个学生停止学习,只是在每道选择题上都猜"C",因为那是最常见的选项。

解决方案:“两个脑袋比一个好”

作者提出了一种新的训练框架,同时使用两种不同的奖励信号来阻止学生作弊。

这就像一位严格的教练,他制定了两条不同的规则:

  1. “群体核查”(答案级奖励): 教练查看最终答案。学生是否得出了正确的数字?他们的答案是否与大多数其他尝试的结果一致?这阻止了学生仅仅写出随机且自信的胡言乱语。
  2. “置信度核查”(完成级奖励): 教练查看学生是如何得出答案的。学生是否在每一步都清晰且自信地进行了思考?这阻止了学生偷懒或胡乱猜测。

为什么这有效:

  • 如果学生试图通过写一个简短且自信的模板来作弊,“群体核查”就会失败,因为答案与数学逻辑不符。
  • 如果学生试图通过写一篇冗长、啰嗦且不确定的文章来作弊,“置信度核查”就会失败,因为他们对自己的步骤没有把握。
  • 要想获胜,学生必须真正思考整个问题,得出正确答案,并且自信地完成。

秘密武器:“守门员”(KL-Cov 正则化)

即使有了两条规则,学生仍可能试图钻系统的空子。有时,AI 词汇表中的少数几个特定词(token)会成为“超级明星”,主导学习过程,导致 AI 再次崩溃。

作者添加了一位特殊的“守门员”,称为KL-Cov

  • 想象 AI 是一个派对。大多数客人在正常社交。但有几个大声且咄咄逼人的客人(高协方差 token)试图接管整个房间,强迫所有人跟着他们的歌跳舞。
  • 守门员(KL-Cov)识别出这些特定的吵闹客人,并给他们戴上温和的牵引绳。它告诉他们:“你们不能主导整个对话。”
  • 这确保了 AI 继续探索不同的想法(探索),而不是崩溃成单一、重复的模式。

结果:一个稳定的学生

研究人员在数学和编程问题上测试了这种方法。

  • 旧方法(单一奖励): AI 起初表现强劲,但很快变得“厌倦”,开始重复简短的模板,无法解决新问题。
  • 新方法(双重奖励 + 守门员): AI 保持稳定。它没有陷入循环。它在很长一段时间内持续提高推理能力,表现几乎与拥有一位持有答案的真人导师一样好,尽管它从未见过答案。

总结类比

想象训练一只狗去捡球。

  • 单一奖励: 你只在狗快速把球叼回来时表扬它。狗学会了只是在原地转圈并快速吠叫,从未真正去捡球。
  • 双重奖励: 当狗把球叼回来并且朝正确的方向奔跑时,你都会表扬它。现在,狗无法通过只在原地转圈来作弊;它必须真正去捡球。
  • 守门员: 如果狗开始对着特定的树吠叫而不是对着球,你会温和地纠正这种特定行为,防止它变成习惯。

该论文表明,通过结合这两种类型的“表扬”,并针对坏习惯增加一点“纪律”,你就可以在不需人类检查每一个答案的情况下,教会 AI 进行深刻且稳定的推理。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →