← 最新论文
💻 computer science

Learning Reasoning Reward Models from Expert Demonstration via Inverse Reinforcement Learning

该论文提出了一种基于专家演示的对抗逆强化学习(AIRL)框架,通过在不同奖励粒度下学习可复用的推理奖励模型,有效弥补了监督微调的模仿局限与基于结果奖励的强化学习对验证器的依赖,从而在训练、推理重排序及跨任务迁移中显著提升了大语言模型的推理能力。

原作者: Claudio Fanconi, Nicolás Astorga, Mihaela van der Schaar

发布于 2026-04-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Claudio Fanconi, Nicolás Astorga, Mihaela van der Schaar

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文提出了一种让大语言模型(LLM)变得更会“思考”的新方法。为了让你轻松理解,我们可以把大语言模型想象成一个正在学习解题的学生,而这篇论文的核心就是如何给这个学生制定一套更聪明的“评分标准”

1. 现有的问题:学生只会“死记硬背”或“只看结果”

目前,教学生(模型)解题主要有两种老办法,但都有缺点:

  • 方法一:照猫画虎(监督微调 SFT)
    • 比喻:老师把标准答案和解题步骤直接抄给学生看,让学生背诵。
    • 缺点:学生只是机械地模仿。一旦遇到老师没教过的新题型(偏离了演示轨迹),学生就懵了,因为他只记住了“怎么抄”,没学会“怎么想”。
  • 方法二:只看分数(基于结果的强化学习)
    • 比喻:老师不管学生解题过程对不对,只看最后的答案。答案对了给糖,错了打屁股。
    • 缺点:这就像考试只改卷不改过程。如果学生蒙对了,或者走了歪路但最后碰巧蒙对,老师也发现不了。而且,如果老师没有现成的“标准答案生成器”(验证器),这招就用不了。

2. 这篇论文的妙招:逆向工程“学霸思维” (AIRL)

作者提出了一种叫**“对抗性逆强化学习” (AIRL)** 的新方法。

  • 核心思想:既然我们有很多“学霸”(专家)的解题过程,我们为什么不逆向推导出学霸脑子里的“评分标准”呢?
  • 比喻
    • 以前是老师直接告诉学生“这样做对”。
    • 现在是让一个**“挑剔的评委”(判别器模型)** 去观察学霸的解题过程。
    • 评委的任务是:“找出学霸每一步为什么走得对,而普通学生(当前模型)哪里走偏了。”
    • 一旦评委学会了这套“评分标准”(奖励模型),它就可以反过来指导普通学生,告诉它:“你刚才那步逻辑虽然答案还没错,但思路已经歪了,赶紧改!”

3. 这个“评分标准”的三个超能力

这篇论文证明,学会这套“评分标准”后,有三个巨大的好处:

① 训练时的“私教” (Training Signal)

  • 比喻:以前学生只能靠背题(SFT)或盲目试错。现在,这个“评分标准”就像一个24 小时在线的私教
  • 效果:学生在做题时,私教能实时指出:“你这一步虽然还没算错,但逻辑链条已经松动了。”这让模型能学到真正的推理能力,而不仅仅是模仿。实验显示,在很多数学和科学题上,用这个方法训练的学生,成绩比单纯背题的要好。

② 考试时的“排雷兵” (Inference-time Reranking)

  • 比喻:考试时,学生可以试着写 16 种不同的解题思路(采样)。以前我们只能随机挑一个,或者瞎蒙。
  • 效果:现在,有了这个“评分标准”,我们可以把这 16 种思路都过一遍,让评委给它们打分,只挑分数最高的那个作为最终答案。
  • 数据:在固定尝试次数的情况下,这种方法能让正确率提升高达 17.4%!就像在 16 个候选人里,用慧眼识珠挑出了最靠谱的那个。

③ 诊断“病灶” (Error Localisation)

  • 比喻:这是最精彩的部分。以前的方法只知道“这题做错了”,但不知道哪一步错的。
  • 效果:这个“评分标准”能像X 光一样,精准定位到学生在哪一句话、哪一个逻辑步骤开始变歪的。
    • 比如,前 5 步逻辑都很完美,奖励分很高;第 6 步突然算错了,奖励分瞬间变负。
    • 这意味着我们不仅能知道结果,还能诊断出学生是哪里“脑子短路”了,甚至能跨学科使用(比如在数学题上学到的逻辑,能辅助解决医学推理题)。

4. 奖励的“颗粒度”:粗调 vs 细调

论文还讨论了一个有趣的细节:评分应该多细?

  • 稀疏奖励(粗调):只在最后给分。
    • 比喻:像期末考试,只有总分。
    • 优点:稳定,不容易出错。
    • 缺点:不知道中间哪里错了。
  • 密集奖励(细调):每一步都给分。
    • 比喻:像每走一步都有教练喊“停,这里不对”。
    • 优点:能精准定位错误,指导性强。
    • 缺点:很难训练,容易让模型“钻空子”(为了拿每一步的分而胡编乱造)。
  • 结论:论文发现,“中等粒度”(比如每隔几步给一次分)往往是最平衡的,既稳定又能提供足够的指导。

总结

简单来说,这篇论文做了一件很酷的事:
它不再让 AI 死记硬背,也不让它盲目试错,而是从专家的优秀解题过程中,提炼出一套“内在的推理逻辑评分表”

这套评分表不仅能AI 怎么思考(训练),还能在考试时AI 挑出最好的答案(推理),甚至能诊断AI 哪里想错了(诊断)。这就好比给 AI 装上了一个“逻辑导航仪”,让它从“只会背地图”变成了“真正会认路”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →