← 最新论文
💬 NLP

Likelihood-Based Reward Designs for General LLM Reasoning

本文系统地证明了,在思维链推理的微调中,使用参考答案的对数概率作为奖励信号是一种优越且通用的方法,其在可验证场景中优于二元奖励,在不可验证场景中则能媲美监督式微调,同时避免了基于概率的其他替代方案的缺陷。

原作者: Ariel Kwiatkowski, Natasha Butt, Ismail Labiad, Julia Kempe, Yann Ollivier

发布于 2026-02-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Ariel Kwiatkowski, Natasha Butt, Ismail Labiad, Julia Kempe, Yann Ollivier

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一名非常聪明但缺乏经验的学生(一个大语言模型)如何解决复杂问题。这个学生很擅长表达,但他们需要学习在给出答案之前如何进行“出声思考”(思维链,Chain-of-Thought)。

这篇论文探讨了一个特定的问题:当你没有标准答案时,你该如何给这个学生评分?

旧方法:“通过/失败”测验

传统上,为了训练这些模型,研究人员使用一种类似于严厉数学老师的方法。

  1. 学生进行出声思考。
  2. 学生给出答案。
  3. 老师检查标准答案。
    • 正确? 你得到一颗金星(奖励 = 1)。
    • 错误? 你得到一个红色的 X(奖励 = 0)。

问题所在: 这在有唯一正确答案的数学或编程领域效果很好。但如果你是让学生写一篇长故事、一首诗或一个复杂的证明,那里并没有单一的“正确”答案。你不能给出一个简单的“通过/失败”的分数。此外,如果学生出错的概率高达 99%,他们永远拿不到金星,从而停止学习,因为反馈信号过于稀疏。

新想法:“可能性”评分

作者提出了一种不同的评分方式。他们不是检查答案是否“正确”,而是检查学生对自己答案的自信程度。

可以这样理解:

  • 旧方法: “你答对了吗?是/否。”
  • 新方法: “你说出完全相同的这些词的可能性有多大?”

如果学生说出的词与训练数据中的参考答案完全一致,老师会根据对数概率(log-probability,一种衡量“你对发生这件事感到多么惊讶”的数学方式)给他们评分。

  • 如果学生非常有信心并说了正确的词,他们会得到高分。
  • 如果学生是在瞎猜,他们会得到低分。

重大发现:“对数概率”是神奇钥匙

研究人员测试了使用这种“信心”评分的许多不同方法。他们发现,其中一种特定方法——使用参考答案的对数概率——是唯一在所有领域都奏效的方法。

以下是使用简单类比对他们发现的详细拆解:

1. “短答案”测试(数学与编程)

  • 设定: 有明确正确答案的短问题(如数学测验)。
  • 结果: “对数概率”方法在获得正确答案方面,表现得与旧的“通过/失败”方法一样出色。
  • 加分项: 它还让学生的回答变得更加“自然”且不再抖动。旧方法会让学生为了得到金星而胡乱猜测,而新方法则让学生即使在出错时,听起来也更有信心、更流畅。

2. “长文章”测试(故事与证明)

  • 设定: 没有单一正确答案的长篇、开放式任务。
  • 其他方法的问题: 有些方法尝试使用简单的“概率”(仅仅是正确的原始概率)。但对于长篇文章,猜中完全相同的词的可能性微乎其微(就像中彩票一样)。分数变得如此之小,几乎等于零,导致学生停止学习。
  • 胜出者: “对数概率”方法完美地处理了这个问题。它没有崩溃。它的表现就像老师直接向学生展示答案并说:“记住这个”一样出色。

3. “思考变短”的意外发现

关于学生思考时长,最有趣的发现之一是:

  • 当使用新的“对数概率”奖励时,学生最初开始思考得更少了。他们缩短了“思维链”(思考过程),仅保留几个词。
  • 为什么? 模型意识到,在最初的几个步骤中,比起冗长复杂的思考过程,更短、更简单的思考过程实际上能带来更高的得分。
  • 在数学中: 随着能力的提升,学生最终学会了再次进行长思考。
  • 在文章中: 他们保持了简短。他们基本上停止了“出声思考”,而是直接给出答案,表现得像一个标准的记忆者。论文指出,对于长篇开放式任务,模型可能是在自己的大脑(隐藏层)中进行“思考”,而不是将其写出来,因此强迫它写下长长的思维链反而会损害性能。

核心总结

论文得出结论,使用对数概率作为奖励是 AI 训练中的一种“通用翻译器”。

  • 它弥合了可验证任务(数学)与不可验证任务(写作)之间的鸿沟。
  • 它不需要特殊的“验证器”或标准答案。
  • 它允许 AI 从任何存在参考答案的数据集中学习,无论是一个短数学题还是一个长证明。

简而言之:与其问 AI“你答对了吗?”,不如问“你对说出这些话有多确定?”,这是一种更简单、更强大的方式来教 AI 进行推理,涵盖了从数学谜题到长篇论文的所有内容。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →