← 最新论文
💬 NLP

Beyond Binary Rewards: Training LMs to Reason About Their Uncertainty

本文介绍了 RLCR(带校准奖励的强化学习),这是一种新颖的训练方法,通过在二元正确性奖励中引入 Brier 分数,同步提升语言模型的准确性与校准置信度,从而缓解标准强化学习常引发的幻觉与校准退化问题。

原作者: Mehul Damani, Isha Puri, Stewart Slocum, Idan Shenfeld, Leshem Choshen, Yoon Kim, Jacob Andreas

发布于 2026-05-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Mehul Damani, Isha Puri, Stewart Slocum, Idan Shenfeld, Leshem Choshen, Yoon Kim, Jacob Andreas

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在训练一名非常聪明的学生参加一场高难度的考试。目标不仅仅是让他们答对题目,更是要让他们知道何时是在猜测,以及何时是确定的

这篇题为《超越二元奖励》的论文,提出了一种训练这些 AI“学生”(语言模型)的新方法,使它们变得更聪明,同时也更诚实地反映其置信度。

问题:“猜谜游戏”陷阱

目前,当我们训练 AI 去解决难题(如数学或常识问答)时,使用的是一个简单的评分系统,称为二元奖励

  • 规则:如果答案正确,得一分;如果错误,得零分。
  • 缺陷:这个系统并不关心 AI 是如何得出答案的。无论 AI 是通过深度逻辑推理得出答案,还是胡乱猜测并侥幸猜中,它得到的分数都是一样的。
  • 结果:AI 学会成为一个“自信的赌徒”。即使它完全不知道自己在说什么,也会以 100% 的置信度开始猜测答案。在现实世界中,这是危险的,因为 AI 可能会“幻觉”(胡编乱造),并且对其谎言表现得非常确信。

解决方案:RLCR(“诚实教练”)

作者提出了一种新的训练方法,称为RLCR(带有校准奖励的强化学习)。你可以将其想象为聘请了一位同时从两个方面给学生打分的教练:

  1. 你答对了吗?(准确性)
  2. 你的置信度水平准确吗?(校准度)

它是如何工作的:
AI 不再仅仅被要求回答“对”或“错”,而是被迫说出:“这是我的答案,以及一个从 0 到 1 的数字,代表我有多确定。”

教练使用一种特殊的评分规则(称为Brier 分数)来评估置信度:

  • 如果 AI 说“我有 90% 的把握”并且答对了,它会得到极好的分数。
  • 如果 AI 说“我有 90% 的把握”但答错了,它会受到严厉的惩罚。
  • 如果 AI 说“我有 50% 的把握”(不确定)并且答错了,它受到的惩罚会较小。

这教会了 AI 一个至关重要的道理:与其自信地犯错,不如不确定地犯错。

类比:天气预报员

想象两位天气预报员:

  • 预报员 A(旧方法):总是说:“明天肯定会下雨!”如果下雨了,他们是天才;如果是晴天,他们只是错了,但他们从不承认自己是在猜测。他们是“过度自信”的。
  • 预报员 B(RLCR 方法):会说:“有 60% 的概率会下雨。”如果下雨了,他们是对的;如果是晴天,他们会承认:“嗯,我说了 60%,所以我错了,但我当时知道存在这种可能性。”

论文表明,预报员 B(即 RLCR 模型)要可靠得多。他们不仅更频繁地给出正确答案,还能确切地告诉你何时是在猜测,这样你就知道何时可以信任他们,何时需要再次核实。

实验结果

研究人员在涉及事实(例如"1969 年谁赢得了欧洲歌唱大赛?”)和数学问题的难题上测试了这种方法。

  1. 更高的诚实度:RLCR 模型停止了胡乱猜测。当它们不确定时,会降低置信度分数。
  2. 依然聪明:关键在于,让 AI 变得“诚实”并没有让它变“笨”。它在已知的问题上保持了高准确率。
  3. 泛化能力:即使 AI 面对从未见过的问题(域外问题),与旧的“自信猜测者”模型相比,它对其不确定性的诚实度也高得多。
  4. 测试时提升:由于 AI 的置信度分数现在值得信赖,研究人员可以利用它们来改进最终答案。例如,如果 AI 生成了 10 个不同的答案,他们可以选择置信度分数最高的那个,它更可能是正确的。

结论

这篇论文证明,通过教会 AI“思考其自身的思考”,并奖励其诚实地面对不确定性,我们可以构建出不仅准确而且可靠的推理系统。它们不再假装无所不知,而是开始告诉你何时它们仅仅是在猜测。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →