Rewarding Intellectual Humility Learning When Not To Answer In Large Language Models
本文证明了具有可验证奖励的强化学习(RLVR)通过明确激励模型在面对不确定问题时选择拒绝回答,能够有效减少大语言模型的幻觉现象并提升其智力谦逊度,且不会显著降低其在事实基准测试上的准确性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在雇佣一位非常聪明、博学多才的助手来回答你的问题。问题在于,这位助手有点“好为人师”。即使他们实际上不知道答案,也会感到有一种必须给出答案的冲动,甚至会编造一些听起来很有说服力但完全错误的事实。在人工智能的世界里,这被称为“幻觉”(hallucinating)。
这篇论文是关于教导这些 AI 助手一项至关重要的技能:知道何时说“我不知道”。
以下是他们方法的详细拆解,使用了简单的类比:
问题所在:过度自信的猜测机器
目前的语言大模型(LLMs)被训练为总是给出答案。如果你问它们一个问题,它们会试图生成某些东西,即使它们只是在瞎猜。这就像一个参加考试的学生,因为害怕留白而不敢交白卷,所以随手涂鸦一个答案以求得分。这会导致自信满满但却是错误的信息。
解决方案:“诚实奖励”系统
研究人员尝试了一种新的训练方法,称为带有可验证奖励的强化学习(RLVR)。你可以把它想象成一种新的评分系统。
他们不仅仅是针对正确答案给分,而是引入了一个三方评分系统:
- 正确答案: +1 分(做得好!)
- 错误答案: -1 分(瞎猜,你会丢分。)
- “我不知道”: 一个特殊的奖励(假设为 +0.3 分)。
目标是教会 AI:承认不知道比自信地瞎猜却答错要更好。他们想要寻找那个“金发姑娘原则”(Goldilocks)下的完美奖励值:不能太高(否则 AI 会为了拿分对所有问题都说“我不知道”,从而停止尝试),也不能太低(否则它会继续瞎猜)。
实验:测试新规则
他们在两种不同类型的“学生”(AI 模型)身上进行了测试:
- Granite-3.3-2B: 一个较小、更紧凑的模型。
- Qwen-3-4B: 一个更大、更强大的模型。
他们也在两种不同的“考试”上测试了它们:
- MedMCQA: 多项选择医学题(类似于带有固定选项的知识问答)。
- Hendrycks Math: 需要写出长篇解答的难题(类似于论文或证明过程)。
他们的发现
1. “甜点区”对选择题有效
在多项选择医学问题上,他们找到了“我不知道”奖励的“甜点区”(最佳平衡点)。
- 如果他们给“我不知道”一个微小的奖励,AI 开始承认自己的不确定性。
- 结果: 虚假、捏造答案的情况显著下降。AI 变得更加谦逊。
- 权衡: AI 的整体正确率也略有下降,因为它不再盲目猜测。然而,研究人员发现,一个适度的奖励(约 0.3)可以在减少错误猜测的同时,不会破坏原本正确的回答。
- 大模型的优势: 较大的模型(Qwen)比较小的模型更好地处理了这种“诚实训练”。它能够在需要时说“我不知道”,而不会损失过多的智能水平。
2. 在开放式问题中的挣扎
当他们尝试在困难的数学题(即 AI 需要写出长篇回答的任务)上进行测试时,这种方法本身的效果并不理想。
- 问题所在: AI 太习惯于猜测了,以至于它不敢尝试“我不知道”这个选项。这就像一个因为太害怕出错而拒绝考虑留白的学生。AI 在训练过程中没有充分“探索”表达“我不知道”这一选项的可能性。
- 解决方法: 他们尝试了一个两步走的过程。首先,他们强迫 AI 在一组特定的问题上练习说“我不知道”(监督微调/SFT)。然后,再应用奖励系统。这帮助 AI 熟悉了“弃权”的概念,尽管平衡起来仍然很困难。
核心结论
论文得出结论:你不能仅仅告诉 AI 要诚实,你必须通过奖励来引导它变得诚实。
通过调整给予“我不知道”的“分数”,开发者可以调节 AI 的性格。他们可以让它变得更谨慎(不太可能撒谎),或者更自信(更有可能尝试),取决于实际需求。
- 对于谨慎型方案: 给“我不知道”一个较小的奖励。AI 将停止捏造事实,这使得它在医疗或法律建议等出错代价极高的领域中更加可靠。
- 局限性: AI 需要一些额外的帮助来学习如何首先开口说出“我不知道”,尤其是在处理复杂的开放式任务时。
简而言之,研究人员建立了一本训练手册,教导 AI 模型:沉默有时比谎言更好;并且他们证明了,只要有正确的奖励机制,AI 确实可以学会保持理性的谦逊。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。