← 最新论文
💬 NLP

Aligning Language Models with Selective Prediction

本文提出了选择奖励强化学习(RLSR),这是一种新颖的后训练对齐框架,通过直接针对风险覆盖率曲线下面积(AURC)进行优化,使大语言模型实现选择性预测,从而显著改善风险与覆盖率之间的权衡,并增强在高风险决策场景中的可靠性。

原作者: Gaoxiang Luo, Yifan Wu, Sinian Zhang, Aryan Deshwal, Ju Sun

发布于 2026-07-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Gaoxiang Luo, Yifan Wu, Sinian Zhang, Aryan Deshwal, Ju Sun

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心问题:过度自信的 AI

想象一下,你雇佣了一位非常聪明但过度自信的助手,来帮助你做出重要的决策,比如诊断病人或分析股票。这个助手(AI)很擅长回答问题,但它有一个坏习惯:它从不承认自己不知道。 即使在瞎猜的时候,它说话也带着 100% 的确定性。

在涉及高风险的场景中(如法律或医疗),一个自信的错误是极其危险的。你宁愿助手说:“我不确定,让专业人士检查一下”,也不愿它自信满满地给你一个错误的答案。这正是这篇论文试图解决的核心问题:我们如何教会 AI 在何时保持沉默?

解决方案:“选择性预测” (Selective Prediction)

论文提出了一种称为**“选择性预测”**的策略。你可以把它理解为教 AI 成为一个“选择性过滤器”。

AI 不再回答每一个问题,而是被训练去执行以下操作:

  1. 回答那些它非常有把握的问题。
  2. 弃权(说“我不知道”)对于那些它不确定的问题。

通过过滤掉那些冒险的猜测,AI 在它确实回答的问题上的整体准确率会显著提高。

为什么以前的方法不起作用

作者解释说,以往修复这一问题的尝试依赖于**“校准” (Calibration)**。

  • 校准类比: 想象一位天气预报员说:“有 70% 的概率下雨。”如果每 10 次预报中有 7 次真的下了雨,那么这位预报员就是“经过校准的”。
  • 缺陷: 论文指出,仅仅做到“校准”是不够的。你可能会遇到一位预报员,虽然他完全符合校准标准,但他仍然会将一个“可能”的答案排在“确定”的答案之前。
  • 论文的洞察: 你真正需要的不仅仅是一个能诚实表达概率的预报员,而是一个能够完美排序的裁判——能将答案从“最有可能正确”到“最有可能错误”进行精准排序。论文称之为**“选择性预测”**,这与单纯的“校准”是不同的目标。

新方法:RLSR(用于选择奖励的强化学习)

作者创建了一种新的训练方法,叫做 RLSR。它是如何工作的呢?我们可以用一个简单的比喻:

“分院帽”类比:
想象 AI 是一个正在参加考试的学生。

  • 旧方法 (RLVR): 老师只根据答对与否给分。如果学生猜对了,得一分;如果猜错了,得零分。在这种情况下,学生会学会回答所有问题,哪怕是在瞎猜。
  • 新方法 (RLSR): 老师改变了规则。老师不仅关心答案是对是错,还关心排序
    • 老师观察学生所有的答案并说:“我希望你最有信心的答案是正确的,而你最没信心的答案是错误的。”
    • 如果学生答对了一个难题,但表示自己只有“50% 的把握”,他会得到很少的奖励。
    • 如果学生答错了一个简单题,但却表示自己有“99% 的把握”,他会受到巨大的惩罚。
    • 如果学生答对了一个难题,并且表示自己有“99% 的把握”,他会得到极大的奖励。

这种被称为 RLSR 的方法使用了一种特殊的评分系统(基于一个称为 AURC 的指标),通过奖励 AI 在“确定”的答案和“不确定”的答案之间创造出一个清晰的差距。

结果:更好的过滤器

论文在各种困难任务(如数学题和复杂的百科知识)上测试了这种新方法,并将其与旧方法进行了对比。

  • 结果: 经过 RLSR 训练的 AI 变得更擅长判断何时该说话,何时该保持沉默。
  • 证明: 当研究人员设定一个规则,例如“仅在有 90% 把握时才回答”时,经过 RLSR 训练的 AI 比其他模型准确率显著更高。它成功地过滤掉了其他模型不断犯下的“自信错误”。
  • 现实世界测试: 他们甚至在一个医学数据集(MedQA)上进行了测试。当他们强制要求 AI 只能回答那些能保证高水平准确性的问题时,RLSR 模型是唯一一个能够持续达到这种高安全标准的模型。

总结

简而言之,这篇论文教会了 AI 模型停止做“自信的猜谜者”。与其试图对所有事情都给出答案,不如让 AI 成为一个聪明的守门人。它学会了说“我知道这个”和“我不知道那个”,从而确保当它开口说话时,极大概率是正确的。这使得 AI 在处理关键现实工作时更加安全、可靠。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →