← 最新论文
🤖 AI

Bridging the Detection-to-Abstention Gap in Reasoning Models under Insufficient Information

本文介绍了“先判断后求解”(JTS)这一推理控制框架,该框架通过训练模型在生成解决方案之前明确承诺可回答性,从而有效弥合了模型虽能识别信息不足却未能选择 abstain 的“检测至 abstention 差距”,最终提升了高风险领域的安全性与效率。

原作者: Renjie Gu, Jiaxu Li, Yihao Wang, Yun Yue, Hansong Xiao, Yefei Chen, Yuan Wang, Chunxiao Guo, Pei Wei, Jinjie Gu, Yixin Cao

发布于 2026-05-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Renjie Gu, Jiaxu Li, Yihao Wang, Yun Yue, Hansong Xiao, Yefei Chen, Yuan Wang, Chunxiao Guo, Pei Wei, Jinjie Gu, Yixin Cao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是论文《在信息不足的情况下弥合推理模型从检测到弃权之间的差距》的解释,采用通俗易懂的语言和富有创意的类比。

问题所在:“自信猜测”的陷阱

想象你是一位被聘请解决谜案的杰出侦探(即 AI 模型)。你得到了一条线索:“嫌疑人留下了一枚沾泥的脚印和半个被咬过的苹果。”

一位普通的侦探可能会想:“嗯,沾泥的脚印暗示着下雨。也许嫌疑人当时在户外。我猜他是个园丁。”他们甚至可能写出一份完整的报告,解释为什么是园丁,尽管线索过于模糊,无法确定。

这正是当前的“推理模型”(高级 AI)在面对信息缺失的问题时所做的事情。

  • 故障点:AI 通常知道某些信息缺失了。在它的“思考过程”中,它可能会说:“等等,我不知道披萨总共有多少片。”
  • 失败点:即使在承认信息缺失后,它也没有停止。它继续思考:“但我们就假设总共有 12 片吧,”然后自信地给出一个错误的答案。

作者将这种现象称为“从检测到弃权的差距”。

  • 检测:AI 看到了拼图中的缺口。
  • 弃权:AI 表示“我无法解决这个问题”。
  • 差距:AI 看到了缺口,却仍然试图用猜测来填补它。

医疗 AI等高风险领域,这是危险的。如果病人问:“我头痛且发烧,该吃什么药?”而 AI 不知道他们的其他症状或过敏史,它就不应该猜测药物。它应该说:“我需要更多信息。”

解决方案:“先判断,后解决”(JTS)

研究人员提出了一种训练这些 AI 的新方法,称为先判断,后解决(Judge-Then-Solve, JTS)。

这就像夜店门口的保镖装配线上的质量检查员

  1. 旧方法:AI 试图立即解决问题。如果它在过程中意识到自己缺少信息,往往已经深陷“思考”之中,无法停下来了。这就像一个司机意识到自己走错了路,但因为已经转了方向盘,所以继续前行。
  2. JTS 方法:在 AI 被允许进行任何解题之前,它必须首先充当法官
    • 步骤 1(审计):AI 必须暂停,并明确询问:“我是否有烘焙这个蛋糕所需的所有原料?”
    • 步骤 2(裁决):
      • 如果答案是“”(信息缺失):AI 必须立即急刹车,合上书本,并说:“我无法回答这个问题。”不允许猜测。
      • 如果答案是“”:只有在这种情况下,它才继续解决问题。

他们如何教会 AI 这样做

你不能只是告诉 AI“停止猜测”并指望它奏效。研究人员使用了一种两步训练法:

  1. 监督式热身(辅助轮):他们向 AI 展示了如何像严格的法官一样行事的具体示例。他们教会了它特定的格式:“首先,检查信息。如果缺失,立即停止。”
  2. 强化学习(奖励系统):他们与 AI 玩了一场游戏。
    • 奖励:如果 AI 正确识别出缺失的信息并停止,它就获得积分。
    • 惩罚:如果 AI 识别出缺失的信息却继续说话和猜测,它就会失去积分。
    • “长度”技巧:他们还增加了一条规则,惩罚 AI 的“过度思考”。如果 AI 意识到自己无法解决问题,却仍然为此写了一大段话,它就会受到惩罚。这教会了 AI 要简洁,并在遇到死胡同时立即停止。

结果:从“过度思考者”到“诚实专家”

研究人员在两种类型的 AI 模型(一种庞大复杂,另一种较小但更密集)上测试了这种方法,使用了数学问题和医疗问题,并故意遗漏了其中的信息。

  • 训练前:AI 大约 50% 的时间能发现信息缺失,但只有约 20% 的时间会真正停止并拒绝回答。它就像一个“知道案件无法解决却仍然撰写报告的侦探”。
  • 经过 JTS 训练后
    • AI 仍然能发现信息缺失(检测)。
    • 关键的是:当它发现信息缺失时,几乎总是(99% 以上)停止并拒绝回答。
    • 额外好处:AI 也变得更快了。因为它停止了对不可能问题的猜测,从而节省了大量的“思考时间”(token)。

副作用:在难题上减少“自我怀疑”

有趣的是,研究人员发现,训练 AI 在简单的信息缺失问题上说“我不知道”,也使其在解决确实有答案困难问题时表现更好。

  • 训练前:AI 会陷入“也许我错了……等等,也许我是对的……不,也许我又错了”的循环(无生产力的自我反思)。
  • 训练后:AI 变得更加果断。它不再浪费时间在那些它本可以解决的问题上自我怀疑,从而得出更清晰、更直接的答案。

总结

该论文表明,高级 AI 往往陷入“在不该猜测时猜测”的习惯。通过迫使它们先判断问题,并在信息缺失时立即停止,研究人员弥合了“知道信息缺失”与“承认无法回答”之间的差距。这使得 AI 更加安全和可靠,特别是在错误猜测可能造成危害的情况下。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →