← 最新论文
💬 NLP

Judge, Retrieve, or Abstain: Uncertainty-Guarded LLM Judging with Provable Risk Guarantees

本文提出了一种用于大语言模型判定的风险控制框架,该框架根据校准后的不确定性阈值,在参数化模式与检索增强模式之间动态路由实例,从而在保证被接受判定(accepted verdicts)的错误发现率保持在用户指定水平以下的同时,实现覆盖率的最大化。

原作者: Sher Badshah, Ali Emami, Hassan Sajjad

发布于 2026-08-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Sher Badshah, Ali Emami, Hassan Sajjad

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在人工智能快速发展的世界中,衡量计算机程序理解世界能力的测试出现了一个新标准。研究人员不再依赖人类专家来阅读并评分机器生成的每一个答案,而是通常使用一个大型语言模型来充当另一个模型的评判者。这种方法高效且具有可扩展性,能够让开发者在人类评阅一篇论文的时间内,评估数千个响应。然而,当这些数字评判者被要求验证事实时,一个显著的问题随之而来。与没有唯一正确答案的主观任务不同,事实性问题有着明确的真伪。评判者可能会仅仅因为某个陈述听起来很有道理,或者因为模型遗忘了近期发生的事件,就自信地将一个错误的陈述判定为正确。由于缺乏了解评判者何时处于不确定状态的方法,这些无声的错误可能会悄然溜过,导致结论不可靠。

核心挑战在于平衡信心与准确度。如果评判者过于谨慎,它会拒绝回答大多数问题,从而使系统变得毫无用处;如果它过于急切,则会犯错。研究人员曾尝试通过让评判者承认自己的不确定性来解决这一问题,但这往往意味着要丢弃那些模型只是“感觉不确定”但可能原本正确的答案。发表在 COLM 2026 会议上的一项新研究提出了一种更聪明的折中方案。研究人员 Sher Badshah、Ali Emami 和 Hassan Sajjad 开发了一套系统,允许评判者在放弃之前先暂停并寻求帮助。当评判者基于其内部记忆对某个事实感到不确定时,它不会立即拒绝回答。相反,它配备了一个搜索网络证据的工具。随后,它利用这些新信息重新评估问题。只有当评判者在阅读搜索结果后仍然感到不确定时,它才会承认失败并将问题标记以供人工审核。

该团队在多种困难的问答基准测试上测试了这种两步法,使用不同规模的语言模型分别担任“学生”和“评判者”。他们发现,通过加入这个检索步骤,系统可以比单独工作的评判者更自信地回答更多问题。至关重要的是,研究人员不仅仅是寄希望于此有效,他们还为这一过程构建了一个数学上的安全网。他们在一组已知问题上对系统进行了校准,以确保其接受的答案中的错误率保持在用户定义的特定限度之下。例如,如果用户设置了 5% 的限度,系统就能以极高的统计确定性,保证其错误率维持在该水平或以下。即使当评判者从使用自身知识转向使用网络搜索结果时,这一保证依然成立——而这种复杂的转换在以往的方法中很难在不失控错误率的情况下进行管理。

结果显示,这种自适应策略显著提高了系统在不牺牲可靠性的前提下提供答案的能力。在一些难度较高的数据集上,该系统能够接受几乎所有被问及问题的答案,而没有网络搜索功能的评判者则会拒绝回答其中的绝大部分。研究表明,该系统可以恢复在知识密集型任务中的覆盖率,而这类任务在以往往往会因不确定性而丢失。此外,研究人员还检查了当网络搜索结果随时间变化时,系统是否仍能保持可靠,这模拟了互联网信息不断变化的现实场景。他们发现,安全保证依然稳固,证明了该系统可以在无需每次因网络变化而进行完全重新校准的情况下,适应新信息。

这项工作为在事实准确性至关重要的场景中部署人工智能提供了一条切实可行的路径。通过将自动化评判的速度与通过搜索实现的类人验证的可靠性相结合,该系统弥合了效率与信任之间的鸿沟。它表明,机器可以被教会识别自身的局限性,不仅是通过保持沉默,更是通过知道何时去查找答案。研究结论指出,通过建立正确的保障机制,我们可以构建出既敢于回答难题、又足以确保答案正确的评估系统,为下一代人工智能应用提供坚实的基石。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →