← 最新论文
💬 NLP

Localize-Then-Decide Guarantees for LLM Judgments

本文提出了一种“先定位后决策”的框架,该框架结合了用于生成高概率候选短名单的符合性预测与基于校准置信度的选择规则,从而恢复了置信度估计的可靠性,并使大语言模型在不同候选规模下均能实现稳健的保证。

原作者: Xinyu Li, Yi Zhou, Guanqun Cao, Zeyu Fu, Tianjin Huang, Gaojie Jin

发布于 2026-08-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Xinyu Li, Yi Zhou, Guanqun Cao, Zeyu Fu, Tianjin Huang, Gaojie Jin

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在人工智能飞速发展的格局中,大型语言模型已不仅是写作或聊天的强大工具,更成为了评判其他机器质量的有力手段。当一个计算机程序针对同一个问题生成多个不同的答案时,必须由人类或其他计算机模型来决定哪一个才是最好的。这一过程正日益自动化,AI 系统正充当着裁判的角色,评估从创意写作到安全准则的一切内容。然而,一个根本性的问题依然存在:我们如何信任这些数字裁判?当一个模型声称对自己的选择非常有信心时,这种信心是否真的意味着它是正确的?多年来,研究人员一直依赖于一个假设,即较高的置信度分数自然与较高的准确率相关联,这一信念在模型仅仅是在两个选项中进行选择时运作良好。但随着选项数量的增加,这种简单的逻辑开始失效,在我们验证自动化决策的能力中制造了一个盲点。

一组研究人员已经确定了这种逻辑失效的具体位置,并提出了一种修复它的新方法。他们发现,当一个 AI 裁判被迫从一大组候选答案中选出最佳响应时——例如,从二十个不同的答案中选出一个,而不是仅仅从两个中选一个——其背后的置相对数就会发生扭曲。想象一下,一个代表模型总确定性的“派”;当只有两块切片时,最好的那块很大且易于识别。但当切片数量增加到二十个时,这个“派”必须在所有切片之间进行分配,使得即使是最好的那一块看起来也会变得很小。这种稀释导致模型的置信度分数下降,即便它已经正确识别出了最佳答案,从而破坏了高置信度与高准确率之间可靠的联系。因此,那些试图通过设置置信度阈值来过滤掉不确定判断的标准方法会失效,它们往往仅仅因为数值看起来不对,就拒绝了好的答案或接受了坏的答案。

为了解决这个问题,研究人员开发了一个名为“先定位后决策”(Localize-Then-Decide)的两步框架。该系统不再试图直接从拥挤的候选名单中挑选出唯一的最佳答案,而是首先将范围缩小到一个非常小的、高质量的候选名单。在第一阶段,模型使用一种统计技术来识别出一小组几乎可以肯定包含人类偏好答案的候选者。这一步起到了安全网的作用,确保真正的最佳选项不会在庞大的群体噪声中丢失。一旦领域被缩减到仅剩几个顶尖竞争者,系统就会进入第二阶段。在这里,它尝试从这个小规模的名单中选出唯一的最佳响应。由于竞争现在仅限于少数几个选项,置信度与准确率之间的关系得以恢复;模型可以再次可靠地区分出什么是稳操胜券,什么是瞎猜。如果模型甚至在这个小群体内都无法找到明确的赢家,它会被设计为退后一步并承认不确定性,而不是进行冒险的猜测。

该团队在多个数据集上并使用各种 AI 模型(从小型系统到大规模、复杂的系统)对这种方法进行了测试。他们将这种两步法与试图直接从完整候选名单中挑选赢家的传统单步法进行了对比。结果显而易见:新框架在达到其安全目标方面的成功率始终更高。传统的做法在候选数量增加时经常无法提供可靠的保证,而新系统则保持了高度的可信度。例如,在目标是确保模型与人类偏好一致率至少达到 81% 的场景中,传统方法经常失败,在某些情况下成功率低至 50%。相比之下,两步法始终能超过 90% 的成功率,有效地证明了当系统表示其有信心时,它是可以被信任去做出正确判断的。

此外,研究人员还展示了这种方法可以扩展为一个级联系统,通过不同模型协同工作来高效处理工作量。在这种设置下,一个较小、较快的模型会首先尝试定位最佳答案。如果它感到不确定,任务就会传递给一个更大、更强大的模型,后者将应用相同的两步逻辑。这种架构使系统能够以高可靠性处理困难案例,同时在处理简单案例时节省计算资源。这项研究证实,通过将复杂的决策分解为定位阶段和选择阶段,我们可以恢复自动化评估所需的数学保证。这项工作不仅改进了我们衡量 AI 性能的方式,还为长期困扰该领域的难题提供了一个结构性的解决方案,确保随着 AI 裁判变得越来越普遍,它们的信心能真正反映其准确性。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →