← 最新论文
🤖 machine learning

Improved Confidence Estimates for Black-Box Large Language Models

本文提出了一种低开销方法,通过利用现有置信度分数以及目标数据集中相似查询的正确性,训练简单的分类器来预测响应的正确性,从而改进黑盒大语言模型的不确定性量化。

原作者: Sokhna Diarra Mbacke, Mouloud Belbahri, Gabriel Loaiza-Ganem

发布于 2026-08-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Sokhna Diarra Mbacke, Mouloud Belbahri, Gabriel Loaiza-Ganem

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

大语言模型已成为写作、编程和回答问题的强大工具,但它们也隐藏着一个风险:有时会以绝对确定的语气编造事实。这种现象通常被称为“幻觉”,它为在医疗或科学研究等高风险领域使用这些系统制造了显著障碍,因为在这些领域,错误的答案可能导致严重的后果。为了解决这个问题,研究人员长期以来一直试图构建能够告诉我们对特定答案应有多大信任度的系统。其目标是为每一个回答分配一个分数,以指示其可靠性。目前,存在许多生成这些分数的方法,从要求模型对自己进行置信度评分,到分析当以不同方式询问同一个问题时,其答案的变化程度。然而,现有的这些评分方法通常孤立运行,将每一个新问题都视为模型从未见过的第一个问题,而没有参考模型过去在类似问题上的表现。

来自 Layer 6 AI 和 TD 保险的研究团队提出了一种不同的方法,他们认为置信度不应被视为模型的固定属性,而是一种可以被学习的模式。他们认为,虽然现有方法在不需要任何先验数据的情况下生成原始的不确定性分数,但现实世界的应用几乎总是涉及一个已经过正确性校验的问题与答案数据集。研究人员意识到,这些带标签的数据是一个巨大的、尚未被开发的资源。他们并没有试图从零开始发明一种衡量不确定性的新方法,而是构建了一个简单的系统,将现有的分数与关于模型过去如何回答类似问题的相关信息结合起来。通过训练一个标准的计算机程序来识别这些输入与答案实际正确性之间的关系,他们创造出了一种新方法,该方法在性能上始终优于原始分数本身。

其工作的核心包含一个模仿人类专家验证新主张的两步过程。首先,系统获取一个新问题以及大语言模型提供的答案。然后,它计算模型或其他工具通常会产生的标准不确定性分数。接下来,系统会在一个既往问题的参考库中查找与新问题最相似的问题。它会检查模型过去在这些相似问题上回答得是正确还是错误,并测量这些问题与当前问题的接近程度。这些细节——标准分数、相似问题的历史记录以及模型在这些问题上的过往表现——都被输入到一个简单的分类器中。这个分类器学习预测新答案是否正确,从而有效地将原始的不确定性信号转化为经过校准的真实概率。

研究人员在多个不同的数据集上测试了这种方法,包括常识推理、科学事实和通用知识问题的基准测试,并使用了各种规模的语言模型。他们将这种新系统与现有的最佳方法进行了对比,包括那些要求模型表达其置信度的方法,以及那些通过生成多个答案变体来检查一致性的方法。结果表明,他们的方法能提供更准确的正确性预测。在几乎所有的测试中,新方法在区分正确与错误答案方面都比原始分数本身表现得更好。此外,该系统产生了经过良好校准的概率,这意味着当它预测一个答案有 80% 的概率是正确时,其预测结果在约 80% 的情况下确实是正确的。这种校准对于决策至关重要,因为它允许用户信任系统提供的数值。

其中最重要的发现之一是,即使在依赖极少额外信息的情况下,该方法依然表现出色。在某些测试中,系统仅使用模型的一个答案和相似问题的历史记录,而无需模型生成多个答案变体。这降低了计算成本,使得该方法在对速度和效率有要求的现实应用场景中具有实用性。研究人员还发现,结合这些信号的最佳方式取决于具体的任务,这表明一种能够适应不同类型问题的灵活方法优于“一刀切”的解决方案。通过将置信度估计视为一个学习问题而非固定的计算过程,该团队证明了利用现有数据可以显著提高大语言模型的安全性和可靠性,且无需访问模型的内部机制或进行昂贵的重新训练。

研究结论指出,虽然目前工具生成的初始不确定性分数是有用的,但它们并不是可靠性的最终定论。通过利用“模型在类似类型问题上表现具有一致性”这一简单事实,监督学习框架可以将这些分数细化为更加值得信赖的估计值。这并不是要取代对优秀不确定性度量指标的需求,而是对其进行增强,将原始数据转化为可操作的洞察。这项工作表明,通往更安全人工智能的道路不仅在于构建更好的模型,还在于构建更好的方式来理解和解释这些模型所给出的答案。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →