← 最新论文
💬 NLP

Claim-Level Confidence Calibration for Reliable Decision Making with Large Language Models

本文提出了一种闭盒框架,该框架将大语言模型(LLM)的响应分解为原子级断言,并利用推理时信号进行事后校准,以生成可靠的断言级置信度评分,从而在高度敏感领域实现更具行动力的决策和针对性的验证。

原作者: Toghrul Abbasli, Kentaroh Toyoda, Yuan Wang, Li Chen

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Toghrul Abbasli, Kentaroh Toyoda, Yuan Wang, Li Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在人工智能飞速发展的背景下,大型语言模型已成为生成文本、回答问题和协助处理复杂任务的强大工具。然而,一个持久的挑战依然存在:这些系统有时会产生听起来很有把握但事实错误的答案,这种现象被称为“幻觉”。对于依赖这些模型进行关键决策的用户来说,危险不仅在于出错,更在于以绝对确定的态度出错。为了解决这个问题,研究人员长期以来一直在寻找衡量模型不确定性的方法,本质上是在询问系统对其自身输出的把握程度。传统方法通常为整个回答提供一个单一的置信度分数,就像天气预报为一整天给出一个概率值一样。然而,一个回答可能包含准确事实与微妙错误的混合,这使得单一的总分对于那些在采取行动前需要核实特定细节的人来说过于粗略,难以发挥作用。

由清华大学及其他机构的 Toghrul Abbasli 及其同事开展的一项新研究提出了一种针对该问题更细粒度的方法。研究人员不再将回答视为一个单一的文本块,而是开发了一种方法,将每个答案分解为其最小的、独立的知识单元,他们称之为“原子命题”(atomic claims)。随后,他们为每一个单独的命题分配一个特定的置信度分数。团队在包括主要开发商系统在内的几种现代语言模型上测试了这一技术,并使用了两类不同的问题集:一组侧重于通用事实知识,另一组旨在诱导模型接受错误的前提。他们的研究结果表明,通过在命题层面进行隔离和校准置信度,可以为决策者创造一个更可靠的信号。这种方法允许用户接受那些极有可能为真的部分,同时对特定的句子进行标记以供进一步审查或拒绝,为在高风险环境中实现更安全、更可靠的人工智能提供了一条切实可行的路径。

研究人员工作的核心是一个多步骤流水线,该流水线无需修改语言模型本身的内部机制即可运行。首先,系统生成一个针对用户问题的回答。接着,一个辅助工具将此回答分解为简短、自洽的陈述,例如“爱因斯坦提出了相对论”或“这发生在1905年”。一旦回答被分解,系统就会对每个陈述进行单独评估。它使用两种主要的信号来确定模型对每个命题的把握程度。第一个信号来自模型的自我评估或口头表达的置信度,即通过提示模型说明其确定程度。第二个信号依赖于一致性;系统生成多个版本的回答,并检查相同的命题是否出现在所有版本中。如果一个命题在不同的尝试中重复出现,则被视为更加可靠。这两个信号随后被结合起来,为每个具体的命题生成最终的置信度分数。

为了确保这些分数具有意义,研究人员应用了一个称为“事后校准”(post-hoc calibration)的统计过程。这一步骤调整了原始置信度数值,使其与现实相符。例如,如果系统对一组命题分配了 90% 的置信度,校准过程将确保大约 90% 的命题实际上是正确的。研究人员在数千个问题中,在六种不同的语言模型(涵盖从开源系统到专有商业模型)上测试了这一框架。结果显示,与仅关注整体回答的方法相比,这种命题层面的方法显著降低了置信度估计的误差率。在事实性问题上,校准后的分数变得更加准确,这意味着当系统表示有 90% 的把握时,它在 90% 的时间内确实是正确的。这种精确度使人类用户能够做出具体的决策:他们可以立即信任高置信度的命题,同时将注意力转向低置信度的命题以进行核实。

然而,研究也明确指出该方法面临局限性的界限。当问题设计带有错误前提时——即假设某件错误的事实为真的陷阱——模型往往会生成流畅、自信但完全错误的命题。在这些对抗性场景中,命题层面的置信度分数有时无法检测出错误,因为模型在其错误中保持了内部一致性。研究人员发现,虽然他们的方法擅长处理包含正确与错误信息的混合回答,但无法始终克服那些对基础事实表现出自信错误的模型。在这种情况下,研究表明,仅靠置信度分数是不够的;需要外部检查,例如搜索证据或由另一个系统进行交叉质询,才能捕捉到这些深层错误。

这项工作的实际意义在于改变了我们在专业环境中与人工智能互动的方式。决策者不再是根据模糊的信任感来接受或拒绝整个回答,而是可以依靠一份详细的可靠性地图。例如,一份由 AI 生成的医疗报告可以因其整体结构而被接受,而具体的药物剂量或病史细节则可以根据其各自的置信度分数被标记出来,交由人工审核。研究人员强调,即使对于内部机制隐藏的“黑盒”模型,这种技术同样有效,这使其适用于目前正在使用的最先进的商业系统。虽然该方法并未完全解决幻觉问题,特别是在模型被错误假设误导时,但它为管理不确定性提供了一个强大的工具。通过将语言模型输出的“黑盒”分解为可验证的碎片,这项研究提供了一种方法,让我们在进行高风险决策时,能够更清晰地了解哪些内容是可以信任的,哪些内容需要进一步调查。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →