A Calibrated Reflection Approach for Enhancing Confidence Estimation in LLMs
本文引入了一种校准反射(Calibrated Reflection)框架,通过最大置信度选择、基于反射的提示以及距离感知校准来增强大语言模型的置信度估计,证明了其在多种对话和事实型任务中均具有更高的可靠性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在人工智能快速演进的格局中,大型语言模型已成为强大的工具,能够生成类人文本、回答复杂问题,甚至进行对话。然而,信任这些系统仍面临一个重大障碍:即了解它们何时正确,何时错误。这些模型生成的答案往往听起来流利且自信,即便事实是错误的。这是一个校准(calibration)问题。在一个校准良好的系统中,如果模型声称对某个答案有百分之九十的把握,那么它应该在百分之九十的时间里是正确的。如果没有这种可靠性,用户就无法区分一项值得信赖的见解与一次自信的幻觉。当处理序数数据(ordinal data)时,这种不确定性尤其棘手,例如在从一星到五星的量表上对服务进行评分。在这些情况下,接近真相的错误比远离真相的错误严重程度较低,但标准方法往往无法识别这种细微差别,将所有错误视为同样糟糕。
亚马逊的研究人员开发了一种旨在修复这一盲点的新框架,创建了一个帮助语言模型更好地理解自身确定性的系统。他们的方法被称为“校准反射”(Calibrated Reflection),结合了两种主要策略来改进模型判断自身工作的方式。首先,他们引入了一种方法,让模型评估每一个可能的选项,而不仅仅是那些最可能的选项,然后在做出最终决定之前停下来反思其推理过程。这个过程迫使模型检查其逻辑并识别潜在的疏忽,就像人类在提交报告前反复检查自己的工作一样。其次,他们增加了一层考虑答案之间距离的调整机制。如果模型预测五分制量表中的评分为四分,但概率质量大量集中在相邻的评分三上,系统会识别出这比概率分布在评分一上是一个更小、更易处理的错误。这种“感知距离”的校准确保了最终的置信度得分能反映出不确定性的真实本质。
为了测试该框架,研究人员将其应用于各种现实场景,包括用户与聊天机器人的对话以及基于事实的分类任务。他们使用了包含数千个示例的既定数据集,例如一组在帮助程度和正确性等维度上进行评分的对话交互,以及一个由 6.8K 个真实陈述及其对应的错误陈述组成的庞大评估数据集。他们将这种新方法与几种现有技术进行了对比,包括简单的概率检查、要求模型生成多个答案以观察其是否一致的方法,以及依赖模型内部数学信号的方法。结果显示,他们的综合方法始终优于其他方法。使用“校准反射”的模型产生的置信度得分与其实际准确率结合得更加紧密。具体而言,该系统在校准误差方面显著降低,这意味着所声明的置信水平是更为可靠的真相指标。它还提高了模型区分正确与错误答案的能力,这是衡量安全性和信任度的关键指标。
研究强调,这种改进是在无需重新训练模型或需要大规模计算资源的情况下实现的。研究人员在闭源和开源模型上都测试了该方法,通过对系统进行单次处理运行实验,这使得该技术具有即时使用的实用性。通过将结构化推理与对误差大小程度的细致理解相结合,“校准反射”方法为构建更值得信赖的人工智能提供了路径。它填补了模型此前无法区分轻微失误与重大失败的关键空白,提供了一个更诚实、更有用的确定性衡量标准。这项工作表明,通过仅仅改变我们要求模型思考自身答案的方式,我们可以使它们成为更可靠的决策伙伴。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。