← 最新论文
🤖 AI

Confidence Calibration in Large Language Models

本文介绍了一项预注册研究,该研究表明大型语言模型总体上表现出过度自信倾向,这种倾向受到难易效应调节,即过度自信在困难任务上达到峰值,而在简单任务上则出现自信不足,从而促成了用于评估不同难度水平下校准能力的 LifeEval 基准测试的开发。

原作者: Noam Michael, Daniel BenShushan, Jacob Bien, Don A. Moore

发布于 2026-05-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Noam Michael, Daniel BenShushan, Jacob Bien, Don A. Moore

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是论文《大语言模型中的置信度校准》的解释,已用通俗易懂的语言并辅以生动的类比进行翻译。

核心问题:过度自信的学生

想象一个学生参加一系列测验。有时,这个学生答对了问题,并说:“我 100% 确定!”(这是好的)。但很多时候,他们答错了问题,却仍然说:“我 100% 确定!”(这是坏的)。

这篇论文调查了大型语言模型(LLM)——即 AI 聊天机器人背后的“大脑”——是否像那个过度自信的学生一样行事。研究人员发现,平均而言,AI 模型过于确信自己是正确的。它们声称自己正确的频率高于实际正确的频率。这很危险,因为如果你信任一个自信满满却答错的模型,你可能会做出错误的决定。

“难易反转”的转折

论文中最有趣的发现是一种被称为**“难易效应”**的现象。把它想象成一个关于自信的跷跷板:

  • 在简单任务上: 当问题很简单时(比如"2+2 等于几?”),模型实际上缺乏自信。它们答对了答案,却说:“我只有 60% 的把握”,尽管它们本应有 100% 的把握。它们表现得过于谦虚。
  • 在困难任务上: 当问题变得非常困难时(比如复杂的逻辑谜题),模型则走向了另一个极端。它们答错了答案,却说:“我有 95% 的把握!”这就是过度自信

论文表明,随着任务变难,模型的自信程度并没有下降到足以匹配其准确率下降的水平。即使它们在挣扎,它们仍然大喊“我知道这个!”

新测试:"LifeEval"

为了研究这个问题,研究人员发明了一个名为LifeEval的新测试。

类比: 想象你正在尝试猜测一个人的寿命有多长。

  • 简单版本: 你被告知:“这个人已经 80 岁了。”你猜测他们会活到 85 岁。他们至少再活 5 年的可能性非常大。模型在这里感到自信。
  • 困难版本: 你被告知:“这个人 25 岁。”你猜测他们会活到 80 岁。但你必须在仅仅 1 岁的误差范围内精确猜测他们的终年。这极其困难。

研究人员使用了真实的政府数据(社会保障寿命表)来了解一个人活到特定年龄的真实概率。然后,他们让 AI 猜测年龄,并说明它有多大的把握。

结果: AI 的表现完全符合上述“难易效应”模式。

  • 当猜测很简单时(预测 80 岁老人的长寿),AI缺乏自信
  • 当猜测很难时(预测 25 岁年轻人的具体终年),AI过度自信

“推理”模型与“聊天”模型

论文测试了两种类型的 AI 模型:

  1. “聊天”模型: 这些是标准的、快速响应的模型。
  2. “推理”模型: 这些是较新的模型,设计为在回答前“思考”步骤(就像一个学生花时间解决数学问题)。

发现: “推理”模型在这方面表现好得多。它们不仅仅是猜测;它们实际上根据任务的难易程度更准确地调整了自己的置信度。与标准的“聊天”模型相比,它们在困难问题上不太可能表现出极度的过度自信。

为什么它们会四舍五入数字?

研究人员注意到模型报告其置信度的方式有一个有趣的现象。

  • 人类经常将置信度四舍五入到像"80%"或"90%"这样整齐的数字。
  • AI也做了同样的事情!标准的“聊天”模型几乎 100% 的时间都将置信度四舍五入到最接近的 5%。

这表明 AI 正在模仿人类的行为,包括我们避免精确表达不确定性的习惯。就像一个学生说“我相当确定”而不是给出一个具体的数字,因为表现得精确感觉有风险。

“污染”检查

研究人员担心,AI 可能只是记住了他们新"LifeEval"测试的答案,因为数据(寿命表)是公开的,很可能包含在 AI 的训练数据中。

他们对 AI 的答案进行了“测谎”测试。他们发现,一些高级模型(如 DeepSeek-R1 和 Gemini 2.5 Pro)似乎记住了数据,显示出“强有力的作弊证据”。然而,即使他们移除了那些似乎记住了答案的模型,过度自信的问题依然存在。这些模型在困难任务上仍然过于自信。

总结

  • 主要问题: AI 模型通常对自己的答案过于自信,尤其是在任务困难时。
  • 模式: 它们在简单任务上过于谦虚,在困难任务上过于傲慢。
  • 解决方案(部分): “推理”模型(那些在说话前先思考的模型)在校准置信度方面比标准聊天模型做得更好。
  • 启示: 我们不能仅仅因为 AI 听起来很确定就盲目信任它。如果任务很困难,AI 可能会自信地犯错,我们需要保持警惕。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →