← 最新论文
💬 NLP

Large Language Models Are Overconfident in Their Own Responses

本文揭示了聊天模板通过一种“所有权偏差”(即模型比信任相同的用户提供内容更信任其自身输出)加剧了指令微调大语言模型的过度自信,并提出了一种无需重新训练的推理策略,即通过将模型答案构造成用户输入,从而显著改善校准。

原作者: Mario Sanz-Guerrero, Manuel Mager, Katharina von der Wense

发布于 2026-06-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Mario Sanz-Guerrero, Manuel Mager, Katharina von der Wense

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是使用简单语言和日常类比对该论文进行的解释。

核心问题:过度自信的 AI

想象一下,你问一位博学多才的学生(AI)一个问题。如果学生答对了,他应该说:“我对此挺有把握的。”如果答错了,他应该说:“我不确定。”

然而,研究人员发现,现代 AI 聊天机器人在这方面表现得很糟糕。它们是过度自信的。即使在出错时,它们也表现得好像自己 100% 确定一样。这就像一个学生做错了数学题,却面不改色地坚持认为自己的答案绝对正确。这是很危险的,因为如果你信任了一个其实并不正确的、却表现得非常自信的 AI,你可能会做出错误的决策。

调查过程:为什么会发生这种情况?

研究人员想知道为什么这些 AI 聊天机器人如此过度自信。他们怀疑有两个主要元凶:

  1. 训练过程:教 AI 成为一名得力助手的过程(称为“指令微调”)。
  2. 对话风格:我们与它们交流的特定方式(即一人扮演“用户”,另一人扮演“助手”的“聊天模板”)。

研究发现:
他们发现两者都有责任,但方式不同。

  • 训练过程是主要的反派。它教会了 AI 成为一个“无所不知”的助手,这导致它失去了判断自己到底有多确定的能力。
  • 聊天风格则让情况变得更糟。研究人员发现了一个特定的怪癖:AI 对于自己生成的答案,比对于由人类(或“用户”角色)提供的完全相同的答案,表现出更高的自信度。

“所有权偏差”类比

把 AI 想象成厨房里的厨师。

  • 场景 A:厨师做了一道菜并端给你。当你问“这好吃吗?”时,厨师说:“绝对好吃!完美!”(即便食物已经烤焦了)。
  • 场景 B:你(顾客)做了完全相同的一道菜并放在桌上。你问厨师:“这好吃吗?”厨师客观地看了看,说:“嗯,这其实有点咸了。”

研究人员将此称为**“所有权偏差”(Ownership Bias)**。AI 太信任自己的“烹饪”(即它自己生成的文本)了。它假设:“如果是我写的这个答案,那我一定是对的。”这种盲目的信任让它变得过度自信。

简单的解决方法:“假装是用户说的”

这篇论文最令人兴奋的部分在于解决方案。研究人员不需要重新训练 AI,也不需要改变它的“大脑”。他们只是改变了对话中提问的方式

窍门:
与其让 AI 回答问题,然后问“我对我的答案有多确定?”,研究人员告诉 AI 要假装那个答案是由用户提供的。

  • 旧方法:AI 说“首都是巴黎。” -> AI 问自己,“我有多确定?” -> AI 说“100%!”(过度自信)。
  • 新方法:用户说“首都是巴黎。” -> AI 问,“我有多确定这个答案是正确的?” -> AI 说“70%。”(更加诚实)。

通过将答案设定为由“用户”提供,AI 卸下了它的“所有权偏差”。它不再像一个自傲的厨师,而是开始像一个客观的裁判。

实验结果

当他们在六种不同的流行 AI 模型上尝试这个简单的窍门时:

  • AI 对其自信度的表达变得显著更加诚实。
  • 它将过度自信程度降低了高达 26%
  • 它让这些“话痨型”的聊天模型变得几乎像早期的“基础(base)”模型一样可靠(基础模型天生更擅长自我判断,但在遵循指令方面较差)。

总结

论文表明,AI 聊天机器人之所以过度自信,是因为它们太为自己的答案感到自豪了。通过一个小技巧,让 AI 误以为答案是用户提供的而非它自己生成的,我们就能让它在面对已知与未知时变得更加诚实,而无需从头开始重建 AI。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →