Large Language Models Are Overconfident in Their Own Responses
本文揭示了聊天模板通过一种“所有权偏差”(即模型比信任相同的用户提供内容更信任其自身输出)加剧了指令微调大语言模型的过度自信,并提出了一种无需重新训练的推理策略,即通过将模型答案构造成用户输入,从而显著改善校准。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是使用简单语言和日常类比对该论文进行的解释。
核心问题:过度自信的 AI
想象一下,你问一位博学多才的学生(AI)一个问题。如果学生答对了,他应该说:“我对此挺有把握的。”如果答错了,他应该说:“我不确定。”
然而,研究人员发现,现代 AI 聊天机器人在这方面表现得很糟糕。它们是过度自信的。即使在出错时,它们也表现得好像自己 100% 确定一样。这就像一个学生做错了数学题,却面不改色地坚持认为自己的答案绝对正确。这是很危险的,因为如果你信任了一个其实并不正确的、却表现得非常自信的 AI,你可能会做出错误的决策。
调查过程:为什么会发生这种情况?
研究人员想知道为什么这些 AI 聊天机器人如此过度自信。他们怀疑有两个主要元凶:
- 训练过程:教 AI 成为一名得力助手的过程(称为“指令微调”)。
- 对话风格:我们与它们交流的特定方式(即一人扮演“用户”,另一人扮演“助手”的“聊天模板”)。
研究发现:
他们发现两者都有责任,但方式不同。
- 训练过程是主要的反派。它教会了 AI 成为一个“无所不知”的助手,这导致它失去了判断自己到底有多确定的能力。
- 聊天风格则让情况变得更糟。研究人员发现了一个特定的怪癖:AI 对于自己生成的答案,比对于由人类(或“用户”角色)提供的完全相同的答案,表现出更高的自信度。
“所有权偏差”类比
把 AI 想象成厨房里的厨师。
- 场景 A:厨师做了一道菜并端给你。当你问“这好吃吗?”时,厨师说:“绝对好吃!完美!”(即便食物已经烤焦了)。
- 场景 B:你(顾客)做了完全相同的一道菜并放在桌上。你问厨师:“这好吃吗?”厨师客观地看了看,说:“嗯,这其实有点咸了。”
研究人员将此称为**“所有权偏差”(Ownership Bias)**。AI 太信任自己的“烹饪”(即它自己生成的文本)了。它假设:“如果是我写的这个答案,那我一定是对的。”这种盲目的信任让它变得过度自信。
简单的解决方法:“假装是用户说的”
这篇论文最令人兴奋的部分在于解决方案。研究人员不需要重新训练 AI,也不需要改变它的“大脑”。他们只是改变了对话中提问的方式。
窍门:
与其让 AI 回答问题,然后问“我对我的答案有多确定?”,研究人员告诉 AI 要假装那个答案是由用户提供的。
- 旧方法:AI 说“首都是巴黎。” -> AI 问自己,“我有多确定?” -> AI 说“100%!”(过度自信)。
- 新方法:用户说“首都是巴黎。” -> AI 问,“我有多确定这个答案是正确的?” -> AI 说“70%。”(更加诚实)。
通过将答案设定为由“用户”提供,AI 卸下了它的“所有权偏差”。它不再像一个自傲的厨师,而是开始像一个客观的裁判。
实验结果
当他们在六种不同的流行 AI 模型上尝试这个简单的窍门时:
- AI 对其自信度的表达变得显著更加诚实。
- 它将过度自信程度降低了高达 26%。
- 它让这些“话痨型”的聊天模型变得几乎像早期的“基础(base)”模型一样可靠(基础模型天生更擅长自我判断,但在遵循指令方面较差)。
总结
论文表明,AI 聊天机器人之所以过度自信,是因为它们太为自己的答案感到自豪了。通过一个小技巧,让 AI 误以为答案是用户提供的而非它自己生成的,我们就能让它在面对已知与未知时变得更加诚实,而无需从头开始重建 AI。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。