Self-Anchoring Calibration Drift in Large Language Models: How Multi-Turn Conversations Reshape Model Confidence
该研究提出了“自锚定校准漂移”(SACD)现象,指出大语言模型在多轮对话中基于自身先前输出进行迭代时,其表达置信度与校准误差会呈现出因模型而异的复杂系统性变化,部分表现为置信度降低或校准改善被抑制。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
这篇论文探讨了一个非常有趣且重要的现象:大型语言模型(LLM)在“多轮对话”中,是如何逐渐“迷失”对自己回答准确性的判断的。
作者把这种现象称为**“自我锚定校准漂移”(Self-Anchoring Calibration Drift, SACD)**。
为了让你轻松理解,我们可以把 AI 想象成一个**“正在写日记的聪明学生”,把多轮对话想象成“连续的追问”**。
1. 核心概念:什么是“自我锚定”?
想象一下,你问这个学生:“今天天气怎么样?”
- 第一轮:学生回答:“可能是晴天,我有 80% 的把握。”(这是初始状态)
- 第二轮:你问:“能详细说说为什么吗?”
- 第三轮:你问:“再补充点细节?”
在这个过程中,学生不再参考外面的天气预报(真实世界),而是盯着自己刚才写下的日记(之前的回答)。
- 如果学生刚才写得很自信,他可能会觉得:“既然我刚才那么肯定,那我肯定是对的!”(过度自信)
- 如果学生刚才写得很犹豫,他可能会想:“我刚才都说不准了,那我可能真的搞错了,我得再谦虚点。”(过度谦虚)
“自我锚定”就是:AI 把自己的上一句话当成了新的真理,并以此为基础调整下一句话的自信程度,而不是基于事实。
2. 实验:三个学生,三种不同的“迷失”
作者找了三个顶尖的 AI 模型(Claude 4.6, GPT-5.2, Gemini 3.1 Pro),让它们回答 150 个问题,并进行了三种测试:
- 单轮测试:问一次,答一次(基准线)。
- 多轮追问:问一次,然后连续追问 4 次,让它基于自己的回答继续 elaborating(自我锚定组)。
- 独立重复:把同一个问题问 5 次,但每次都是全新的对话,互不干扰(对照组)。
结果发现,这三个“学生”在面对连续追问时,表现出了三种截然不同的性格:
🧐 学生 A (Claude 4.6):越聊越心虚
- 现象:在聊开放式问题(比如“你怎么看这个哲学问题?”)时,随着对话轮数增加,它的自信度反而下降了。
- 比喻:就像一个人刚开始很有把握地讲个故事,聊着聊着,因为一直在重复自己的话,突然开始自我怀疑:“哎呀,我是不是刚才说错了?我是不是太武断了?”
- 结果:它变得过度谦虚,即使它原本可能是对的,也不敢肯定了。
🚀 学生 B (GPT-5.2):越聊越上头
- 现象:在聊开放式问题时,随着对话进行,它的自信度反而上升了。
- 比喻:就像一个人讲笑话,讲得越久越觉得自己是喜剧天才。它把“重复”当成了“正确”的证据。哪怕它一开始只是猜的,聊到第 5 轮时,它已经坚信自己 100% 正确了。
- 结果:它变得过度自信,甚至开始胡说八道还觉得自己很对。
🛑 学生 C (Gemini 3.1 Pro):原地踏步的“刹车”
- 现象:它的自信度没怎么变,但它犯了一个更隐蔽的错误——它失去了“自我纠错”的能力。
- 比喻:
- 在独立重复测试中(对照组):如果你把同一个问题问它 5 次,它第一次可能答得烂(校准误差大),但第二次、第三次它就能迅速调整,越答越准。这就像人通过练习能进步。
- 在多轮追问中(实验组):一旦它开始基于自己的回答继续聊,这种“越练越准”的进步就被卡住了。它的错误率一直停留在高水平,不再下降。
- 结果:它没有变得更自信或更谦虚,但它失去了自然变聪明的机会。
3. 关键发现:什么情况下最容易“翻车”?
- 事实性问题(如“中国的首都是哪里?”):无论怎么聊,AI 都很稳,几乎不会漂移。因为答案就在那里,像铁板钉钉。
- 开放式问题(如“未来 20 年人类会怎样?”):这是重灾区。因为没有标准答案,AI 只能依赖自己的“感觉”和“之前的话”。在这里,上述的三种“迷失”现象最明显。
4. 这对我们意味着什么?
这篇论文告诉我们,AI 在长对话中并不是越聊越稳,反而可能越来越“飘”。
- 对于用户:如果你和 AI 聊了很久,特别是讨论一些没有标准答案的话题(比如写小说、做决策、分析局势),你要小心!AI 最后给出的“非常确定”的结论,可能只是因为它在对话中自我强化了,而不是因为它真的掌握了真理。
- 对于开发者:不能只测试 AI 回答单个问题的能力。必须测试它在连续对话中的表现。可能需要设计一种机制,每隔几轮就“重置”一下 AI 的记忆,或者提醒它:“嘿,别光盯着自己刚才说的话,再看看事实吧。”
总结
这就好比照镜子:
- 如果镜子里的影像(AI 之前的回答)是歪的,而 AI 又一直盯着这个歪影像看,它最终会觉得自己就是歪的。
- 有的 AI 会觉得自己太歪了(变谦虚),有的会觉得自己其实挺正的(变狂妄),有的则忘了怎么把镜子擦干净(失去纠错能力)。
这篇论文提醒我们:在 AI 的长对话中,保持清醒的头脑(校准)比保持自信更重要。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。