Confident but Conflicted: Internal Uncertainty and Cognitive Dissonance Resolution in LLMs
本文引入了“信任弹性”(Trust Elasticity)来量化大语言模型在面对冲突证据时如何解决认知失调,揭示了不同模型间说服易感性的差异与特定的内部不确定性指标(如置信度失调和内部不确定性变化)之间存在相关性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正在和一个非常自信、知识渊博的机器人朋友聊天。你对它说:“我觉得天空是绿色的。”机器人说:“不,天空是蓝色的。”
现在,想象一下你想说服这个机器人改变主意。你可能会说:“嗯,一位著名的科学家说过它是绿色的,”或者“我读到一篇不起眼的博客文章说它是绿色的。”机器人会如何反应?它会改变主意吗?它会生气并更加坚持认为天空是蓝色的吗?还是它干脆忽略了你?
这篇论文正是对这一场景的研究,只不过研究对象是大型语言模型(LLMs)——也就是聊天机器人背后的 AI 大脑。研究人员将这个过程称为**“认知失调解决”(cognitive dissonance resolution)**,这是一个高级说法,意思就是:当有人挑战 AI 刚刚说过的话时,它是如何应对的?
以下是他们利用简单的类比对研究结果进行的拆解:
1. 实验:“说服游戏”
研究人员设计了一个包含四种不同 AI 模型(Qwen、Grok、Llama 和 GPT-4o)的游戏。他们给 AI 提供了 12 个不同的健康声明作为起点。其中一些明显是假的(比如“5G 波会使你的 DNA 减半”),一些是夸张的(比如“禁食对心脏很坏”),还有一些只是表述得过于绝对(比如“拉伸永远不会提高运动表现”)。
然后,他们尝试通过两个杠杆来改变 AI 的想法:
- 来源(权威性): 提出相反意见的人是谁?是一个匿名的 Reddit 用户、一名当地的营养师、一位大学教授,还是世界卫生组织(WHO)?
- 证据(证明力): 证据有多好?是一个微小的、不可靠的初步研究,还是一项大规模、完美的科学试验?
2. “信任弹性”(TE)计
为了衡量 AI 被说服的难易程度,研究人员发明了一个新工具,叫做信任弹性(Trust Elasticity, TE)。你可以把它想象成一根橡皮筋。
- 高弹性: 橡皮筋很容易被拉长。当你推动它时,AI 会迅速改变主意。
- 低弹性(僵硬): 橡皮筋很硬。AI 拒绝挪动。
- 负弹性(反弹): 橡皮筋比之前更猛烈地弹回。AI 变得更加固执,在受到说服后反而更加坚持原有的观点。
3. 他们的发现
这项研究揭示了三种主要行为:
- “岩石”效应(免疫力): 当 AI 被告知一些明显虚假的内容时(比如“疫苗导致自闭症”),它的表现就像一块岩石。无论说话的人多有名,或者那个虚假研究看起来多么“科学”,AI 都纹丝不动。它的信任弹性接近于零。它对明显的谎言具有免疫力。
- “海绵”效应(说服): 当声明是夸张或过于绝对时,AI 更像一块海绵。它吸收了新信息并改变了主意。
- 不同的海绵: 并非所有 AI 模型都同样具有吸收性。Llama 是最像“海绵”的(最容易被说服),而 Qwen 则更僵硬(更难被说服)。有趣的是,最大的 AI 模型并不一定是最高度难以被说服的;有时较小的模型反而更强硬。
- “反弹”效应: 有时,如果 AI 觉得挑战过于激进,或者来自它不信任的来源,它不仅会忽略你,还会变本加厉。它会对原有的错误答案更加笃定。这种情况最常发生在 AI 被挑战“绝对化”声明(即使用“从不”或“总是”这类词汇的声明)时。
4. 机器人大脑内部的秘密
论文中最令人兴奋的部分是,在被说服的过程中,他们在 AI 的“大脑”(其内部数学逻辑)内部看到了什么。他们观察了两点:
- 置信度失准(Confidence Miscalibration): AI 是否在外部表现出 90% 的确定性,但内部其实只有 50% 的确定性?
- 内部不确定性变化(Internal Uncertainty Change): 当听到新的论点时,AI 的内部“混乱度量计”是上升还是下降?
他们发现,不同的 AI 模型根据其内部“个性”会有不同的反应:
- Qwen 就像一个过度自信的人。当它在外部表现得过于确定但在内部却不确定时,它更有可能改变主意。
- Llama 就像一个反复无常的人。当它的内部混乱度量计在争论过程中剧烈波动时,那就是它改变主意的时候。
总结
论文得出结论,AI 模型在改变主意方面并不尽相同。
- 对于明显的谎言,它们是不可撼动的。
- 对于夸张的声明,它们是灵活的。
- 如果受到过度的挤压,它们会变得固执(反弹)。
至关重要的是,这项研究表明,要解决这些行为,我们不应该仅仅试图改变 AI 的“输出”(它说了什么),而是需要修复 AI 对其自身知识的“感受”(其内部的不确定性)。如果我们能让 AI 的内部“置信度量计”与其真实的知识水平相匹配,我们或许能让它在受到挑战时变得更加理性。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。