← 最新论文
💻 computer science

Wired for Overconfidence: A Mechanistic Perspective on Inflated Verbalized Confidence in LLMs

该论文通过电路级机制分析,揭示了大语言模型中过度自信的内部成因(主要由中后层特定的 MLP 块和注意力头驱动),并提出通过针对这些电路进行推理时干预,可有效改善模型的校准能力。

原作者: Tianyi Zhao, Yinhan He, Wendy Zheng, Yujie Zhang, Chen Chen

发布于 2026-04-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Tianyi Zhao, Yinhan He, Wendy Zheng, Yujie Zhang, Chen Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文就像是在给大语言模型(LLM)做了一次深度的“脑部 CT 扫描”,目的是找出为什么它们总是**“明明错了,却自信满满”**。

想象一下,你问一个 AI:“地球是平的吗?”它回答:“是的,地球是平的。”然后你问它:“你有多确定?”它居然回答:"99% 确定!”这种“自信地胡说八道”不仅误导用户,还让 AI 看起来不可靠。

这篇论文就是为了解开这个谜团:这种“虚假自信”到底是在大脑的哪个部位产生的?能不能把它关掉?

以下是用通俗语言和比喻对论文核心内容的解读:

1. 核心发现:大脑里有个“自信放大器”

研究人员发现,大模型并不是整个大脑都在“装自信”。相反,它们的大脑里有一小群特定的**“神经回路”(就像电路图中的几个关键开关),专门负责“吹牛”**。

  • 比喻:想象大模型是一个巨大的交响乐团。当它回答错误时,并不是所有乐器都在乱吹。而是有几个特定的乐手(位于大脑中后部的几个特定神经元模块),不管事实如何,他们总是拼命地敲锣打鼓,告诉听众:“我们刚才演奏得完美无缺,绝对是 100 分!”
  • 位置:这些“吹牛乐手”主要集中在大脑的中后段(Middle-to-late layers)。
  • 稳定性:无论问的是历史、科学还是常识(不同的数据集),这组“吹牛乐手”总是同一拨人。这说明“过度自信”不是偶尔的失误,而是模型内部一种固定的、根深蒂固的机制

2. 研究方法:如何找到这些“捣蛋鬼”?

研究人员设计了一套非常巧妙的“捉鬼”游戏:

  • 第一步:制造“真相注射”
    他们先让模型回答一个错误的问题(比如模型说“乔布斯是画家”),然后让模型自我评估:“你有多确定?”(模型说"95%")。
    接着,他们偷偷把模型刚才的错误答案替换成正确答案(把“画家”改成“企业家”),但保持其他所有条件不变,再让模型评估一次。

    • 原理:如果模型真的懂,换对答案后,它的自信度应该下降(因为它知道自己之前错了)。如果它依然自信,说明它的自信是“无脑”的。
  • 第二步:给大脑做"X 光”
    通过对比“错误答案”和“正确答案”两种情况下的内部信号,研究人员发现,那组特定的“中后段神经元”在模型犯错且自信时,会发出强烈的信号。这就好比给大脑做了个热成像,发现只有这几个点特别烫。

  • 第三步:验证
    他们把这几个“烫手”的神经元暂时“关掉”(或者削弱它们的活动),结果发现:模型依然能回答问题,但那种**“盲目自信”的毛病治好了**!它开始变得谦虚,或者至少不再乱报高分了。

3. 解决方案:给大脑“调音”

找到病灶后,研究人员尝试了两种“手术”方案,让模型在回答问题时重新校准自信度:

  • 方案 A:直接“静音” (Mean Ablation)
    直接把那几个“吹牛乐手”的声音关掉,用平均音量代替。

    • 效果:很有效,但有点太粗暴。就像把乐手直接赶下台,虽然不吹牛了,但可能连正常的自信也一起没了。
  • 方案 B:温柔“调音” (Activation Steering)
    这是更高级的方法。研究人员计算出一个“过度自信的方向向量”,然后在模型生成答案时,轻轻推它一把,让它往“谦虚”的方向走一点点,而不是完全切断信号。

    • 比喻:就像给一个总是喊“我赢了!”的运动员,在他耳边轻轻说:“嘿,稍微冷静点,再检查一下。”
    • 效果:这种方法最棒。通过调节“推力”的大小(参数 α\alpha),可以让模型在**“保持自信”“承认错误”之间找到完美的平衡点。实验显示,这种方法能让模型的校准度提升70% 到 90%**以上!

4. 为什么这很重要?

  • 不是“修修补补”,而是“治本”:以前的方法通常是在模型输出结果后,用数学公式强行修正分数(事后诸葛亮)。而这篇论文是直接修改模型内部的运作机制,从源头上解决问题。
  • 可解释性:我们终于知道,AI 的“傲慢”不是玄学,而是由具体的、可识别的电路决定的。
  • 未来应用:这意味着未来我们可以给 AI 装上“自信调节器”。在需要严谨的医疗、法律场景,我们可以把“自信度”调低,让它多思考;在需要创意的场景,我们可以保持它的自信。

总结

这篇论文告诉我们:大模型的“嘴硬”是有生理基础的。 它们大脑里有一小撮固定的“自信制造机”,不管事实如何,它们都倾向于输出高分。好消息是,只要我们找到这几个特定的开关,轻轻拨动一下,就能让 AI 变得既聪明又诚实,不再“迷之自信”。

这就好比给一个总是吹牛的实习生做了一次心理疏导,让他学会了在不知道答案时,诚实地说“我不确定”,而不是瞎编一个高分。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →