← 最新论文
💬 NLP

Verbal Confidence Saturation in 3-9B Open-Weight Instruction-Tuned LLMs: A Pre-Registered Psychometric Validity Screen

这项研究通过心理测量学验证发现,3-9B参数规模的开源指令微调模型在通过数值或类别形式进行口头置信度表达时,均无法有效反映其真实的预测准确性,且模型输出的置信度与内部对数概率(logprobs)并不相关。

原作者: Jon-Paul Cacioli

发布于 2026-04-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Jon-Paul Cacioli

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这是一篇关于人工智能(AI)“过度自信”现象的研究报告。为了让你轻松理解,我们可以把这些 AI 模型想象成一群正在参加**“知识问答大赛”**的小学生。

核心结论:AI 的“迷之自信”

简单来说,这项研究发现:在 3B 到 9B(即参数量较小)的 AI 模型中,它们表现出一种极其严重的“盲目自信”。 无论题目难易,无论它们答对还是答错,它们给出的信心分数几乎永远是“100分”。


用三个比喻来理解研究内容

1. “只会说‘我绝对行’的复读机” (关于饱和现象 - Saturation)

想象一下,你正在考一场数学竞赛。无论是一加一等于二,还是一个复杂的微积分难题,每当你写完答案,监考老师问你:“你有多大把握?”你每次都毫不犹豫地大喊:“100%!绝对没问题!”

这就是研究中发现的**“饱和现象”**。这些小规模的 AI 模型就像这个学生,它们失去了“怀疑”的能力。因为它们给出的信心分数全都挤在 95%-100% 这个区间,导致这个分数失去了意义——如果大家都说自己 100% 确定,那这个分数就没法用来判断谁真的懂,谁在瞎猜了。

2. “换个问法就大脑宕机” (关于格式失效 - Format Rescue)

研究人员想:既然让 AI 直接说数字(0-100)不行,那我们换个温柔点的方式,给它几个选项(比如:没把握、有点把握、非常有把握),看看它能不能表现得正常点?

结果发现,这反而把 AI “问懵了”。原本还能勉强答题的 AI,一旦换成这种分类问法,准确率竟然直接从 60% 掉到了接近 0%。这就像是你原本能正常做选择题,但老师突然要求你必须用一种极其复杂的哲学逻辑来分类你的信心,结果你直接把卷子撕了,连题目都看不懂了。

3. “越啰嗦,心里越虚” (关于推理过程 - Reasoning Contamination)

研究中还观察了一个有趣的现象:对于那些会“边思考边回答”的模型(比如 DeepSeek-R1),研究人员发现:如果 AI 写了很长很长的推理过程,它最后给出的信心分数反而越低。

这就像一个学生,如果他一眼看出答案,会很自信;但如果他写了满满一整页的草稿纸,还在那儿反复推导,最后往往会小声嘀咕:“呃……可能不对吧?”写得越多,说明它越纠结,内心越没底。


这项研究为什么重要?(现实意义)

如果你把这些 AI 当作“专家”来使用,后果可能很严重。

想象一下,你正在使用一个 AI 医疗助手。如果 AI 给出了一个错误的诊断方案,但它却用极其笃定的语气说:“我有 100% 的把握这是对的!”——这种“虚假的确定性”会误导人类做出错误的决策。

研究者的建议是:
在把这些 AI 模型投入到需要“判断对错”或“风险评估”的实际工作之前,我们必须先给它们做一个“心理测评”(即论文中提到的 Validity Screen),看看它们是真的懂,还是只是在“装腔作势”。

总结一句话:

现在的这些小型 AI 模型,虽然看起来很聪明,但它们在表达“我不确定”这件事上,表现得像个只会说“我全知道”的自大狂。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →