← 最新论文
💬 NLP

Self-Reported Confidence of Large Language Models in Gastroenterology: Analysis of Commercial, Open-Source, and Quantized Models

该研究通过 300 道胃肠病学试题评估了多种大语言模型的自我报告置信度,发现尽管顶尖模型表现有所提升,但所有模型均存在过度自信倾向,这凸显了不确定性量化在医疗安全应用中的关键挑战。

原作者: Nariman Naderi, Seyed Amir Ahmad Safavi-Naini, Thomas Savage, Zahra Atf, Peter Lewis, Girish Nadkarni, Ali Soroush

发布于 2026-04-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Nariman Naderi, Seyed Amir Ahmad Safavi-Naini, Thomas Savage, Zahra Atf, Peter Lewis, Girish Nadkarni, Ali Soroush

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文就像是一次对人工智能(AI)医生的“自信心体检”。研究人员给各种大语言模型(LLM)出了一套肠胃科专家级的考试卷,然后问它们:“你觉得自己答对这道题的把握有多大?”

结果发现了一个有趣但令人担忧的现象:这些 AI 非常“自信”,但往往“自信过头”了。

下面我用几个生活中的比喻来为你拆解这项研究:

1. 考试背景:给 AI 出“专家级”难题

想象一下,你找来了几十位不同性格的“学生”(包括 GPT-4、Claude、Llama 等各种 AI 模型),让他们参加一场美国肠胃病学会的专家资格考试

  • 题目特点:这些题目很难,是专门用来考真人医生的,而且因为太专业,AI 在训练时大概率没背过答案(就像你让一个没学过中医的人去考中医执照)。
  • 任务:不仅要选答案,还要给自己打分(0 到 10 分),告诉考官:“我觉得我这道题有几分把握。”

2. 核心发现:AI 的“迷之自信”

研究发现,无论 AI 答得对不对,它们都倾向于给自己打高分

  • 比喻:这就好比一个学生,做对了一道很难的题,他给自己打 9 分;做错了一道同样难的题,他依然给自己打 8 分。
  • 数据说话
    • 表现最好的 AI(如 GPT-o1 preview),正确率大概是 81%,但它平均给自己打的信心分却是 9.15 分(满分 10 分)。
    • 表现差的 AI,正确率只有 30%,却敢给自己打 8.5 分甚至 9 分。
    • 结论:AI 就像一个过度自信的推销员,哪怕它手里拿的是次品,它也敢拍着胸脯说“这是顶级好货”。

3. 为什么这很危险?

在医疗领域,“不知道”比“乱说”更安全

  • 比喻:如果你问一个 AI 医生:“我肚子疼,是不是阑尾炎?”
    • 如果 AI 说:“我不确定,建议你去检查。”(虽然它可能猜错了,但它提示了风险)。
    • 如果 AI 说:“绝对是阑尾炎,99% 把握,快去做手术!”(实际上它可能搞错了,但因为它太自信,病人和医生都信了,结果可能误诊)。
  • 现状:目前的 AI 就像那个过度自信的推销员,它很难区分“我真的知道”和“我只是在瞎编(幻觉)”。这种“盲目自信”在医疗这种高风险领域是非常危险的。

4. 越新的模型越聪明,但“毛病”还在

研究人员测试了从旧版到最新版的几十种模型。

  • 好消息:新模型(如 GPT-4o, Claude 3.5)确实更聪明,答对题的比例更高了,它们对自己错误的“盲目自信”稍微少了一点点。
  • 坏消息:即使是最聪明的模型,依然没有达到医疗安全标准。它们依然无法准确判断自己什么时候会犯错。

5. 研究者的建议:别光听 AI 自己说

既然 AI 自己说的“信心分”不可靠,我们该怎么办?

  • 比喻:就像你不能只听一个学生自己说“我考得肯定好”,老师(人类专家)必须亲自阅卷,或者用更复杂的工具(比如让 AI 自己出题考自己,或者用其他模型来验证)来确认它的水平。
  • 未来方向:我们需要给 AI 设计专门的“谦虚训练”,教它们学会说“我不知道”,而不是盲目自信。在目前的医疗应用中,人类医生必须始终作为最后的把关人,不能全权依赖 AI 的判断。

总结

这篇论文告诉我们:现在的 AI 医生虽然知识渊博,但它们太爱“吹牛”了。 它们很难准确评估自己有多大的把握。在真正用来治病救人之前,我们必须给这些 AI 装上“刹车”,并时刻由人类医生来监督,防止它们因为“过度自信”而误导我们。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →