💬 NLP
Self-Reported Confidence of Large Language Models in Gastroenterology: Analysis of Commercial, Open-Source, and Quantized Models
该研究通过 300 道胃肠病学试题评估了多种大语言模型的自我报告置信度,发现尽管顶尖模型表现有所提升,但所有模型均存在过度自信倾向,这凸显了不确定性量化在医疗安全应用中的关键挑战。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
这篇论文就像是一次对人工智能(AI)医生的“自信心体检”。研究人员给各种大语言模型(LLM)出了一套肠胃科专家级的考试卷,然后问它们:“你觉得自己答对这道题的把握有多大?”
结果发现了一个有趣但令人担忧的现象:这些 AI 非常“自信”,但往往“自信过头”了。
下面我用几个生活中的比喻来为你拆解这项研究:
1. 考试背景:给 AI 出“专家级”难题
想象一下,你找来了几十位不同性格的“学生”(包括 GPT-4、Claude、Llama 等各种 AI 模型),让他们参加一场美国肠胃病学会的专家资格考试。
- 题目特点:这些题目很难,是专门用来考真人医生的,而且因为太专业,AI 在训练时大概率没背过答案(就像你让一个没学过中医的人去考中医执照)。
- 任务:不仅要选答案,还要给自己打分(0 到 10 分),告诉考官:“我觉得我这道题有几分把握。”
2. 核心发现:AI 的“迷之自信”
研究发现,无论 AI 答得对不对,它们都倾向于给自己打高分。
- 比喻:这就好比一个学生,做对了一道很难的题,他给自己打 9 分;做错了一道同样难的题,他依然给自己打 8 分。
- 数据说话:
- 表现最好的 AI(如 GPT-o1 preview),正确率大概是 81%,但它平均给自己打的信心分却是 9.15 分(满分 10 分)。
- 表现差的 AI,正确率只有 30%,却敢给自己打 8.5 分甚至 9 分。
- 结论:AI 就像一个过度自信的推销员,哪怕它手里拿的是次品,它也敢拍着胸脯说“这是顶级好货”。
3. 为什么这很危险?
在医疗领域,“不知道”比“乱说”更安全。
- 比喻:如果你问一个 AI 医生:“我肚子疼,是不是阑尾炎?”
- 如果 AI 说:“我不确定,建议你去检查。”(虽然它可能猜错了,但它提示了风险)。
- 如果 AI 说:“绝对是阑尾炎,99% 把握,快去做手术!”(实际上它可能搞错了,但因为它太自信,病人和医生都信了,结果可能误诊)。
- 现状:目前的 AI 就像那个过度自信的推销员,它很难区分“我真的知道”和“我只是在瞎编(幻觉)”。这种“盲目自信”在医疗这种高风险领域是非常危险的。
4. 越新的模型越聪明,但“毛病”还在
研究人员测试了从旧版到最新版的几十种模型。
- 好消息:新模型(如 GPT-4o, Claude 3.5)确实更聪明,答对题的比例更高了,它们对自己错误的“盲目自信”稍微少了一点点。
- 坏消息:即使是最聪明的模型,依然没有达到医疗安全标准。它们依然无法准确判断自己什么时候会犯错。
5. 研究者的建议:别光听 AI 自己说
既然 AI 自己说的“信心分”不可靠,我们该怎么办?
- 比喻:就像你不能只听一个学生自己说“我考得肯定好”,老师(人类专家)必须亲自阅卷,或者用更复杂的工具(比如让 AI 自己出题考自己,或者用其他模型来验证)来确认它的水平。
- 未来方向:我们需要给 AI 设计专门的“谦虚训练”,教它们学会说“我不知道”,而不是盲目自信。在目前的医疗应用中,人类医生必须始终作为最后的把关人,不能全权依赖 AI 的判断。
总结
这篇论文告诉我们:现在的 AI 医生虽然知识渊博,但它们太爱“吹牛”了。 它们很难准确评估自己有多大的把握。在真正用来治病救人之前,我们必须给这些 AI 装上“刹车”,并时刻由人类医生来监督,防止它们因为“过度自信”而误导我们。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。