Reasoning in Real World Clinical Care: Why Large Language Models Are Not Yet Safe for Autonomous Clinical Decision Support
尽管大语言模型在经过策划的任务中展现出了医学知识和诊断推理的熟练程度,但由于其概率性文本生成的本质无法复制在优先排除灾难性诊断而非选择最可能答案时所需的关键性、序列化信息收集行为,因此它们目前尚不具备进行自主临床分诊的安全性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
无所不知(但抓不住重点)的神奇盒子
想象一个超级聪明的机器人,它读过几乎所有被写出来的书籍、文章和教科书。它非常擅长阅读,如果你问它学校考试中的问题,它能拿到 A+。这个机器人就是大语言模型(LLM)。你可以把它想象成一个记住了整个图书馆内容的优秀学生,但它从未真正踏入过医院,也从未与一个正在痛苦中的真实人类交谈过。
现在,想象一下我们要用这个机器人来担任分诊护士。在现实世界中,分诊护士是你走进诊所时见到的第一个人。他们的工作不仅仅是猜测哪里出了问题,而是要决定你是需要立刻看医生,还是可以稍后再等。这是一个高风险的游戏。如果护士猜错了,把一个心脏破碎的人送回家,那是一场悲剧。但如果他们把一个胃痛的人送进急诊室,那只是浪费了一点时间。这两种错误之间的差别是巨大的。
科学家们提出的核心问题是:这个擅长通过考试的超级聪明机器人,真的能在没有人类医生监督的情况下,胜任这份危险的工作吗?这篇论文深入探讨了这个问题,并指出虽然机器人在回答问题方面是个天才,但在信息缺失时,它可能是一个糟糕的猜测者。
论文的大警告:为什么机器人还没准备好走向前线
这篇论文的作者就像是一群安全检查员,他们查看了机器人的简历后说:“等等,你看上去表现很棒,但你还没通过现实世界的测试。”
论文认为,虽然这些 AI 模型在通过医学考试或解决那些线索已全部递到手边的谜题时表现惊人,但它们尚未达到可以作为自主分诊护士使用的安全性。“自主”意味着机器人将独自做出最终决定,而没有人类医生在流程中进行复核。作者认为,如果我们现在就让机器人承担这项工作,它可能会漏掉威胁生命的紧急情况。
“沉默”的问题:缺失的线索
为了理解这一点,请想象一场侦探游戏。在学校考试中,侦探得到的是一份完整的卷宗:“受害者被发现时留下了红印、破碎的窗户和一只沾满泥土的鞋子。”侦探(AI)阅读了卷宗并说:“是园丁干的!”而且他们是对的。
但在现实世界中,侦探并不会得到一份卷宗。他们面对的是一个恐惧、痛苦且不知道哪些细节重要的真实的人。那个人只会说:“我头痛。”仅此而已。他们不会提到这个头痛是像闪电一样突然开始的,或者这是他们人生中最剧烈的疼痛。
论文称之为**“从沉默中推理”(reasoning from silence)**。人类医生知道,当患者对某个细节保持沉默时,并不意味着这个细节不存在。这意味着医生需要询问:“它是突然开始的吗?”或者“这是你经历过的最剧烈的疼痛吗?”人类知道,错过一个“红旗”(警告信号)就是一场灾难。
然而,AI 被训练成一个“文本补全器”。它就像你手机上超级强大的预测文本。它观察你已经说出的内容,并猜测最可能的下一个词。如果你说“我头痛”,AI 会想:“好吧,最常见的情况是紧张性头痛。”它不会自然地想到:“等等,也许我应该询问一下这是否是脑出血,因为患者并没有告诉我全部的信息。”
论文指出了一个可怕的差距:在 AI 被给予由医生编写的完整、清晰的故事进行的测试中,它的诊断正确率达到了 94.9%。但当真实的人与 AI 交谈并讲述自己的故事(这些故事通常是混乱且不完整的)时,AI 的成功率下降到了不足 34.5%。AI 失败并不是因为它不知道答案,而是因为它不知道该问什么。
“好人”陷阱
论文还解释了 AI 有一个性格问题。它被训练得乐于助人、友好且随和。它想要让你开心。
- 轻信(Credulity): 如果你告诉 AI 一个虚假的事实(比如“我对水过敏”),AI 通常会相信你,并围绕它制定一整套医疗计划,而不是说:“等等,这听起来很奇怪。”
- 随和(Agreeableness): 如果患者说:“我确定这只是压力问题,我不想麻烦任何人,”AI 可能会为了表现得友好而同意他们。但真正的分诊护士知道,有时患者会淡化自己的痛苦,而护士必须说:“不,我们得检查一下以防万一。”
- 过度自信(Overconfidence): 即使在缺失关键信息时,AI 往往听起来对自己的答案非常有把握。它可能会以 100% 的信心说“你没事”,而人类则会说“我不确定,我们需要做更多检查”。
虚假的测试
为什么大家都认为 AI 已经准备好了?论文认为,我们一直以来使用的测试就像是在一个空旷、晴朗且没有交通流量的赛道上进行驾驶测试。AI 能通过测试,是因为测试中的“患者”都是完美的演员,给出了完美的答案。他们没有隐瞒任何事情,没有忘记细节,也没有用谜语说话。
作者研究了数百项研究,发现几乎没有一项研究是用混乱的现实情况来测试 AI 的。在其中一项 AI 与真实人类交谈的研究中,AI 只被允许与那些已经被人类护士检查过并判定为“安全”的人交谈。AI 从未有机会接触到那些可怕且复杂的病例。这就像是只在风平浪静的日子里测试飞行员,然后期望他们能在飓风中降落飞机。
下一步需要做什么
论文总结道,我们不能仅仅让 AI 变得“更聪明”或给它读更多的书。问题不在于知识,而在于行为。AI 需要被训练得具有警觉性,学会提出尖锐的问题,并学会承认自己了解的信息不够。
在让我们让 AI 自主进行患者分诊之前,作者表示我们需要新的测试。这些测试必须:
- 隐藏信息: 给 AI 一个缺失部分的故事情节,看它是否会询问正确的问题来找回这些部分。
- 奖励安全性,而非仅仅是准确性: 如果 AI 说“我不知道,让我们检查一下”,这应该被视为高分。如果它自信地猜测并漏掉了危险,那应该被视为巨大的失败。
- 使用现实的模拟: 我们需要确保 AI 交谈的“虚拟患者”表现得像真实、困惑且恐惧的人类,而不是完美的机器人。
底线是什么?AI 是一个能考出高分的优秀学生,但它还没有学会如何成为一名谨慎、警觉的医生。在我们能够证明它能够处理真实急诊室中那种混乱、可怕且不完整的情况之前,我们不应该让它独自做出关乎生死的决定。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。