Toward Better Assessment of LLMs' Performance in Clinical Error Detection
本文表明,F1 分数等标准聚合指标在临床错误检测中可能会产生误导,因为它们往往会掩盖大语言模型在两两辨别性能方面的低下表现以及语言特定偏差,因此有必要采用配对评估方法以确保临床应用的安全性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在现代医疗领域那浩如烟海、纸张堆叠的走廊中,医生笔记中一个微小的用词错误就可能产生连锁反应,将正确的诊断变成危险的失误。这些记录了从患者症状到治疗方案的一切文档,是医疗护理的支柱,却也是导致可预防性伤害的常见来源。多年来,研究人员一直希望人工智能可以充当一双不知疲倦的“第二双眼睛”,通过扫描这些笔记,在错误到达患者手中之前将其拦截。其前景十分明确:如果计算机能够识别出错误的诊断或遗漏的感染,它就能挽救生命。但要了解这些计算机是否真正具备这种能力,科学家必须首先弄清楚如何公平地测试它们。挑战在于,如何区分一个真正理解医学推理的模型,与一个仅仅是在无论阅读什么文本都只会重复给出相同答案的模型。
最近,一个研究小组专门针对这一问题展开调查,重点研究了一种在很大程度上被忽视的特定人工智能测试方法。他们检查了十五种不同的大型语言模型(即能够阅读和编写人类语言的强大计算机程序),并要求它们寻找临床笔记中的错误。研究人员使用了一种巧妙的测试方法:每一份包含错误的笔记都配有一份几乎完全相同的正确笔记,两者仅在单一句子上有差异。这种配对方式使他们能够观察模型是否能分辨这两者的区别。他们的发现是一个严峻的警告:虽然这些模型在标准测试中表现得相当不错,但在核心的辨别任务上却基本失败了。当研究人员进行深入观察时,他们发现大多数模型实际上并没有在识别错误,而是在简单地采取一种单一的猜测策略——要么将所有笔记都标记为危险,要么将所有笔记都视为安全,而并未真正理解内容。
研究始于对十五种不同模型在英文、中文和日文编写的四组医疗笔记上的测试。在典型的评估中,研究人员可能会看一个单一的分数,例如模型整体回答正确的频率。然而,研究人员意识到这种方法是有缺陷的,因为它将每份笔记视为孤立事件。相反,他们将这对笔记(一份有错,一份无错)视为一个整体真理单位。他们计算了一个新的衡量标准,本质上是在问:模型是否能在识别第一份笔记中的错误的同时,正确地判定第二份笔记为安全?如果一个模型对所有内容都猜“有错”,它会答对第一部分,但在第二部分失败;如果它对所有内容都猜“无错”,它会第一部分失败,但在第二部分答对。只有真正理解差异的模型,才能将这对笔记中的两部分都做对。
结果令人惊讶且令人担忧。在接受这种配对标准评判的十五个模型中,有十三个模型的表现甚至不如随机猜测。事实上,在区分错误笔记与正确笔记的能力上,它们的表现往往比抛硬币还要差。然而,当研究人员查看大多数人所依赖的标准分数时,这些模型看起来表现得还算不错,得分显示其取得了中等程度的成功。这种差异揭示了目前评估这些系统时的一个隐藏陷阱。标准分数被一种一致性的偏差所夸大了。有些模型由于过于渴望发现错误,几乎会将每份笔记都标记为危险;而另一些模型则过于谨慎,几乎放过了所有情况。由于测试设计未能捕捉到这种行为,模型因在某一方向上表现出持续性的错误,而非准确性,从而获得了高分。
研究人员进一步挖掘以了解模型失败的原因。他们发现,这种偏差并不一致,而是取决于语言。同一个模型在处理英文时可能过度怀疑错误,但在处理中文时却可能过于信任。这种不一致性意味着,如果不经过仔细调优,模型无法在不同语言之间可靠地工作。更具启发性的是,研究人员分析了模型在出错时所写的解释内容。研究人员要求模型解释其推理过程,指出导致其决策的具体句子。他们发现,模型通常擅长找到正确的句子。当一个模型将一份笔记标记为有误时,它经常能精准指向包含错误的那个句子。然而,在处理那份干净的笔记时,它又会犯同样的错误,指向一个类似的句子并声称该处也是错误。模型可以定位证据,但无法利用这些证据做出正确的判断。
这种“能找到证据却无法正确判断”的差距表明,这些模型只是在模仿医学推理的结构,而非真正掌握其背后的逻辑。它们可以高亮显示正确的词汇,但无法判断这些词汇是否构成错误。研究还表明,标准分数与真实的辨别能力之间的关系已经破裂。在许多情况下,那些在标准测试中排名最高的模型,实际上在区分正确与错误笔记的能力上表现最差。这意味着,如果一家医院根据目前的标准指标来选择人工智能系统,他们很可能会选到一个最容易产生系统性错误的系统。
研究人员得出结论,要让这些工具在医院中达到安全使用的水平,其测试方式必须发生改变。仅仅依赖单一的总分已不再足够。相反,评估必须包含这些配对比较,以确保模型确实能够分辨正确与错误的笔记。在此之前,尽管当前这一代人工智能在生成文本和定位信息方面展现出了惊人的能力,但要在独立执行检测医疗错误这一关键任务时获得信任,它们仍然显得过于不可靠。未来的路径不仅在于构建更大的模型,更在于构建更好的测试方法,以看穿能力的幻象,揭示这些系统的真实极限。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。