Implementation Variability Makes Sepsis-3 an Inconsistent Measuring Model for Early AI Prediction on Clinical Data
本文表明,Sepsis-3 定义在执行过程中的变异性(特别是关于疑似感染的部分)显著削弱了 AI 模型相对于专家验证标签的可复现性和预测性能,因此必须透明地报告测量方案,以确保临床研究中的可比性。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在重症监护室(ICU)这种高风险的环境中,时间往往是生与死之间的分水岭。脓毒症(Sepsis)是对感染的一种危险反应,可能导致器官衰竭,是全球医院死亡的主要原因之一。由于病情恶化极快,医生依赖人工智能来扫描患者记录,并在患者病情崩溃前发出警报。为了教会这些计算机系统该寻找什么,研究人员必须首先教会它们什么是真正的脓毒症。他们通过将一套公认的医学规则(称为 Sepsis-3)应用于电子健康记录中的原始数据来实现这一点。这些规则充当了一个衡量标准,将复杂的生命体征和实验室结果流转化为一个简单的标签:有脓毒症或无脓毒症。人们一直希望,如果每个人都使用相同的规则,生成的计算机模型就会是可靠且具有可比性的。然而,一项新的研究表明,这个“衡量标准”远没有此前认为的那样一致,这引发了人们对如何训练旨在拯救生命的人工智能技术的严重质疑。
海德堡大学的一位研究人员决定通过将脓毒症的定义视为一种“测量模型”而非固定事实,来调查这些规则的可靠性。他们观察了不同的研究团队在声称遵循相同的 Sepsis-3 指南时,实际上是如何将这些指南应用于患者数据的。他们发现,这些指南留下了巨大的解释空间。例如,规则要求寻找“疑似感染”,但并未明确规定什么样的抗生素组合和实验室检查才算作“疑似”。一个团队可能认为单剂抗生素就足够了,而另一个团队可能要求进行为期一周的完整治疗。同样,“器官功能障碍”的定义也会根据研究人员如何计算名为 SOFA 的特定评分(该评分用于追踪患者器官的工作情况)而有所不同。该研究人员确定了六个可以做出此类选择的领域,当他们结合所有可能的变体时,发现实现同一个定义的独特方式竟然超过了两千种。
为了观察这些选择的影响有多大,该团队利用来自三个不同医院数据库的数据进行了一项大规模实验。他们采用了完全相同的患者记录,并对每一种可能的 Sism-3 规则版本进行了应用。结果令人震惊。定义“疑似感染”的不同方式是产生分歧的最大来源,其次是研究人员如何决定脓毒症的具体开始时间。在某些情况下,规则的选择会完全改变患者的最终标签。研究人员发现,这些差异不仅仅是微小的技术细节;它们引入了一种不一致性,使得很难比较不同研究的结果。在一个医院使用一套规则训练的模型,与在另一个医院使用略微不同的规则训练的模型相比,可能会有着本质的区别,即使两者都声称使用的是同一标准。
随后,该研究采取了关键的一步,将这些计算机生成的标签与真实专家的判断进行了对比。研究人员使用了一个数据集,其中资深医生手动审查了患者记录,并标记了他们认为脓毒症开始的确切时间。当他们将各种计算机版本的 Sepsis-3 与这些人类专家进行对比时,发现计算机模型很难与医生达成一致。这种不匹配在“敏感性”方面尤为严重,这意味着计算机规则经常无法识别出医生已经清晰察觉到的脓毒症病例。这种一致性的缺失直接影响了人工智能的表现。基于计算机生成的 Sepsis-3 标签训练的模型,其表现明显逊于直接基于专家标签训练的模型。在最坏的情况下,计算机训练的模型在预测准确度上低了高达 18 个百分点,在正确识别阳性病例的能力上低了 13 个百分点。
研究人员发现,通过仔细调整计算机规则以匹配当地专家思考疾病的具体方式,可以缩小这一性能差距。通过使脓毒症发作和感染的定义与专家标签保持一致,他们能够将准确度差距缩小到仅几个百分点的水平。然而,这个解决方案也带有一个代价。最能匹配专家判断的具体规则,往往是那些识别脓毒症发生时间较晚的规则,这与早期预警系统所需的目标背道而驰。这一发现表明,不存在一个适用于所有用途的单一、完美的 Sepsis-3 定义。一个擅长预测死亡风险的规则集,在捕捉疾病早期阶段方面可能表现糟糕;而一个匹配某一家医院专家的规则集,在另一家医院可能会失效。
最终,研究结论指出,这些规则应用过程中的变异性是现代医学的一个结构性特征,而非可以轻易修复的漏洞。作者认为,该领域过度依赖于“共识定义保证测量一致性”这一观念。相反,研究表明,代码中所做的选择与数据本身同样重要。为了让医疗领域的 AI 变得值得信赖且具有可重复性,研究人员必须停止将脓毒症的定义视为一个“黑箱”。他们需要透明地说明使用了哪个版本的规则,以及这些规则如何与当地的临床现实相匹配。如果没有这种透明度,人工智能在彻底改变早期疾病检测方面的承诺,仍将笼罩在如何测量疾病本身所带来的不确定性之中。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。