Machine Learning Models for Predicting Active Bleeding in Patients Presenting to the Emergency Department with Upper Gastrointestinal Bleeding: A Retrospective Cross-Sectional Study
这项回顾性研究表明,利用常规入院数据训练的机器学习模型,特别是随机森林模型,对于内镜证实的活动性上消化道出血可以实现极高的阴性预测值(≥95%),为提高特异性并减少急诊科患者不必要的内镜检查提供了一种潜在工具。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
请将急诊科(ED)想象成一个繁忙的机场航站楼。到达的患者就像是可能正经历着体内“风暴”(活动性出血)或仅仅是“毛毛雨”(无活动性出血)的旅客。
目前,这个机场配备了一台标准的安检扫描仪——格拉斯哥-布拉奇洛夫评分(GBS)。这台扫描仪非常擅长捕捉每一个可能有风暴的人,但它有点过于敏感了。它经常会将那些其实平安无事的人也标记出来,并让他们接受一次完整、昂贵且具有侵入性的全身扫描(内窥镜检查),即便他们并不需要。这堵塞了航站楼,也浪费了资源。
研究人员在论文中提出了这样一个问题:“我们能否构建一个更智能的、由人工智能驱动的扫描仪,利用我们现有的基本信息(如血压和血液检查),来精准识别出那些确定没有风暴的人,从而让我们跳过那些不必要的全身扫描?”
以下是他们如何构建这个更智能的扫描仪的简易说明:
1. 训练营(数据)
团队回顾了 2015 年至 2022 年间来到他们医院的 1,000 多名患者的记录。他们收集了患者入院时所有可用的信息:
- 生命体征: 心率、血压。
- 实验室检查结果: 血细胞计数、肾功能等。
- 体格检查: 患者是否晕厥?大便中是否有血?
- “真相”: 他们查看了内窥镜报告,以确认谁确实存在活动性出血(“风暴”),谁则没有。
他们将这些患者分为两组:
- 学生组(训练集): 666 名患者用于教计算机识别什么是活动性出血。
- 考试组(测试集): 343 名患者用于观察计算机在面对全新的、未见过的数据时是否真的能通过测试。
2. 五个 AI 候选人
研究人员训练了五种不同类型的“数字侦探”(机器学习模型)来破解这个谜题。你可以把它们想象成不同的侦探风格:
- 高斯朴素贝叶斯 (Gaussian Naive Bayes): 一个基于简单概率进行快速推测的侦探。
- K-最近邻 (KNN): 一个观察患者“邻居”(相似的既往患者)并假设他们也一样的侦达。
- 支持向量机 (SVM): 一个在沙地上画出极其精确的分界线,以此区分“出血者”和“非出血者”的侦探。
- 随机森林 (Random Forest): 一个询问整个侦探委员会的意见并进行投票的侦探。
- 逻辑回归 (Logistic Regression): 一个根据每个线索的重要性来计算加权得分的侦探。
3. 结果:谁通过了测试?
当这些侦探对 343 名患者进行测试时,情况如下:
“安全网”获胜者: 随机森林、逻辑回归和 SVM 这几位侦探在识别“安全”患者方面表现出色。
- 类比: 想象一个能捕捉到 97% 实际安全人员的安全网。如果随机森林模型说:“这位患者是安全的”,那么你有 97% 的把握确定他没有活动性出血。
- 为什么这很重要: 在测试组中,大约每 100 名患者中只有 9 人真正有活动性出血。这些模型成功识别了绝大多数的 91 名安全患者,这意味着它们可以帮助医生决定是否可以不对这些人进行内窥镜检查。
“过度自信”的失败者: KNN 侦探的表现很奇怪。它在说“不”(即判定为无风险)方面极其准确(准确率达 99%),但它几乎漏掉了所有的实际出血病例(仅抓住了 100 人中的 3 人)。
- 类比: 这个侦探因为太害怕错过风暴,以至于拒绝观察任何人。它在技术上是“准确”的,因为大多数人都是安全的,但它完全没用,因为它无法发现那些危险的情况。
“遗漏”的情况: 即便是最好的模型(如随机森林)也会漏掉一些活动性出血者(它们的灵敏度为 80%,意味着漏掉了 20% 的实际风暴)。这就是为什么论文指出这些工具是用来补充(而非替代)现有评分的。
4. 核心结论
论文得出结论,这些 AI 模型(特别是随机森林、逻辑回归和 SVM)充当了一个高度可靠的“一切正常”信号。
如果 AI 说一名患者风险较低,那么该患者确实没有活动性出血的可能性非常高(概率超过 95%)。这可以帮助医生更有信心地决定延迟或跳过针对这些特定患者的内窥镜检查,从而节省时间和资源。
然而,论文非常谨慎地指出:
- 这是一项“回顾性”研究(基于旧记录),而不是目前正在医院进行的实时测试。
- 研究仅在一家医院进行。
- AI 目前还无法取代医生的判断。在能够用于做出现实生活中的决策之前,它还需要在许多不同的医院进行测试(前瞻性验证)。
简而言之: 研究人员构建了一个非常擅长说“你可能很安全”的数字工具,这有助于减少不必要的全身扫描,但它还需要更多的练习,才能被信任去独立运行整个“机场”。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。