Reconsidering the case against risk prediction in self-harm: routinely collected health data distinguishes groups at higher and lower risk of adverse outcomes following paracetamol overdose
这项研究挑战了目前英国临床指南中反对对自伤行为进行风险预测的普遍观点,其证明了常规收集的电子健康记录数据能够从统计学上区分在扑热息痛过量后面临更高或更低严重后果风险的群体,尽管这些模型目前仍缺乏临床部署到个体层面所需的精准度。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明
侦探的困境:数据能否预见风暴降临前的征兆?
想象你是一名气象预报员,正试图预测一场突如其来的危险风暴。在医学领域,特别是在人们因服用过量扑氨卡因(一种常见的止痛药)而就医时,关于我们能否预测未来的自杀行为或再次入院的“风暴”,存在着一场巨大的争论。长期以来,英国的官方规则一直是:“不要尝试去预测。”当时的观点认为,医生每天收集的数据——比如年龄、既往就诊记录和处方清单——实在是太杂乱且毫无用处,无法告诉我们谁处于风险之中。这就像是试图通过观察一张模糊的云朵照片来猜测天气;专家们认为,这张照片缺乏足够的细节,无法发挥作用。
但如果那张照片其实隐藏着某种秘密模式呢?如果我们利用超级聪明的“计算机大脑”(机器学习)同时观察成千上千张这样的模糊照片,我们是否能捕捉到肉眼无法察觉的形状?这就是科学家们一直在追问的问题。他们想知道,这些“常规收集的健康数据”——即医生随手记录的那些枯燥、日常的记录——是否真的蕴含着一个隐藏的信号,能够将那些会有不良后果的人与那些不会的人区分开来。如果答案是“是”,这并不意味着我们拥有了水晶球,但它可能意味着我们不该过早地把地图丢弃。如果答案是“否”,那么我们就确定需要去别处寻找帮助。
伟大的扑氨卡因之谜:在噪声中寻找信号
在这项研究中,一组研究人员决定对“数据无用论”进行测试。他们并没有试图构建一个阻止自杀的神奇工具;相反,他们扮演的是寻找单一线索的侦探。他们在 2017 年至 2023 年间,收集了来自 NHS Lothian(苏格兰)急诊科的 4,095 名成年人的医疗记录,这些患者均因扑氨卡因过量就医。
可以将这些记录想象成一个巨大的拼图盒。盒子里有 37 种不同的信息碎片,这些都是医生在患者走进医院那一刻就已经掌握的信息:他们的年龄、居住地(这可以反映出该地区的贫困程度)、他们正在服用的药物,以及他们此前是否看过精神科专家。研究人员将这些拼图碎片输入到一个名为“弹性网络逻辑回归”(elastic-net logistic regression)的智能计算机模型中。你可以把这个模型想象成一位非常严厉的图书管理员,正试图将一大堆书分类成两叠:“关于会有不良后果的人的书”和“关于不会有不良后果的人的书”。
研究人员观察了患者离开医院后的三个不同时间段:
- 第一周(0–7 天): 他们是否死亡或被送入精神科病房?
- 接下来的一个月(8–30 天): 麻烦是否持续存在?
- 整整一年(31–365 天): 风暴最终是否爆发?
重大发现
结果令人惊讶。计算机模型确实找到了模式。虽然它并不完美,但绝对比掷硬币猜正反要好。
- 在第一周,模型的正确排序率约为 65% 到 82%(取决于衡量标准)。
- 在 8 到 30 天的窗口期内,准确率在 63% 到 90% 之间。
- 在一整年的观察期内,准确率在 71% 到 85% 之间。
在统计学领域,50% 的得分仅仅是瞎猜。任何高于 50% 的得分都意味着模型确实捕捉到了真实存在的某种东西。研究人员发现,该模型擅长识别高风险人群,并且非常擅长确保它给出的数值与现实生活中的结果相匹配(这被称为“校准度”)。
线索来自哪里?
你可能会认为该模型只是在观察年龄或性别,就像一个典型的侦探那样。但研究人员发现,这并不是主角。模型的真正“超能力”来自于与精神健康相关的线索。模型最精准的判断源于以下因素:
- 患者是否被开具了抗精神病药物或抗焦虑药物;
- 他们是否有看精神科医生的病史;
- 是否患有精神分裂症或酒精性肝病;
- 他们同时服用多少种不同类型的药物(多重用药)。
年龄虽然也被模型使用,但它并不是主要的驱动力。真正的信号隐藏在一个人复杂的精神健康历程之中。
这篇论文说了什么(以及没说什么)
理解这项研究并非在表达什么非常重要。作者并不是在声称我们现在可以精确预测哪一个具体的个体会在下次尝试自杀。他们也不是在说我们应该从明天开始就在医院里使用这个计算机模型来决定谁该接受治疗。
事实上,他们明确警告不要这样做。该模型的准确性虽然优于随机猜测,但还不足以作为针对单个人的最终判决依据。如果你将这个工具用于某一个特定的人,它仍有可能出错。论文指出,目前英国的规则(即“完全不使用风险预测工具”)可能有些“把婴儿连同洗澡水一起倒掉”了。该规则是基于“数据中不存在任何有用信号”的假设。而这项研究表明,确实存在有用的信号,只是这个信号目前还不够强大,无法作为一个独立的“水晶球”来使用。
研究人员还指出,他们使用的这种“枯燥”的结构化数据(那 37 个勾选框)存在一个天花板。这就像试图通过只阅读一部电影的演职员表和片长来理解整部电影一样;你会错过剧情、情感和对话。关于一个人风险的真正、深层的线索——例如他们具体的想法、绝望感或支持系统——通常写在医生笔记的**自由文本(非结构化文本)**中,而不是这些勾选框里。论文建议,如果我们教计算机去阅读这些笔记(使用一种称为“自然语言处理”的技术),我们可能会发现一个更强大的信号。
总结
那么,结论是什么?论文得出结论:认为“常规收集的健康数据不包含任何有用的预测信号”这一观点是错误的。数据中确实存在信号;它可以区分高风险群体和低风险群体。然而,目前的信号还太微弱,尚不足以用于对单个个体做出生死攸关的决策。
作者本质上是在说:“不要仅仅因为当前的章节还不完美,就直接合上研究这本书。”他们敦促科学家们继续探索,或许可以通过教计算机去阅读那些混乱、充满人性色彩的医疗笔记,而不是放弃“数据可以帮助拯救生命”这一理念。通往更好预测的大门依然敞开着,我们只是需要更好的工具走进去。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。