Explainable machine learning to predict depression across phenotype definitions integrating genetic and environmental factors
本研究利用英国生物样本库(UK Biobank)数据上的可解释机器学习技术,旨在证明抑郁症预测模型以及遗传与环境因素的相对重要性会随所使用的特定表型定义而显著变化,其中复合终身定义定义得出的结果最为稳定,并突显了当前症状与终身病史之间截然不同的驱动因素。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明
抑郁症是全球范围内导致残疾的主要原因之一,影响着数百万人,然而预测谁会患上抑郁症仍然是现代医学中最困难的挑战之一。这种困难在于该疾病本身的性质。抑郁症并非单一、统一的存在;它是一幅由许多不同线条编织而成的复杂织锦。有些人经历的是一段短暂的忧郁期,而另一些人则要忍受长期的严重症状。此外,其成因是生物学与生活经历交织在一起的复杂混合体。科学家知道基因发挥着作用,但也知道睡眠、经济压力和社会孤立是强大的力量。由于抑郁症的定义取决于提问者是谁以及他们提出了什么问题,因此构建一个可靠的计算机模型来预测它,就像是在尝试击中一个移动的目标。研究人员长期以来一直想知道,他们在数据中对疾病的定义方式是否会改变预测结果,以及隐藏在我们DNA中的遗传线索是否仅对某些类型的抑郁症有用,还是对整个病症都有用。
爱丁堡大学的一个研究小组试图通过测试在给定不同疾病定义的情况下,机器学习模型的预测效果如何,来解决这个谜题。他们利用了英国生物样本库(UK Biobank),这是一个包含超过50万名志愿者健康信息的庞大数据库,用以检查近15.3万人的情况。该团队并没有仅仅依赖一种识别抑郁症的方法,而是创建了四个不同的组别。一组代表目前感到抑郁的人,通过关于过去两周症状的标准问卷进行识别。另外三组代表终身抑郁,其定义具有不同程度的严格性:一组是基于核心症状的广泛筛查,一组是自我报告的寻求专业帮助的历史,还有一组是结合了所有这些因素的严格组合,以确保高置信度的诊断。对于这些组别中的每一个人,研究人员收集了广泛的数据,包括他们的年龄、性别、睡眠习惯、经济状况,以及多基因风险评分——这是一个总结了一个人在数千个微小DNA变异基础上患抑型抑郁症遗传可能性的单一数值。
研究人员训练了五种不同类型的计算机算法,从这些数据中学习并预测谁会被归类为患有抑郁症。他们发现,最先进的算法(被称为提升模型)表现最好,但真正的故事在于抑郁症的定义如何改变了结果。当模型观察终身抑郁时,它们表现得非常一致。无论定义是宽泛还是严格,计算机识别出的最重要的五个因素都是相同的:女性、年龄、失眠、自评健康状况以及遗传风险评分。这些模型显示,遗传信息为终身抑郁的预测准确性提供了小幅但有意义的提升。然而,当研究人员将目标转向预测过去两周内的当前症状时,情况发生了彻底的变化。针对当前症状的模型对遗传和性别的依赖程度大大降低,转而赋予了可改变的生活因素更高的权重,例如一个人向他人倾诉的频率以及是否面临经济困难。
这种转变揭示了一个关键洞察:我们如何定义抑郁症,决定了计算机从中学习到什么。针对终身抑郁训练的模型具有高度的可迁移性,这意味着无论定义是宽泛还是严格,它们学习到的规则都是相同的。相比之下,针对当前症状的模型学习到了一套不同的规则,侧重于即时的生活环境而非长期的脆弱性。研究人员还调查了基因与环境是否相互作用,寻找是否存在一个人的遗传风险可能被其生活境遇放大的情况。他们发现了强有力的证据,表明抑郁症的遗传风险在遭受失眠困扰的人群中更为显著,这表明睡眠障碍可能是一种触发器,使得遗传易感性变得更加强烈。他们还发现了类似的相互作用,涉及年龄和整体健康状况。
这项研究得出结论,不存在一种单一的“最佳”预测抑郁症的方法,因为这种疾病本身并不是单一的事物。一个旨在识别一个人终身患病风险的模型,看起来会与一个旨在发现某人正处于当前发作期的模型截然不同。研究结果表明,虽然遗传数据对于理解长期风险很有用,但对于预测由当前生活压力和社会联系驱动的即时症状则帮助较小。通过展示疾病的定义如何塑造预测,这项研究强调了科学家和医生在试图预测什么时必须保持精确。如果目标是预防,模型应侧重于终身风险因素。如果目标是即时干预,焦点必须转向当前的社会和环境条件。这项工作并未提供治愈抑郁症的灵丹妙药,但它提供了一张更清晰的地形图,表明要理解精神健康的未来,我们必须首先对我们正在观察的对象达成共识。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。