An Explainable XGBoost Framework for Anxiety and Depression Risk Prediction with SHAP and Counterfactual Reasoning
本研究提出了一种用于预测焦虑与抑郁风险的可解释 XGBoost 框架,该框架在解决类别不平衡和评估严谨性的同时,通过整合 SHAP 和反事实推理,在不取代临床诊断的前提下,为模型决策提供透明且可解释的见解。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明
在现代医疗领域,人工智能已成为一种强大的工具,能够通过筛选海量的人类数据来发现那些可能被忽视的模式。当应用于心理健康时,这些系统旨在通过分析人们对有关生活、习惯和感受的问题所给出的答案,来识别焦虑或抑郁的早期迹象。然而,挑战在于这些症状非常复杂且往往十分微妙,而且用于研究的数据通常是不平衡的,即报告心理健康状况良好的人数远多于报告存在困扰的人数。此外,做出预测的计算机模型通常是一个“黑箱”:它只给出答案而不解释原因,这使得医生难以信任或负责任地使用这些信息。要使一个系统真正发挥作用,它不仅必须准确地预测风险,还必须展示其推导过程,揭示哪些因素驱动了决策,并确保其对不同群体进行公平对待。
来自尼莱大学(Nilai University)的一个研究团队开发了一个全新的框架,旨在应对这些确切的挑战。他们构建了一个复杂的计算机程序,能够利用大量的调查问卷回复和个人细节来评估焦虑和抑郁的风险。研究人员并没有仅仅致力于训练一个能尽可能提高正确率的模型,而是专注于创建一个透明、可靠且经过仔细测试的系统。他们首先使用了一个包含超过 24,000 名参与者信息的数据库,其中包括关于压力、睡眠和情绪的标准问卷答案,以及年龄、性别和受教育程度等详细信息。由于该组中患有焦虑或抑郁的人数远少于没有此类问题的人数,团队必须教会计算机对少数病例给予额外的关注,以确保它不会为了获得高总分而简单地忽略这些案例。
研究人员将数据分为三个不同的组别,以确保其结果是真实的,而非仅仅是运气好。他们用第一组数据来教导计算机,用第二组数据来微调系统的决策方式,并使用第三个完全隔离的、由 3,644 人组成的组别来测试最终结果。这种严格的分离防止了系统通过“死记硬背”测试答案来获得高分,而这是导致结果过于乐观的常见陷阱。他们还调整了系统的决策过程。他们没有采用“得分超过 50% 即判定为阳性结果”的标准规则,而是显著提高了门槛。他们发现,为了使预测变得可靠,必须使用更高的阈值,这实际上是在告诉系统在标记某人为风险人群之前必须非常确定。
当最终测试在 3,644 名参与者的隔离组上运行时,该系统的表现极其精准。对于焦虑症,它实现了 0.98 的 AUC(曲线下面积);对于抑郁症,它实现了 0.95 的 AUC。更重要的是,该系统不仅仅给出一个“是”或“否”的答案,它还为其选择提供了清晰的解释。通过一种拆解每个问题影响力的分析方法,研究人员发现与压力相关的回答是焦虑和抑郁预测中最强大的驱动因素。与睡眠相关的提问也发挥了重要作用,尤其是在预测抑郁症方面。该系统可以展示一个人的具体回答是如何将最终得分推高或降低的,从而允许临床医生看到风险评估背后的逻辑。
为了进一步测试系统的逻辑,研究人员提出了另一种类型的问题:需要发生什么变化,计算机才会改变主意?他们创建了一些假设场景,通过轻微改变一个人的回答,观察风险评分是否会下降。他们发现,仅仅改变几个关键答案(例如,降低数据中报告的压力水平或改善睡眠质量)通常足以让一个人从高风险类别转入低风险类别。这证明了该模型对特定变化是敏感的,而不仅仅是在进行随机猜测。团队还检查了系统在男女群体中的表现是否同样出色,发现虽然具体数值略有差异,但在区分高风险和低风险的能力方面,跨性别的一致性保持不变。
研究人员强调,该系统并非医生的诊断替代品。心理健康涉及深层的个人因素和背景因素,这是计算机无法完全捕捉的。相反,这个框架被设计为一个决策支持工具,旨在帮助从业者识别那些可能需要进一步关注的个体。通过将高准确度与清晰的解释以及跨群体的公平测试相结合,这项研究为在心理健康筛查中使用人工智能提供了一条更值得信赖的路径。它表明,当技术以细致和透明的方式构建时,它可以照亮通往更好护理的道路,同时不会丢失其核心的人文复杂性。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。