← 最新论文
💻 computer science

An Interpretable AI Framework for Multiclass Classification of Thalassemia Using Combined CBC and HPLC Biomarkers

本文提出了一种可解释的多模态机器学习框架,该框架结合了全血细胞计数(CBC)和高效液相色谱法(HPLC)生物标志物,通过堆叠集成模型实现了对地中海贫血高度准确(99.89%)且符合临床一致性的多分类,并通过 SHAP 分析证实了排名前列的预测特征与标准诊断标准相一致。

原作者: Banoth Dinesh Nayak, Sridevi Chitti, R Jegadeesan

发布于 2026-09-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Banoth Dinesh Nayak, Sridevi Chitti, R Jegadeesan

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

地中海贫血症是一种遗传性血液疾病,影响着全球数百万人的健康,在南亚、东南亚和地中海地区尤为常见。当人体无法产生足够的构成血红蛋白(红细胞中携带氧气的物质)的蛋白质时,就会发生这种疾病。由于缺乏足够的这些蛋白质,身体难以制造健康的红细胞,从而导致贫血及一系列其他健康并发症。几十年来,医生通过在显微镜下检查血液样本并使用专门的机器来测量不同类型的血红蛋白来诊断这种疾病。虽然这种方法很准确,但过程昂贵、耗时,且高度依赖于阅读结果的个体医生的技术水平。因此,在大规模人群中进行快速筛查非常困难,尤其是在该疾病最常见的地区。

近年来,科学家们转向利用人工智能来帮助实现这一过程的自动化。其核心思想是教计算机识别血液检测结果中指示地中海贫血症的模式,就像经验丰富的医生那样,但要具备机器般的效率和一致性。然而,创建一个这样的系统并非易事。血液检测会产生大量数据,且不同类型疾病的模式往往存在重叠。此外,在任何大规模筛查的人群中,绝大多数人都是健康的,只有极小部分人才患有该疾病或携带遗传特征。这给计算机程序制造了一个难题,因为它们倾向于忽略这些罕见病例,并简单地猜测每个人都是健康的,因为这是发生频率最高的情况。

来自印度 SR 大学和 Jyothishmathi 技术与科学学院的研究团队开发了一个新的框架来解决这些特定问题。他们创建了一个计算机系统,旨在同时观察两种不同类型的血液检测结果:一种是测量红细胞大小和数量的标准全血细胞计数,另一种是更详细的被称为高效液相色谱法的测试,后者可以分离并测量血红蛋白的具体组分。通过结合这两类信息,研究人员旨在构建一个模型,该模型不仅能检测出疾病,还能区分三个不同的群体:健康人群、携带遗传特征的人(可能将特征传给后代)以及患有活动性严重疾病的人。

研究人员首先使用了一个包含超过 13,000 名患者记录的海量数据集。该集合包含了九个关键血液指标的详细测量值,以及年龄和性别等人口统计学信息。数据呈现严重的偏态分布,其中健康个体的记录占比超过 90%,而严重病例的占比不足 0.5%。为了处理这种不平衡,团队首先对数据进行了清洗,修正了信息记录中的错误,并将年龄描述转换为简单的数字。随后,他们将原始记录中的 13 种不同诊断标签归并为该系统所需的三个大类。至关重要的是,他们使用了一种技术,在训练数据中人工创造了更多罕见病例的样本,以确保计算机能够像识别常见健康病例一样,同样有效地识别这些罕见病例。

为了找到分类患者的最佳方式,团队测试了四种不同类型的先进机器学习算法。前两种基于决策树,这是一种通过让计算机对血液数值进行一系列“是或否”的问题来得出结论的方法。第三种是专为表格数据设计的深度学习模型,它试图寻找数字之间复杂的非线性关系。第四种方法是“堆叠式”(stacking)集成算法,它并不依赖单一算法,而是通过结合其他模型的预测结果来做出最终决定。研究人员对这些模型进行了严格的测试过程,确保用于教导计算机的数据与用于测试它的数据绝不相同,这是证明系统在面对新患者时依然有效的必要步骤。

结果显示,组合方法是最有效的。这种堆叠式集成模型通过汇集其他算法的长处,在正确识别这三个群体方面达到了 99.89% 的准确率。它成功识别了 94.7% 的实际疾病和携带者病例,这在医学领域是一个至关重要的指标,因为漏诊可能会带来严重后果。其他模型表现也很好,基于决策树的模型紧随其后,但组合模型始终优于它们。研究人员还使用了一种方法来理解计算机是如何做出决策的。他们发现,系统主要依赖于五个特定的生物标志物:HbA2 的水平、红细胞的平均大小、红细胞内的血红蛋白量、红细胞总数以及胎儿血红蛋白的水平。

这些发现具有重要意义,因为它们与既有的医学知识完美契合。医生早已知晓,HbA2 水平升高和红细胞体积偏小是地中海贫血症携带者的典型特征,而胎儿血红蛋白的变化通常预示着更严重的疾病形式。人工智能独立识别出这些关键因素作为最重要的指标,这一事实让医生相信,该系统并非在盲目猜测,而是真正学习到了疾病的生物学规律。研究还强调,虽然深度学习模型功能强大,但在处理结构化医疗数据时,它们可能需要更大的数据集才能超越传统的决策树方法。

研究人员承认,他们的系统目前还不是适用于所有情况的完美解决方案。数据来源于印度的单一地区,而地中海贫血症的遗传模式在世界其他地方可能会有所不同。此外,该系统较为复杂,且比单一决策树更难解释。然而,这项研究证明了构建一个能够处理现实世界中杂乱医疗数据的、高准确度自动化筛查工具是完全可能的。通过结合不同类型的血液检测并使用智能的算法组合,该框架为实现更快、更可靠的地中海贫血症筛查提供了一条充满前景的路径,有望比现有方法更有效地识别携带者和患者。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →