← 最新论文
🧬 biology

Machine learning implementation for host-based infectious disease diagnostics

这项针对 21 项研究(2020–2025 年)的系统综述评估了用于基于宿主的传染病诊断的 54 种机器学习模型,发现虽然随机森林和神经网络是最常见的算法,但没有哪种单一模型是普遍最优的,且未来的临床转化需要标准化的报告、外部验证以及上下文感知的算法选择。

原作者: Samuel Harrington

发布于 2026-09-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Samuel Harrington

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

技术摘要:基于宿主的感染性疾病诊断中的机器学习实现

问题陈述
早期识别感染性疾病的病因对于临床治疗至关重要,然而不确定性往往导致不必要的抗生素暴露,从而促进了耐药菌株的选择与传播。传统的诊断方法(如细菌培养和靶向 PCR)在速度、对疑似病原体的依赖性以及细菌、病毒与非感染性疾病之间非特异性炎症生物标志物的重叠方面存在局限性。基于宿主的诊断通过评估患者的生物学反应(例如转录组特征、细胞因子、生理信号)而非直接检测病原体,提供了一种潜在的解决方案。然而,将这些多样化的数据模态与机器学习(ML)相结合需要进行系统性评估,以确定哪些算法最适合特定的数据类型,并了解文献中目前是如何报告性能的。

方法论
本研究对 2020 年 1 月至 2025 年 8 月期间发表的文献进行了系统回顾。检索使用了四个来源:Nature、PLOS、PubMed 和 Elsevier,并采用了针对来源调整后的检索字符串,以捕捉应用于临床患者数据进行病原体检测、感染分类(如细菌 vs. 病毒)或宿主反应诊断的研究。

  • 筛选标准: 在检索到的 144 条记录中,51 条通过了初步的宿主诊断筛选。在排除缺乏合适的 ML 诊断模型或仅侧重于体外系统的研究后,最终有 21 篇文章符合入选标准。
  • 数据提取: 本次回顾从 21 篇文章中提取了 54 个不同的模型评估。这些评估根据输入模态(结构化临床变量、基因/分子表达测量、医学影像、生理信号和显微镜检查)和模型类别进行了分类。
  • 模型重点: 分析重点关注了四类主要的监督学习模型:随机森林(Random Forest)、神经网络(Neural Networks)、支持向量机(SVM)和逻辑回归(Logistic Regression)。
  • 评估: 作者评估了性能报告的一致性,指出由于研究目标和设计的实质性异质性,并未进行正式的偏倚风险评估(例如 PROBAST)。相反,在数据合成过程中对方法学质量进行了描述性评估。

关键结果

  • 模型分布: 随机森林是评估频率最高的模型类别(23 个评估,占 42.6%),其次是神经网络(17 个,31.5%)、支持向量机(9 个,16.7%)和逻辑回归(5 个,9.3%)。
  • 模态对齐: 影像学研究通常倾向于使用神经网络方法,这可能是由于其能够从高维输入中学习空间特征。相反,分子表达研究则频繁使用随机森林。
  • 性能报告: 由于输入模态、队列组成、预处理、验证策略和报告终点的差异,无法对不同研究的模型性能进行直接比较。
    • 指标: 准确率(Accuracy)和受试者工作特征曲线下面积(AUC)是主要的性能度量指标。14 个评估仅报告了准确率,20 个仅报告了 AUC,20 个两者均有报告。
    • 缺陷: 仅有 16 个评估(30%)报告了其他具有临床意义的指标,如敏感性(Sensitivity)、特异性(Specificity)、F1 分数或马修斯相关系数(Matthews correlation coefficient)。
  • 泛化性: 证据并不支持存在一种普遍最优的模型类别。性能高度依赖于算法与输入数据的特定生物学及技术属性之间的对齐程度。

核心贡献

  1. 系统映射: 本文提供了当前基于宿主的诊断 ML 领域的全面图谱,详细说明了特定算法在不同数据模态中的流行程度。
  2. 报告分析: 它强调了报告标准中存在的显著差距,特别是过度依赖准确率和 AUC,而对类别特定指标(敏感性、特异性)及校准度量报告不足,这限制了这些模型的临床解释性。
  3. 上下文模型选择: 本综述确立了模型选择应由输入数据的结构和约束(如维度、噪声结构)驱动,而非追求单一的优越算法。
  4. 转化框架: 它概述了临床转化的必要步骤,包括对外部验证、透明的预处理描述以及开发疾病无关输出(例如:细菌 vs. 病毒 vs. 非感染性)的需求。

意义与主张
作者主张,虽然基于宿主的机器学习在支持感染性疾病分类和减少不必要抗生素治疗方面具有明确潜力,但该领域目前受到方法学异质性和报告不一致性的阻碍。本文断言,没有哪一种模型类别在所有数据类型上都具有统一的优越性。相反,最直接的进步机会在于提高标准化水平。作者认为,对预处理、验证、超参数选择以及比 AUC 更广泛的性能指标进行一致性报告,对于使研究具有可重复性和临床解释性至关重要。未来的工作必须优先考虑具有泛化能力的、疾病无关的输出,以及能够在临床有用时间内测量的靶向生物标志物面板,从而将这些系统从回顾性演示转化为有价值的决策支持工具。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →