Interpretable Machine Learning Reveals Complementary Age-Related Signatures in the Oral and Gut Microbiome
通过对配对的口腔和肠道微生物组数据应用基于 SHAP 的可解释性分析,本研究揭示了虽然结合模型在区分新生儿与成年人方面的预测准确度并未超越仅使用肠道数据的完美预测准确度,但它们发现了来自口腔腔内具有互补性且非冗余的生物特征,而这些特征是传统准确度指标所无法捕捉到的。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明
人体并非一个单一、统一的环境,而是一个个独特的“邻里”集合,每个邻里都孕育着其独特的微观生命社区。从皮肤到口腔再到肠道,这些微生物城市受局部条件、免疫防御以及与外界接触程度的影响而各具特色。几十年来,科学家们一直想知道这些群落是如何随着一个人从新生儿成长为成年人而发生变化的。肠道和口腔中的微生物是同步律动地共同成熟,还是遵循各自独立的进程?回答这个问题对于理解人类发育至关重要,但对于依赖机器学习的研究人员来说,这提出了一个棘手的谜题。当计算机被训练通过微生物来预测一个人的年龄时,它们通常会产生一个单一的准确率得分。如果加入来自第二个身体部位的数据并没有提高这个得分,标准的结论就是第二个部位没有提供任何新信息。然而,这种方法可能会忽略一个微妙的真相:即使其中一个部位本身已经足以获得完美的分数,计算机也可能是在利用来自这两个部位的信息来进行决策。
来自孟加拉国达卡布拉克大学(BRAC University)的一个研究小组试图通过观察机器的推理过程而非仅仅看其最终得分来解决这个谜题。他们使用了一个包含来自44个人体样本的匹配数据集,这些样本分别取自粪便和口腔,且样本在健康成年人和新生儿之间均匀分布。这两组人群之间的生物学差异非常显著;新生儿的微生物世界与成年人截然不同。研究人员首先证实了许多人可能会预料到的情况:仅针对肠道细菌训练的模型可以完美地区分这两个年龄组。当他们将肠道数据与口腔数据结合时,计算机的准确率得分并没有变得更高。它已经达到了完美的上限。在传统的研究中,这种平坦的结果会表明口腔数据是冗余且无用的。但研究人员怀疑故事背后还有更多内容。
为了寻找隐藏的信息层,该团队使用了一种被称为SHAP的方法,这种方法就像一束聚光灯,能够精确显示计算机依靠哪些数据片段来进行决策。他们将此方法应用于同时使用肠道和口腔数据的模型。结果揭示了一个令人惊讶的模式。尽管仅靠肠道细菌就足以解决问题,但当两者同时存在时,计算机实际上更倾向于依赖口腔细菌。事实上,来自口腔的特征在模型的决策过程中贡献了超过一半的重要性。这意味着这两个身体部位并不是在重复相同的信息,而是提供了互补的线索。计算机正在利用来自口腔的独特信号来完善其理解,尽管它并不需要这些信号也能达到完美的分数。
随后,研究转向了驱动这种行为的具体微生物。计算机识别出了几种区分新生儿与成年人的关键物种。在这些物种中,包括了Malassezia restricta、Staphylococcus epidermidis和Prevotella melaninogenica。乍看之下,这些微生物的角色似乎具有模糊性,因为其中一些已知在成人和儿童体内都存在。然而,当研究人员直接观察样本中这些物种的丰度时,一幅清晰的图景浮现了出来。这些特定微生物水平的升高始终指向新生儿样本。这种行为符合已有的生物学知识,即在早期定植阶段,这些物种是首批在婴儿体内定居的物种之一。计算机成功地将这些早期定植者识别为代表年轻态的最强标记,证实了其内部逻辑是基于真实的生物学模式而非随机噪声。
研究人员采取了额外措施,以确保这些发现是真实的,而非数据或计算机模型的巧合。他们使用不同的设置运行了分析,并将其结果与随机概率进行了对比,确认了那完美的准确率是成年人与新生儿之间生物学差异的真实反映。他们还注意到,另一项使用不同方法进行的更大规模的研究也发现了口腔与肠道之间存在类似的互补信号模式。这些证据的汇聚表明,口腔和肠道微生物群是沿着两条不同但相关的路径成熟的。这项研究表明,要真正理解身体不同部分之间的关系,科学家必须超越简单的准确率得分。通过检查模型的思考方式,他们可以挖掘出丰富的、非冗余的信息,这些信息在其他情况下将是不可见的,从而揭示人类微生物组从出生到成年发育过程中更完整的图景。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。