Graph-Adaptive Horseshoe for Compositional Regression
该论文提出了 GRACE,这是一个全贝叶斯框架,通过集成一种新颖的线性重参数化与一种自适应的、由结果驱动的收缩图,来解决组合回归中的挑战,从而同时实现变量选择、提高预测精度,并恢复与传统的固定系统发育或生态网络不同的特征关系。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在人体内,特别是在口腔中,数万亿个微观生物共同生活在复杂的群落中。科学家们将这种集合称为微生物组。当研究人员研究这些群落时,他们不会计算细菌的绝对数量,因为这个数字会根据采集唾液或牙菌斑的量而不断变化。相反,他们测量的是相对丰度,即每种类型的细菌相对于整个群落的比例。这创造了一个独特的数学难题:如果一种细菌的比例上升,为了保持总和为百分之百,所有其他细菌的比例就必须下降。这种相互依赖性使得使用标准的统计工具来找出哪些特定细菌与某种健康状况相关联变得十分困难。多年来,科学家们一直试图通过假设在生命进化树上亲缘关系较近的细菌会表现出相似的行为来解决这个问题。他们基于这些固定的家族树构建模型,希望进化上的接近性能预测细菌如何与人类健康发生相互作用。然而,这一假设经常失效,因为在人体内表现相似的细菌可能是亲缘关系很远的亲戚,而亲缘关系近的细菌其影响可能却大相径庭。
一个研究团队开发了一种新方法,可以在不依赖预设细菌家族树假设的情况下,理清这些关系。他们创建了一个名为 GRACE 的系统,全称为“用于组合回归的图自适应马蹄形分布”(Graph-Adaptive Horseshoe for Compositional Regression)。该方法不再强迫数据去符合静态的进化关系图谱,而是让数据本身来绘制地图。研究人员将这种方法应用于一项针对有糖尿病风险但尚未发病的成年人的研究。他们分析了牙龈下方的牙菌斑样本,以观察哪些细菌与胰岛素抵抗(一种身体难以调节血糖的状况)有关。通过使用一种灵活的、基于学习的模型,团队发现与胰岛素抵抗相关的细菌是根据它们对身体的实际影响而非仅仅根据它们的进化历史来分组的。
研究人员使用模拟数据测试了他们的新方法,这些数据模仿了真实微生物组样本中那种混乱且充满零值的特性。在这些测试中,他们将 GRACE 与现有的依赖于源自系统发育树或共发生模式的固定图谱的方法进行了对比。结果显示,当固定图谱与真实的生物学关系不匹配时,旧的方法在寻找正确的细菌或重建连接网络方面表现挣扎。然而,GRACE 能够适应数据。它成功识别了正确的细菌组,并恢复了它们关系的底层结构,即使最初关于细菌关系的假设是错误的。即使在数据包含许多缺失值(这是微生物组研究中的常见问题,即某些细菌在每个样本中都太稀少而无法被检测到)的情况下,该方法也表现出了鲁棒性。
当团队将 GRACE 应用于涉及 152 名成年人的 ORIGINS 研究的真实数据时,研究结果为口腔微生物组在代谢健康中的作用提供了更清晰的图景。该模型识别出了与胰岛素抵抗相关的特定细菌,包括 Tannerella forsythia 和 Selenomonas artemidis。这些细菌已知参与牙龈疾病,但新的分析显示了它们是如何根据对血糖调节的共同影响而聚集在一起的。至关重要的是,GRACE 构建的细菌间连接网络与传统的进化树看起来非常不同。模型将它们归为一类的细菌并不一定是生命之树上亲缘关系最近的亲属。相反,它们被归为一组是因为它们在针对健康结果的表现上趋向一致:一些细菌与较高的胰岛素抵抗相关,而另一些则与较低的抵抗力相关。
研究还表明,人体内细菌的连接方式并不是对它们进化历史的简单反映。研究人员发现,在胰岛素抵抗方面的细菌“距离”并不总是与其在进化树上的距离相匹配。例如,一些在进化上很接近的细菌在与疾病的关系上却相距甚远,而另一些亲缘关系较远的亲属却表现得步调一致。这表明,仅依靠进化树来理解微生物组数据可能会导致研究人员错过重要的联系。这种新方法允许数据本身说话,创建一个由实际健康结果驱动的关系图谱,而不是由预先存在的理论所驱动。
研究人员强调,GRACE 生成的图谱不应被视为细菌之间物理相互作用(例如谁吃谁,或谁帮助谁生存)的地图。相反,它是如何描述不同细菌相对于特定健康状况行为的总结。它是一个假设生成工具,突出了哪些细菌组共享对身体的共同影响。在 ORIGINS 研究中,该模型识别出的模块与已知的生物学功能(如与牙周病和代谢功能障碍相关的功能)相一致。这种与现有医学知识的一致性使研究人员确信,该模型捕捉到的是真实的生物信号而非随机噪声。
这种方法的一个核心优势在于其处理不确定性的能力。该模型不仅产生一个单一、僵化的答案,还会提供一系列可能性,并指出它对每个连接的信心程度。这在数据稀疏且充满噪声的复杂生物系统中尤为重要。通过允许从数据中学习细菌之间的连接,该方法避免了强行将数据塞入不匹配的框架中所带来的陷阱。研究人员指出,当他们对细菌的初始关系不确定时,使用较弱的先验假设可以让模型直接从观测中学习结构,从而获得更好的结果。
将此方法应用于口腔微生物组数据,为理解牙龈健康与糖尿病之间的联系提供了更细致的理解。研究证实,某些细菌(如 Tannerella forsythia)与较高的胰岛素抵抗水平持续相关。它还强调了这些细菌并非孤立行动,而是属于一个影响最终结果的更大社区结构。模型显示,与胰岛素抵抗相关的细菌形成了独特的集群,这些集群与那些与健康葡萄糖调节相关的细菌是分开的。这种细致程度有助于研究人员超越仅仅列出存在哪些细菌,转而开始理解整个群落是如何运作的。
研究人员得出结论,虽然进化树对于理解生命的历程非常有用,但它们并不总是理解生物体如何与人类健康相互作用的最佳指南。以往研究中使用的固定图谱往往无法捕捉到驱动疾病结果的真实关系。通过开发一种能够适应数据的模型,团队为研究人员探索微生物组提供了一个新工具。这个工具可以帮助识别哪些细菌对于特定状况真正重要,以及它们在那个语境下如何相互关联。研究结果表明,微生物组研究的未来在于灵活的、由结果驱动的方法,让数据揭示自身的结构,而不是强迫其符合预设的图谱。
该研究还解决了处理微生物组数据时的实际挑战,例如当细菌未被检测到时出现的许多零值问题。新方法证明了即使在这些困难条件下也具有稳定性和准确性,其表现优于那些在噪声面前表现挣扎的其他技术。这种鲁棒性使其成为未来研究中极具前景的选择,因为未来的数据质量可能会有所波动。研究人员计划将他们的工作扩展到直接对细菌的原始计数进行建模,并整合多个来源的网络信息,这可能会进一步提高结果的准确性和可靠性。
最终,这项工作代表了科学家对待微生物组复杂性的方式的一种转变。它不再认为存在一个适用于所有情况的单一、固定的关系图谱。相反,它接受了细菌之间的关系是流动的,并且取决于特定的背景,例如正在研究的健康状况。通过使用一种能从数据中学习这些关系的方法,研究人员可以对微生物在人类健康中所扮演的角色获得更深入、更准确的理解。对口腔微生物组及其与糖尿病联系的研究只是这一方法的其中一个例子,它可以应用于医学的其他领域,潜在地揭示人类体内复杂生命网络的新见解。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。