Interpretable Machine Learning Reveals Complementary Age-Related Signatures in the Oral and Gut Microbiome
通过对配对的口腔和肠道微生物组数据应用基于 SHAP 的可解释性分析,本研究揭示了虽然结合模型在区分新生儿与成年人方面的预测准确度并未超越仅使用肠道数据的完美预测准确度,但它们发现了来自口腔腔内具有互补性且非冗余的生物特征,而这些特征是传统准确度指标所无法捕捉到的。
997 篇论文
生物信息学宛如一座连接生物学与计算机科学的桥梁,利用强大的算法和数据分析技术,将海量的生命遗传信息转化为可理解的科学发现。这一领域不再依赖显微镜下的观察,而是通过代码挖掘基因组的秘密,帮助科学家理解疾病机制、追踪病毒变异并推动精准医疗的发展。
作为 Gist.Science 的专属栏目,我们持续追踪来自 bioRxiv 的最新预印本论文,确保您能第一时间接触前沿动态。团队对每一篇新上传的预印本进行深度处理,不仅提供详尽的技术总结,更精心撰写通俗易懂的科普解读,让复杂的生物数据变得清晰易懂。
以下为您呈现该领域最新发表的几项重要研究成果,带您探索生命数字化的最新进展。
通过对配对的口腔和肠道微生物组数据应用基于 SHAP 的可解释性分析,本研究揭示了虽然结合模型在区分新生儿与成年人方面的预测准确度并未超越仅使用肠道数据的完美预测准确度,但它们发现了来自口腔腔内具有互补性且非冗余的生物特征,而这些特征是传统准确度指标所无法捕捉到的。
本文介绍了 pydreg,这是一个对 dreg 算法进行的快速且易于维护的 Python 重实现,用于从新生转录中识别活跃的顺式调控元件,它在保持原方法准确性及与现代计算基础设施兼容性的同时,显著降低了运行时间和内存消耗。
通过对比中世纪蒙古个体匹配的全无去簇(full-UDG)与非去簇(non-UDG)古DNA文库,本研究表明,虽然各种计算损伤校正方法(修剪、重缩放和掩蔽)在位点保留与误差降低之间存在差异化的平衡,但最优选择取决于具体的下游分析,且校正后的数据对于非去簇文库中准确的亲缘关系推断至关重要。
本文提出了一种集成在 DMRcaller 软件包中的可扩展框架,该框架利用原生 Oxford Nanopore 测序技术来量化单分子 DNA 甲基化异质性并检测共甲基化位点,从而揭示了被传统的位点级平均分析所掩盖的表观遗传模式和调控相互作用。
本文提出了一种重建蛋白质-蛋白质相互作用(PPI)筛选实验搜索空间的方法,以推断可能的非相互作用蛋白质对,从而实现更好的误差率估计、模型校准以及改进机器学习训练,以实现对人类相互作用组更准确且更完整的映射。
该论文介绍了 Inverse FoldDir,这是一种基于狄利克雷流匹配(Dirichlet flow matching)的可控逆折叠方法,通过在氨基酸概率单纯形上进行迭代去噪,能够根据用户定义的约束生成具有多样性且经过实验验证的蛋白质序列,实现了最先进的结构恢复指标,并成功完成了抗 GFP 纳米体的功能性重新设计。
本研究引入了扰动感知神经常微分方程(pNODE)框架,该框架通过整合微生物丰度和时间分辨的抗生素扰动,在预测接受异基因造血干细胞移植的癌症患者的肠道微生物群动态以及预测肠道来源的血流感染方面,表现优于传统模型。
本研究系统地基准测试了针对多样化数据集和技术的长读段 RNA 测序的小变异检测与单倍型相位划分流程,揭示了测序质量是主要的性能决定因素,同时确定了 Clair3-RNA、DeepVariant 和 longcallR 为顶尖的检测工具,以及根据具体情况而言 WhatsHap 或 HapCUT2 是最优的相位划分工具。
这项研究表明,虽然用于真菌 ITS 序列的深度学习分类器在全长参考序列上实现了高准确度,但它们在常用的 ITS2 子区域上表现出剧烈的失败,因为它们依赖于侧翼区域而非条形码本身,从而导致在现实的环境元条形码场景中,经典的基准方法表现显著优于它们。
该论文介绍了 Cavebear,这是一个机器学习框架,它利用来自一个物种或条件的参考单细胞 RNA 测序(scRNA-seq)时间序列数据,来准确推断在缺乏可靠时间标签的查询上下文中中的伪时间,并绘制生物衰老或疾病进展图谱。