Towards reconstruction of the human interactome from positive and negative experimental evidence
本文提出了一种重建蛋白质-蛋白质相互作用(PPI)筛选实验搜索空间的方法,以推断可能的非相互作用蛋白质对,从而实现更好的误差率估计、模型校准以及改进机器学习训练,以实现对人类相互作用组更准确且更完整的映射。
1012 篇论文
生物信息学宛如一座连接生物学与计算机科学的桥梁,利用强大的算法和数据分析技术,将海量的生命遗传信息转化为可理解的科学发现。这一领域不再依赖显微镜下的观察,而是通过代码挖掘基因组的秘密,帮助科学家理解疾病机制、追踪病毒变异并推动精准医疗的发展。
作为 Gist.Science 的专属栏目,我们持续追踪来自 bioRxiv 的最新预印本论文,确保您能第一时间接触前沿动态。团队对每一篇新上传的预印本进行深度处理,不仅提供详尽的技术总结,更精心撰写通俗易懂的科普解读,让复杂的生物数据变得清晰易懂。
以下为您呈现该领域最新发表的几项重要研究成果,带您探索生命数字化的最新进展。
本文提出了一种重建蛋白质-蛋白质相互作用(PPI)筛选实验搜索空间的方法,以推断可能的非相互作用蛋白质对,从而实现更好的误差率估计、模型校准以及改进机器学习训练,以实现对人类相互作用组更准确且更完整的映射。
该论文介绍了 Inverse FoldDir,这是一种基于狄利克雷流匹配(Dirichlet flow matching)的可控逆折叠方法,通过在氨基酸概率单纯形上进行迭代去噪,能够根据用户定义的约束生成具有多样性且经过实验验证的蛋白质序列,实现了最先进的结构恢复指标,并成功完成了抗 GFP 纳米体的功能性重新设计。
本研究引入了扰动感知神经常微分方程(pNODE)框架,该框架通过整合微生物丰度和时间分辨的抗生素扰动,在预测接受异基因造血干细胞移植的癌症患者的肠道微生物群动态以及预测肠道来源的血流感染方面,表现优于传统模型。
本研究系统地基准测试了针对多样化数据集和技术的长读段 RNA 测序的小变异检测与单倍型相位划分流程,揭示了测序质量是主要的性能决定因素,同时确定了 Clair3-RNA、DeepVariant 和 longcallR 为顶尖的检测工具,以及根据具体情况而言 WhatsHap 或 HapCUT2 是最优的相位划分工具。
这项研究表明,虽然用于真菌 ITS 序列的深度学习分类器在全长参考序列上实现了高准确度,但它们在常用的 ITS2 子区域上表现出剧烈的失败,因为它们依赖于侧翼区域而非条形码本身,从而导致在现实的环境元条形码场景中,经典的基准方法表现显著优于它们。
该论文介绍了 Cavebear,这是一个机器学习框架,它利用来自一个物种或条件的参考单细胞 RNA 测序(scRNA-seq)时间序列数据,来准确推断在缺乏可靠时间标签的查询上下文中中的伪时间,并绘制生物衰老或疾病进展图谱。
这项研究表明,哈密顿自动分解优化框架(HADOF)能够克服当前 NISQ 硬件的限制,在真实量子硬件上成功组装了一个 710 万碱基对的铜绿假单胞菌(*Pseudomonas aeruginosa*)基因组,实现了 99.348% 的基因组组装比例,并证明了可扩展量子优化在大型科学工作负载中的可行性。
本文介绍了 PLI-Parallax,这是一个综合性的数据集,它整合了预测的与实验的蛋白质-配体结构,并配备了经过校准的准确度标签和严格的评估划分,使得即使在缺乏实验真值的情况下,也能通过方法间的一致性来实现对预测可靠性的估计。
scAtlasPy 是一种新型的、基于磁盘驻留的计算框架,它克服了标准工作站的内存限制,能够以显著更低的内存占用和更高的处理速度,实现对大规模单细胞图谱(例如 1 亿个细胞)的全分辨率分析,其性能优于现有的最先进平台。
本研究识别出血管疾病中一种可重复的高阶“功能组织”,这种组织超越了单个基因或通路的变异,揭示了跨越不同病理条件和细胞类型的心血管重塑是由六个保守生物学功能的协调且动态的重新平衡所驱动的。