PanGBank: a large-scale resource of precomputed microbial pangenomes built with PPanGGOLiN
PanGBank 是一个综合性的开放获取数据库,通过使用 PPanGGOLiN 为超过 4,600 种原核物种提供预计算的泛基因组,提供标准化的图谱资源和多种访问工具,以促进大规模比较基因组学研究以及对微生物进化与适应性的研究。
1012 篇论文
生物信息学宛如一座连接生物学与计算机科学的桥梁,利用强大的算法和数据分析技术,将海量的生命遗传信息转化为可理解的科学发现。这一领域不再依赖显微镜下的观察,而是通过代码挖掘基因组的秘密,帮助科学家理解疾病机制、追踪病毒变异并推动精准医疗的发展。
作为 Gist.Science 的专属栏目,我们持续追踪来自 bioRxiv 的最新预印本论文,确保您能第一时间接触前沿动态。团队对每一篇新上传的预印本进行深度处理,不仅提供详尽的技术总结,更精心撰写通俗易懂的科普解读,让复杂的生物数据变得清晰易懂。
以下为您呈现该领域最新发表的几项重要研究成果,带您探索生命数字化的最新进展。
PanGBank 是一个综合性的开放获取数据库,通过使用 PPanGGOLiN 为超过 4,600 种原核物种提供预计算的泛基因组,提供标准化的图谱资源和多种访问工具,以促进大规模比较基因组学研究以及对微生物进化与适应性的研究。
本文介绍了一种名为 Move BeTween modAlities (MBTA) 的新颖框架,该框架利用流匹配(flow matching)来连接特定模态的潜在空间并解决单细胞数据中的结构失配问题,从而在保持每种分子模态独特的结构完整性的同时,实现准确的跨模态转换。
本文介绍了一种可扩展的拓扑数据分析框架,该框架在显著降低从表面斑块预测蛋白质-蛋白质相互作用界面计算成本的同时,保持了与既有几何深度学习方法相比具有竞争力的准确度。
本文介绍了 MAPPIE,一种通过生成人类蛋白质-蛋白质相互作用的二维嵌入图,来预测特定相互作用对的特定功能角色,且在功能知识稀疏的相互作用组区域中表现优于现有基准方法的创新方法。
本研究引入了 VirGenes,这是一个整合了序列、结构和功能数据的层级同源性框架,旨在揭示全球病毒组中大量此前被低估的病毒碳水化合物活性酶的多样性,并揭示其复杂的进化起源以及在病毒-宿主相互作用中的重要作用。
该研究介绍了 PhyCD,这是一种辅助系统发育学的计算工具,它分析了近 500 万个 SARS-CoV-2 基因组,识别出超过 10,000 起污染事件并掩盖了近 65,000 个错误替换,从而提高了下游病原体进化和传播分析的可靠性。
SLIM 是一个轻量级且计算高效的模型,它利用 64 维 STRING 网络嵌入和闭式岭回归估计器来准确预测细胞对遗传扰动的反应,通常在仅使用极少可训练参数的情况下,其表现优于复杂的深度学习基准模型。
本文表明,通过应用以 FAIR 原则和现代软件工程标准为指导的系统性重构,被遗弃的科学软件(例如被废弃的基于 MATLAB 的 NuMorph 工具包)可以被成功挽救,并转化为像 nf-core/lsmquant 这样可持续且可复用的社区工作流。
本研究通过评估 184 个核心家庭中 555 名个体的基因型一致性和孟德尔违背率,将 Twist Bioscience 的全基因组 SNP 捕获 (GxS) 平台与全基因组测序及 Illumina GSA-24 芯片进行基准测试,旨在为这一新兴靶向测序技术提供第三方评估。
本文提供了一个公开可用的数据库,其中包含基于 FAME 2 临床试验重建的 779 根冠状动脉的三维非定常纳维-斯托克斯(Navier-Stokes)模拟数据及高质量六面体网格,旨在解决数据驱动建模和机器学习应用中数值血液动力学数据匮乏的问题。