PHI: A Galaxy-based workflow for reproducible prophage-host interaction analysis and standardized viral-genomics reporting
本文介绍了 PHI,这是一个基于 Galaxy 的用户友好且自动化的工作流,它简化了可重复的原噬菌体鉴定、宿主相互作用预测以及功能表征过程,同时生成标准化的报告,从而为病毒基因组学研究领域的专家和非专家降低了门槛。
1012 篇论文
生物信息学宛如一座连接生物学与计算机科学的桥梁,利用强大的算法和数据分析技术,将海量的生命遗传信息转化为可理解的科学发现。这一领域不再依赖显微镜下的观察,而是通过代码挖掘基因组的秘密,帮助科学家理解疾病机制、追踪病毒变异并推动精准医疗的发展。
作为 Gist.Science 的专属栏目,我们持续追踪来自 bioRxiv 的最新预印本论文,确保您能第一时间接触前沿动态。团队对每一篇新上传的预印本进行深度处理,不仅提供详尽的技术总结,更精心撰写通俗易懂的科普解读,让复杂的生物数据变得清晰易懂。
以下为您呈现该领域最新发表的几项重要研究成果,带您探索生命数字化的最新进展。
本文介绍了 PHI,这是一个基于 Galaxy 的用户友好且自动化的工作流,它简化了可重复的原噬菌体鉴定、宿主相互作用预测以及功能表征过程,同时生成标准化的报告,从而为病毒基因组学研究领域的专家和非专家降低了门槛。
本文介绍了 BGC-MLM,这是一种在未标记的生物合成基因簇序列上进行预训练的基础模型,它显著提高了对天然产物性质、生物活性和结构相似性的预测能力,从而增强了挖掘新型天然产物的基因组挖掘效率。
2026 年的 Scop3P 更新通过整合 152,350 个经过统一重处理的人类磷酸化位点以及全面的结构、生物物理、进化和突变注释,通过提供一个可扩展、具有溯源性的资源,来呈现这一蛋白质组学驱动知识库的大规模扩张,旨在为解释功能及疾病背景下的磷酸化提供支持。
本研究评估了 AlphaFold2、AlphaFold3 以及增强采样方案在模拟抗体和 TCR 抗原识别方面的性能,证明了虽然增加采样和 AlphaFold3 通常能提高准确性,但成功率在不同复杂类型之间存在显著差异,并且可以通过整合互补模型来进一步提升。
本文定义并分析了从多个源基因组中选择基因组区块以优化多基因性状的 NP 完全问题,并提出了一套算法组合——包括一个经过认证的分支定界求解器、一种快速的块坐标下降启发式算法以及一个半正定规划松弛方法——这些算法共同提供了具有理论保证的、在酵母规模模拟实验上经过经验验证的最优或近优解。
GTcomplex 是一种基于空间索引的新型算法,它通过直接从最优全局叠加中导出链分配,实现了对大分子复合物准确且高效的整体对齐,在多种结构数据集上的速度和精度方面均优于现有方法。
本研究表明,通过回顾性模拟进行优化并在闭环伯氏体(*Borrelia burgdorferi*)筛选活动中得到验证的校准主动学习策略,显著提高了实验命中率,并使能够训练出能够准确预测分布外化合物抗生素活性的泛化机器学习模型。
本文介绍了一种将排序后的 k-mer 表示为虚拟超 k-mer 列表的新方法,该方法在 sklib 工具中实现,与 KMC 等现有工具相比,实现了高吞吐量的集合运算并显著降低了内存使用量,同时保持了具有竞争力的查询性能。
通过对公共数据集进行严格的统计控制以建立包含 1,828 个位点的高置信度人类甲基化图谱,作者开发并验证了一种基于迁移学习的深度学习模型(AHLF-Methylation),该模型显著提高了甲基化肽段的检测与定位能力。
VirProtRAG 是一个检索增强生成框架,通过整合混合文献检索与基于证据的重排序,来增强病毒蛋白质功能注释,从而产生可验证的高质量功能见解并扩展现有的专家人工策展。