EZSolver: Template-free prediction of polar enzymatic mechanisms via bidirectional flow matching and search
EZSolver 是一个无需模板的生成式框架,它利用流匹配(flow matching)和评估器引导的双向搜索,能够准确预测分布外化学反应中的极性酶促反应机制,克服了传统基于规则模型的泛化局限性。
858 篇论文
生物信息学宛如一座连接生物学与计算机科学的桥梁,利用强大的算法和数据分析技术,将海量的生命遗传信息转化为可理解的科学发现。这一领域不再依赖显微镜下的观察,而是通过代码挖掘基因组的秘密,帮助科学家理解疾病机制、追踪病毒变异并推动精准医疗的发展。
作为 Gist.Science 的专属栏目,我们持续追踪来自 bioRxiv 的最新预印本论文,确保您能第一时间接触前沿动态。团队对每一篇新上传的预印本进行深度处理,不仅提供详尽的技术总结,更精心撰写通俗易懂的科普解读,让复杂的生物数据变得清晰易懂。
以下为您呈现该领域最新发表的几项重要研究成果,带您探索生命数字化的最新进展。
EZSolver 是一个无需模板的生成式框架,它利用流匹配(flow matching)和评估器引导的双向搜索,能够准确预测分布外化学反应中的极性酶促反应机制,克服了传统基于规则模型的泛化局限性。
本研究提出了 PredHLM,这是一种基于 XGBoost 的定量且具有可解释性的机器学习模型,该模型利用近 12,000 种化合物进行训练,能够准确预测人类肝微粒体代谢半衰期并识别关键化学驱动因素,以支持早期药物发现中的快速决策。
该论文介绍了 stGP,这是一个将时空转录组数据分解为时间与空间成分的统计框架,旨在识别具有解释性的、细胞类型特异性的基因程序,从而揭示动态组织结构和局部细胞反应如何随时间和解剖生态位而演变。
该论文介绍了 DL4DR,这是一种双塔残差后期融合深度学习模型,通过将细胞系编码为基因组图像并结合分子表示来预测泛乳腺癌药物反应,从而在不依赖细胞系身份的情况下,实现了对未见细胞系和癌症类型的卓越泛化能力,并识别出新的基因组驱动因素。
该论文介绍了 hmSEKRE,一种基于 k-mer 的隐马尔可夫模型,它通过扫描转录组来识别长链非编码 RNA 中非线性的、结构域层面的序列相似性,从而在不需要预先知晓序列比对的情况下,实现对功能相关 RNA 结构域及其相关蛋白质相互作用网络的发现。
本文介绍了 AllTheBacteria,这是一个综合性的社区资源,它对近 250 万个公开细菌基因组进行了统一处理,以支持大规模生物学研究,并通过通过人工智能驱动的挖掘发现并验证新型抗菌肽,成功展示了其应用价值。
本文介绍了 PHI,这是一个基于 Galaxy 的用户友好且自动化的工作流,它简化了可重复的原噬菌体鉴定、宿主相互作用预测以及功能表征过程,同时生成标准化的报告,从而为病毒基因组学研究领域的专家和非专家降低了门槛。
本文介绍了 BGC-MLM,这是一种在未标记的生物合成基因簇序列上进行预训练的基础模型,它显著提高了对天然产物性质、生物活性和结构相似性的预测能力,从而增强了挖掘新型天然产物的基因组挖掘效率。
2026 年的 Scop3P 更新通过整合 152,350 个经过统一重处理的人类磷酸化位点以及全面的结构、生物物理、进化和突变注释,通过提供一个可扩展、具有溯源性的资源,来呈现这一蛋白质组学驱动知识库的大规模扩张,旨在为解释功能及疾病背景下的磷酸化提供支持。
本研究评估了 AlphaFold2、AlphaFold3 以及增强采样方案在模拟抗体和 TCR 抗原识别方面的性能,证明了虽然增加采样和 AlphaFold3 通常能提高准确性,但成功率在不同复杂类型之间存在显著差异,并且可以通过整合互补模型来进一步提升。