CodonMamba: a foundation model for programmable mRNA coding sequence design
CodonMamba 是一个用于 mRNA 编码序列设计的先进基础模型,通过在大规模语料库上的预训练,该模型在预测任务中实现了卓越的性能,并能够实现可编程的、推理时的密码子优化引导,以满足特定的宿主或应用偏好而无需重新训练。
1012 篇论文
生物信息学宛如一座连接生物学与计算机科学的桥梁,利用强大的算法和数据分析技术,将海量的生命遗传信息转化为可理解的科学发现。这一领域不再依赖显微镜下的观察,而是通过代码挖掘基因组的秘密,帮助科学家理解疾病机制、追踪病毒变异并推动精准医疗的发展。
作为 Gist.Science 的专属栏目,我们持续追踪来自 bioRxiv 的最新预印本论文,确保您能第一时间接触前沿动态。团队对每一篇新上传的预印本进行深度处理,不仅提供详尽的技术总结,更精心撰写通俗易懂的科普解读,让复杂的生物数据变得清晰易懂。
以下为您呈现该领域最新发表的几项重要研究成果,带您探索生命数字化的最新进展。
CodonMamba 是一个用于 mRNA 编码序列设计的先进基础模型,通过在大规模语料库上的预训练,该模型在预测任务中实现了卓越的性能,并能够实现可编程的、推理时的密码子优化引导,以满足特定的宿主或应用偏好而无需重新训练。
本文引入了一种分辨率感知且经过校准的最小不确定性准则,以及一个判别力评估框架,旨在增强从异构数据中进行贝叶斯网络结构学习的鲁棒性、可解释性和统计校准性。
Delta-Marches 是一个生成式人工智能框架,它通过模拟组织类别之间理想化的形态转变来解码疾病机制,从而精准定位驱动病理生理变化的亚细胞特征,这已在肾癌分级和结直肠异型增生中得到证实。
KRAKEN 是一个可扩展、具有溯源追踪功能的知识图谱,旨在通过将多样化的生物医学来源整合进一个拥有标准化语义、内置分析工具以及面向人类和人工智能驱动研究的多模态接口的模块化 1500 万节点系统中,来解决多组学和健康数据代表性不足的问题。
这项研究表明,在检索生物合成基因簇方面,显式的 Pfam 结构域内容优于或等同于 ESM-2 序列衍生表示,这表明序列嵌入目前并不能在恢复超越既有基于结构域指标的替代生物合成途径方面提供改进。
本文介绍了 EvoBind-multimer,这是一个深度学习框架,它能够仅通过蛋白质序列实现大环分子胶(macrocyclic molecular glues)的从头设计,以诱导邻近效应并驱动靶向蛋白质降解,同时也揭示了这些分子胶的功能结果在不同患者来源的模型中会呈现出依赖于上下文的变化。
本文介绍了 EnzymARC,这是一个由结构破坏型酶诱饵组成的新型基准数据集,旨在证明当前的先进酶功能预测器严重依赖系统发育捷径,且无法区分催化失能变体与功能性酶,从而强调了在模型训练和评估中引入结构感知负样本的紧迫需求。
本文介绍了 antigen-prime,这是一种前向时间流行病模拟器,它将遗传序列与宿主选择下的抗原表型联系起来,以生成用于基准测试流感变异株分配和生长率估计方法的地面真值数据,并揭示了这些方法的准确性及其特定的失效模式。
这项研究表明,基于标准度的基因优先级排序系统性地忽略了对于协调生物过程至关重要的非枢纽连接基因,并提出了 EDVS,一种无需依赖功能注释或社区检测的无划分、信息论中心度度量方法,该方法成功地找回了这些被遗漏的基因。
SVlog 是一个基于 Souffle 构建的透明、声明式逻辑编程框架,它通过将基因组数据转换为关系事实并应用可组合的逻辑规则,实现了对用于临床疾病策展的结构变异进行快速、确定且可解释的分析、注释与优先级排序。