← 最新论文
💻 bioinformatics

CodonMamba: a foundation model for programmable mRNA coding sequence design

CodonMamba 是一个用于 mRNA 编码序列设计的先进基础模型,通过在大规模语料库上的预训练,该模型在预测任务中实现了卓越的性能,并能够实现可编程的、推理时的密码子优化引导,以满足特定的宿主或应用偏好而无需重新训练。

原作者: Lang, M., Fang, X., Wang, Z., Chen, M., Cheng, Z., Zhu, X., Tam, K. Y., Zhang, J., Li, X.

发布于 2026-08-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Lang, M., Fang, X., Wang, Z., Chen, M., Cheng, Z., Zhu, X., Tam, K. Y., Zhang, J., Li, X.

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

在每一个活细胞内部,一条复杂的流水线正将遗传指令转化为维持生命运转的蛋白质。这些指令是用由四个化学字母组成的语言书写的,这些字母被分组为称为“密码子”的三联体。虽然遗传密码是通用的,但不同生物使用这些三联体的方式各不相同;有些生物偏好某些组合而非其他组合,就像不同的方言对表达同一概念有特定的词汇偏好一样。长期以来,科学家们一直试图重写这些遗传信息以创造强大的药物,特别是信使RNA(即mRNA),它作为制造治疗性蛋白质的临时蓝图。然而,设计这些序列是一场微妙的平衡。代码不仅必须产生正确的蛋白质,还必须正确折叠、保持稳定,并能被进入的特定宿主细胞高效读取。多年来,研究人员一直依赖计算机程序来优化这些序列,但每当科学家想要针对新的宿主或不同的医疗应用更改规则时,这些工具往往需要进行彻底的重构。

现在,一个研究小组引入了一种名为 CodonMamba 的新方法,该系统旨在以空前的灵活性理解并生成这些遗传序列。CodonMamba 并非仅仅通过记忆现有数据中的模式来运作,而是作为一个基础模型(foundation model)发挥作用——这是一种经过大量自然编码序列训练的人工智能,旨在掌握生物语言的底层规则。研究人员针对与预测 mRNA 行为相关的十二项不同任务对该模型进行了测试。在这些测试中,CodonMally 的表现优于以往任何方法,在十二个类别中排名第一的共有十个。这一成功表明,该模型已经学习到了关于遗传序列如何运作的深层且具有泛化能力的理解,使其能够在广泛的生物场景中高精度地预测结果。

这项工作的独特之处不仅在于其准确性,还在于它能够在创建过程中受用户引导。传统上,如果科学家想要为特定生物设计一个序列,他们必须使用新数据重新训练整个计算机模型,这是一个缓慢且僵化的过程。CodonMamba 改变了这种动态,它允许科学家在生成阶段直接指定其偏好。通过引入关于特定密码子出现频率的用户定义规则,该系统可以立即适应特定宿主或应用的需求,而无需重新训练。这意味着,只需调整给出的指令,单个模型即可用于设计适用于不同环境的序列,在保留核心生物逻辑的同时,改变其风格选择以适应新语境。

在实验中,研究人员证明了该系统可以同时协调多个设计目标,即同时优化序列的多种属性。他们展示了该模型如何将原本为一种宿主设计的遗传设计进行重定向,使其适配另一种宿主,在切换底层偏好的同时保持本质的结构选择不变。这种能力标志着从静态优化向可编程框架的转变,在此框架下,设计过程变成了科学家与模型之间的对话。结果表明,这一基础模型为工程化 mRNA 提供了一个精确且灵活的工具,推动该领域迈向一个遗传序列可以以极高的特异性和简易度进行定制的未来。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →