← 最新论文
🧬 biology

mRNA Design and Optimization with Deep Knowledge-Infused Approach

该论文介绍了 RNop,一种知识注入的 Transformer 模型,它通过集成机制对齐损失来实现绝对的序列保真度、显著提升的生物学指标以及高吞吐量,从而解决了 mRNA 优化的“不可能三角”问题,将 mRNA 设计从一个黑盒过程转变为一个可预测且可解释的工程问题。

原作者: Zheng Gong, Ziyi Jiang, Weihao Gao, Yuanyuan Wang, Zhining Cai, Deng Zhuo, Lan Ma

发布于 2026-09-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Zheng Gong, Ziyi Jiang, Weihao Gao, Yuanyuan Wang, Zhining Cai, Deng Zhuo, Lan Ma

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

信使核糖核酸(mRNA)是细胞的指令手册。它将遗传蓝图从 DNA 携带到蛋白质制造工厂,准确地告诉细胞应该构建哪些蛋白质以及构建多少。几十年来,科学家们一直致力于改写这些指令以用于医疗用途。当研究人员设计用于制造疫苗或疗法的 mRNA 时,他们面临着一场艰难的平衡博弈。他们必须调整序列以让细胞产生更多的蛋白质,但又不能改变正在制造的蛋白质本身,否则治疗将会失败。他们还需要足够快地完成这项工作,以便同时设计数千个序列。在此之前,现有的工具迫使科学家们在这些目标之间做出选择:他们要么能确保蛋白质保持正确,要么能针对速度和数量进行优化,但很难两者兼顾。

现在,一个研究小组开发出了一种打破僵局的新方法。通过教导计算机模型遵循特定的生物学规则,而非仅仅猜测模式,他们创建了一个能够以完美的准确度、极高的速度和改进的蛋白质产量来优化 mRNA 序列的系统。这种被称为 RNop 的方法,并不将设计过程视为一种神秘的猜谜游戏,而是一个受控的工程任务,其中的每一次变化都由已知的生物学原理引导。其结果是,该工具可以生成比以往方法更有效的 mRNA 序列,同时保证最终的蛋白质完全符合预期。

mRNA 设计的核心挑战通常被描述为一个“不可能三角”。三角的一个角是保真度(fidelity),即要求新序列必须产生与原始序列完全相同的蛋白质。第二个角是同时优化多个生物学目标的能力,例如让 mRNA 更稳定或更容易被细胞读取。第三个角是速度,即快速处理大量序列的需求。传统的计算机算法可以确保蛋白质正确,但处理大规模应用时速度太慢。较新的人工智能模型速度很快,且能针对多个目标进行优化,但它们经常会犯一些微小的、无意识的错误,从而改变了蛋白质,导致设计失效。这些模型的作用方式类似于“黑箱”,它们通过从海量数据中学习模式,却并不理解底层的规则,这使得控制其误差或解释其为何做出某些选择变得不可能。

研究人员通过改变计算机的学习方式解决了这个问题。他们没有让模型仅从数据中猜测规则,而是通过在训练过程中使用一套惩罚与奖励机制,明确地教授了它生物学规则。他们构建了一个理解遗传密码与产生蛋白质之间关系的模型。如果模型建议的修改会改变蛋白质,系统会立即对该建议进行惩罚,迫使模型寻找另一条既能保持蛋白质完全一致的路径。与此同时,模型会因为做出其他有益的改变(例如选择细胞机器更偏好的遗传密码,或排列序列使其更稳定)而获得奖励。这确保了最终输出始终忠实于原始蛋白质序列。

这种方法使团队能够在一个包含超过 600 万个遗传序列的系统中进行训练。在计算机模拟测试中,新模型生成的序列始终与原始蛋白质完美匹配,零误差。同时,这些优化的序列在预测细胞读取效率的生物学指标上也表现出了显著提升。该模型能够处理不同长度的序列,并跨越从细菌到人类的不同物种进行工作,证明它学习到的是通用的生物学规则,而非仅仅记住了特定的例子。与那些在处理长序列时表现挣扎或处理单个设计需要数小时的旧方法不同,这个新系统每秒可以生成数十个优化序列,足以满足高通量工业应用的需求。

为了在现实世界中证实这些发现,研究人员在活细胞中测试了优化后的序列。他们在实验室培养皿中使用人类细胞,观察从新指令中产生的蛋白质产量。结果令人瞩目:由新系统设计的序列产生的蛋白质,比目前商业标准下被认为高度优化的序列多出高达 2.28 倍。在一次特定的测试中,竞争对手的方法完全失败了,几乎没有产生蛋白质,因为它过度改变了信息的结构。新系统通过平衡所有必要因素,确保了信息既可读又稳定,从而避免了这种失败。这证明了计算机的预测可以直接转化为真实的生物学成功。

该系统的力量在于其透明度。由于规则已内置于模型之中,科学家可以调整不同目标的权重。如果他们希望极其严格地保持蛋白质不变,可以收紧规则;如果他们希望允许更多的灵活性来探索新的可能性,可以放宽规则。这种控制力将设计过程从一种神秘的试错练习转变为一种可预测的工程学科。研究人员表明,通过将清晰、可解释的知识注入模型,他们可以实现此前被认为互不兼容的目标。

这项工作代表了科学家对待生物设计方式的一种转变。它不再仅仅依赖人工智能盲目地寻找自然界的模式,而是转向利用人工智能严谨地应用已知的科学原则。该系统具有灵活性,这意味着随着科学家发现新的生物学规则,他们可以在无需从头重建整个系统的情况下,将这些规则添加到模型中。这为设计更广泛应用的 mRNA(从新型疫苗到工业蛋白质生产)打开了大门,并提供了以往无法实现的快速性和可靠性。通过解决保真度、优化和速度这一“不可能三角”,研究人员提供了一个全新的工具,使生命指令的工程化变得更加精准且强大。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →