RNASeek: A Cross-Phyla Generative Foundation Model for Multipurpose RNA Modeling and Reinforcement Learning-Based Design
RNASeek 是一个拥有 16 亿参数的生成式基础模型,它利用强化学习来统一 RNA 序列表示、功能预测和从头设计,成功生成了性能增强且经过实验验证的核酶和 3' UTR。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明
在每一个活细胞内部,都进行着一场宏大而复杂的对话,这种对话并非通过文字,而是通过分子进行的。在这场对话的核心是 RNA,一种多功能的分子,它既是信使也是调节者,负责传递来自遗传蓝图的指令,并决定这些指令如何被执行。几十年来,科学家们一直明白,RNA 链中字母的具体顺序决定了它的形状和功能,就像句子中字母的排列决定了其含义一样。然而,准确预测一段新的字母序列将会如何表现一直是一个巨大的挑战。其中的规则非常复杂,涉及长程相互作用和难以通过人工绘制的细微结构差异。现在,研究人员开发出了一种新工具,它通过阅读生命本身的生物学文献来学习这些规则,这使得他们不仅能够预测 RNA 的行为,还能设计出具有特定、理想属性的全新分子。
由加州大学河滨分校和哥伦比亚大学研究人员领导的团队开发了一个名为 RNASeek 的大型计算机程序。可以将这个程序想象成一名学生,它读完了包含一百多种不同物种(从植物、动物到真菌和病毒)遗传指令的图书馆中的每一本书。与以往仅旨在解决一个特定谜题的工具不同,RNASeek 的构建旨在理解 RNA 的通用语言。它是在一个包含大约 1500 亿条遗传信息的数据集上进行训练的,学习识别不同生物构建其 RNA 的模式。该程序还学会了阅读自然语言指令,这意味着科学家只需告诉它想要什么,例如“创建一个稳定的 RNA 序列”或“设计一个能自我切割的分子”,模型就会尝试生成解决方案。
为了测试这个“数字学生”是否真正掌握了这种语言,研究人员首先要求它预测核酶的行为。核酶是作为酶发挥作用的 RNA 分子,能够切割自身或其他分子。团队向模型提供了数千个已知的核酶序列及其测得的切割速度。RNASeek 成功地学会了预测哪些序列切割快,哪些切割慢,并识别出了有助于速度的细微特征,例如分子结构中某些环路的灵活性。该模型的表现与许多专门为此任务设计的专业工具相当,甚至更好,证明了它已经掌握了 RNA 结构如何决定功能的底层原理。
受到这一成功的鼓舞,研究人员进一步推动模型,要求它从头开始设计新的 RNA 序列。他们专注于在 3' 非翻译区发现的一种不同类型的 RNA,该区域有助于决定 RNA 在细胞内的存活时间。更长的寿命意味着细胞能产生更多该 RNA 所编码的蛋白质,这对于像 mRNA 疫苗之类的疗法至关重要。研究人员使用了一种称为强化学习的技术,这是一种让计算机程序进行试错游戏的算法。它生成了数千个候选序列,而模型的另一个部分则充当裁判,根据预测的稳定性对它们进行评分。随后,程序调整其策略以生成更好的候选序列,逐渐学会生成高度稳定的序列。
结果令人瞩目。由 RNASeek 设计的序列并非随机的字母组合;它们包含了特定的模式,例如丰富的腺嘌呤和尿嘧啶,这些模式已知有助于稳定 RNA。当研究人员在实验室环境中测试这些计算机生成的方案时,他们发现这些新序列的表现异常出色。其中一些设计的分子甚至比自然界中发现的最佳序列或通过其他人工智能工具创建的序列还要稳定。至关重要的是,当研究人员打乱这些成功设计的字母顺序,在保持相同成分的同时改变其排列时,稳定性消失了。这证实了成功源于字母的特定排列,而非仅仅是化学组成,证明了模型已经学习到了这种语言真正的语法。
研究还表明,该模型可以遵循复杂的指令。科学家可以要求程序生成一个包含特定克隆基序(motif)或排除可能导致问题的特定模式的稳定 RNA 序列。模型在优化稳定性的同时,成功遵守了这些约束条件。这种遵循自然语言命令并产生功能性生物部件的能力,预示着一种工程化生命的新方式。科学家不再依赖实验室中缓慢且昂贵的试错循环,现在可以使用一个统一的系统来预测 RNA 的行为,并设计出满足精确需求的新分子。这项工作证明,一个单一的大规模模型可以弥合理解生物数据与创造新型功能性生物工具之间的鸿沟,为更高效地设计疗法和研究工具开启了大门。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。