← 最新论文
🧬 biology

Joint optimisation of amino acid and coding sequence for de novo designed proteins

本文介绍了 JANUS,这是一个通过利用逆折叠熵来消除实验缺陷并提高合成成功率,从而同时为从头设计蛋白质设计氨基酸序列和编码序列的联合优化框架,其性能优于将这些任务分开处理的传统方法。

原作者: Anees Ahmed Mahaboob Ali, Radhakrishnan Delhibabu, Everette Jacob Remington Nelson

发布于 2026-09-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Anees Ahmed Mahaboob Ali, Radhakrishnan Delhibabu, Everette Jacob Remington Nelson

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

在微观而静谧的生命世界中,构建蛋白质的指令是用一种双重语言书写的。第一种语言是蛋白质本身,它是由氨基酸组成的链,通过折叠成特定的形状来执行任务,例如像钥匙匹配锁一样,或者像酶一样加速化学反应。第二种语言是基因,即作为该蛋白质蓝图的 DNA 链。数百万年来,自然界一直在编写这些蓝图,每一份天然蛋白质都配有一个经过进化测试和完善的基因。但在现代科学中,研究人员现在正从零开始设计全新的蛋白质,创造出自然界从未造就过的形状。挑战在于,尽管科学家们已经非常擅长构思这些新形状,但他们往往难以构建制造它们所需的基因。基因不仅仅是蛋白质的被动副本;它是一套复杂的指令集,其中字母的具体选择对于基因如何被读取、信息的稳定性以及细胞是否能真正生产出蛋白质而不至于“窒息”至关重要。

对于天然蛋白质而言,基因是一个已知的量,是一个经受住时间考验的可靠伙伴。但对于一种全新的、设计的蛋白质,则没有这样的伙伴。科学家必须从无到有地发明基因。直到现在,标准的方法一直将这两个任务视为两个独立的步骤。首先,计算机设计出完美的蛋白质形状。然后,另一个不同的计算机程序获取这个固定的形状,并尝试寻找构建它所需的最佳基因,并假设蛋白质序列不可更改。本文认为,这种分离是一种错误。研究人员表明,蛋白质序列并不是一个固定的目标,而是一个灵活的目标;通过允许蛋白质序列在设计基因时发生轻微偏移,他们可以解决标准基因设计者无法触及的问题。他们开发了一种新方法,将蛋白质和其基因共同设计,从而找到一个对细胞更友好、更易于制造且更有可能在实验室中奏效的解决方案。

研究人员首先观察了一个包含 862 个蛋白质骨架的海量集合,其中包括其他科学家创造的数百个新设计。他们提出了一个简单的问题:在为特定形状设计基因时,我们究竟拥有多少自由度?他们发现,对于这些新蛋白质中的几乎每一个位置,都有几种不同的氨基酸可以同样完美地适配该形状。事实上,计算机模型显示,对于一个典型的设计,存在着大量的隐藏灵活性,这是一种“微调空间”,即蛋白质可以在不丢失形状的情况下,使用不同的构建模块进行构建。标准方法丢弃了这种灵活性,在考虑基因之前就先选定一个序列并将其锁定。这种新方法——作者称之为 JANUS——保持了这种灵活性。它将蛋白质和基因视为一个单一的、相互连接的谜题,同时搜索两者的最佳组合。

当他们将这种联合方法应用于 447 个已发表的蛋白质设计时,结果令人瞩目。他们发现,99.1% 的这些设计都带有至少一个隐藏的缺陷,即一种可能导致蛋白质在细胞尝试制造它时失败的“负债”。这些缺陷包括序列过于重复、区域过于“粘性”且容易聚集,或是向细胞发出销毁蛋白质的信号。标准的基因优化器只能在保持蛋白质固定的情况下改变基因字母,因此无法修复这些问题。这就像是试图通过仅仅重新排列屋内的家具来修理漏水的屋顶;结构本身才是问题所在。通过允许蛋白质序列发生轻微变化,新方法可以消除这些缺陷。对于他们观察到的五种缺陷类型中的三种,修复这些缺陷的代价极其微小,仅需对整体设计进行极小的改动即可。

最令人惊讶且具有实际意义的发现并非关于蛋白质的生物学特性,而是关于制造它的物流问题。为科学家合成基因的商业公司有着严格的规则,它们不会制造某些字母模式的基因,因为这些模式难以制造或容易出错。研究人员发现,当他们使用先设计蛋白质后设计基因的旧方法时,生成的基因在超过一半的情况下违反了这些制造规则。当他们使用新的联合方法时,违规次数减少了一半以上。这意味着,一个此前会被供应商拒绝制造的基因,现在可以被订购和构建。这是一个关键的瓶颈:如果一个基因无法被订购,项目在进行生物学测试之前就会停滞。新方法本质上为这些新蛋白质从计算机走向现实世界扫清了障碍。

研究还探讨了蛋白质序列究竟需要改变多少才能获得这些益处。他们发现,对于绝大多数设计,该方法只需要更换极少数的氨基酸就能取得显著的改善。事实上,他们证明了极小的灵活性就足以捕捉到几乎所有的潜在改进。这表明,“完美”的蛋白质序列并不是一个单一、僵硬的点,而是一个拥有许多优选方案的景观。联合方法只是找到了那个让蛋白质稳定、基因易读且满足制造规则的景观中的最佳位置。他们还测试了这种方法在不同类型的细胞(如细菌与人类细胞)中是否同样有效,发现该方法能成功适应两者,尽管所需的具体变化各不相同。

尽管取得了这些成功,研究人员也谨慎地指出,在哪些方面该方法并未提供巨大的优势。对于控制蛋白质生产启动速度的基因特定部分,他们发现大部分改进可以通过仅改变基因字母而不触动蛋白质来实现。这证实了对于某些任务,旧有的方法仍然相当出色。然而,对于涉及蛋白质稳定性及其与细胞清理系统相互作用的更广泛问题,联合方法是必不可少的。研究结论认为,蛋白质设计领域一直将基因视为次要的附属品,但对于从头合成(de novo)蛋白质而言,基因是一个主要的约束条件。通过同时解决蛋白质和基因的问题,科学家可以创造出不仅在理论上成立,而且在实践中可行的设计,从而将更多的数字创造物转化为真实的、工作的分子。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →