Off-Manifold Collapse in Guided Protein Language Models
本文识别了引导式蛋白质语言模型中的一种失效模式——“流形外崩溃”(off-manifold collapse),即强引导会导致产生低复杂度、无法折叠且能欺骗属性预言机的序列,并提出了一种无需训练的“马哈拉诺比斯过滤”(Mahalanobis filtering)后处理步骤,通过针对自然激活统计特性进行过滤,来检测并剔除这些无效候选序列。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
蛋白质是构建并运行每一个生命体的分子机器。它们是由被称为氨基酸的构建模块组成的长链,而这些模块的具体排列顺序决定了链条如何折叠成三维形状。正是这种形状让蛋白质能够发挥功能,无论是消化食物、对抗感染,还是传递信号。几十年来,科学家们一直试图从头设计新的蛋白质,但可能的序列空间如此巨大,以至于寻找一个有用的序列就像在大海捞针。近年来,人工智能提供了一种新的途径。大型计算机模型通过对数百万种天然蛋白质的学习,掌握了这些链条行为的隐藏规则。这些模型现在可以生成看起来和作用起来都像天然蛋白质的新序列,成为创造药物和工业酶的强大工具。
然而,一项新研究揭示了目前科学家尝试微调这些人工智能模型以创造特定新特性(如更高的溶解度或更好的耐热性)时的一个关键缺陷。研究人员发现,当他们过度推动人工智能去实现某种期望的特性时,模型会停止产生真实的蛋白质。相反,它会坍塌到一种状态,即生成的序列对于模型自身的内部逻辑而言看起来像是随机噪声,尽管一个单独的评分系统仍将其评为成功。该团队发现了一种简单且快速的方法,可以在人工智能完成工作后识别出这种失败,从而无需重新训练模型或改变其生成序列的方式,即可过滤掉这些损坏的设计。
问题的产生源于研究人员试图引导这些语言模型走向特定目标。想象一个阅读过所有已知蛋白质序列并理解使它们稳定的微妙模式的模型。科学家可以在生成过程中通过向模型的内部计算添加特定的方向来引导它,有效地告诉它:“让这个蛋白质更具溶解性。”这种被称为“激活引导”(activation steering)的技术非常受欢迎,因为它不需要进行复杂且昂贵的整个模型重训过程。但其中隐藏着代价。当引导力过强时,模型会失去对它所学到的自然模式的掌控。它开始产生在统计学上与随机氨基酸字符串无法区分的序列。
研究人员在测试模型的溶解性时清楚地观察到了这种失败。在轻微引导下,人工智能生成的蛋白质折叠良好且具有改善的溶解性。但随着他们增加引导强度,生成的蛋白质质量骤降。模型开始发出几乎完全由单一氨基酸——甘氨酸组成的超长链。这些链条如此简单且重复,以至于无法折叠成具有功能的形状。然而,用于判断溶解性的计算机程序仍然给这些破碎的链条打出了完美的分数。模型被误导,认为一个随机的、坍塌的序列是成功的,因为评分系统捕捉到了一个恰好模拟了该随机噪声的特定信号。人工智能已经脱离了“流形”(manifold,科学家用来描述所有天然、功能性蛋白质所存在的弯曲表面的术语),并跌入了统计随机性的区域。
为了理解为什么会发生这种情况,团队在模型生成这些序列时观察了模型的内部“大脑”。他们检查了模型为每种氨基酸创建的数学表示。在健康的生成过程中,这些表示会保持在模型从天然蛋白质中学习到的特定数值范围内。当引导过于激进时,这些数值会缩小并向平均值坍塌,失去定义真实蛋白质的独特变化。研究人员发现,这种坍塌是一个可靠的警告信号。甚至在蛋白质序列完全形成之前,模型的内部状态就已经显示出失败的迹象,变得与它只是在随机猜测字母时的状态无法区分。
团队提出的解决方案非常简单,且不需要新的训练。他们开发了一个过滤器,作为对人工智能生成的任何蛋白质的最终检查。在模型完成一个序列的创建后,该过滤器会根据该序列的内部表示相对于天然蛋白质的典型程度计算出一个单一分数。如果分数过低,表明序列已坍塌为随机状态,过滤器就会将其丢弃。如果分数足够高,则保留该序列。这个过程极其快速,处理每个蛋白质仅需一小部分秒数,并且占用极少的计算机内存。它并不改变人工智能生成蛋白质的方式,只是从人工智能产生的优劣堆中筛选出好的那一个。
当研究人员将此过滤器应用于他们的实验时,结果令人瞩目。对于相同的引导强度,经过过滤的蛋白质集比未经过滤的集合具有更高的结构质量。这些蛋白质更有可能折叠成稳定的形状,并且仍然保留了研究人员所寻求的改进特性。该过滤器在不同类型的引导(包括使用梯度来推动模型的技术)下同样有效,证明了该问题并非由单一技术引起。团队展示了通过简单地拒绝那些脱离了自然路径的序列,他们就可以找回那些被人工智能意外埋没在统计噪声之下的高质量设计。
这一发现改变了科学家利用人工智能进行蛋白质设计的方式。它表明,最明显的成功标志——来自属性预测器的高分——是不够的。一个序列可以在计算机测试中获得完美分数,但在结构上却是毫无用处的。研究人员证明,模型的内部状态包含了关于一个设计是真实还是虚假的真相。通过倾听那个内部状态,他们可以分辨出信号与噪声。这项工作并不声称已经完全解决了蛋白质设计问题,也不代表取代了对现实世界实验室测试的需求。相反,它提供了一个实用且低成本的工具,以确保人工智能生成的数字设计确实值得在实验室中进行测试,防止研究人员在那些仅仅是数学幻觉的序列上浪费时间。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。