Task- and dataset-specific information in protein language models
这项研究表明,对于蛋白质语言模型下游任务而言,最具信息量的嵌入表示通常存在于中间层而非最后一层,且最优层数取决于任务涉及的是单个残基、整个蛋白质还是人工序列。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明
想象一下,你拥有一座巨大的、充满魔力的图书馆,其中的每一本书都是构建一种被称为“蛋白质”的生命机器的食谱。多年来,科学家们一直试图教会计算机阅读这些食谱并理解这些机器的功能。为了实现这一目标,他们构建了“蛋白质语言模型”(PLMs)。你可以把这些模型想象成超级聪明的学生,他们已经阅读了数十亿份蛋白质食谱。他们不仅仅是在死记硬背单词,还在学习这种语言隐藏的语法和风格。学习完成后,这些学生可以将一个蛋白质的食谱转化为一种秘密代码(即“嵌入/embedding”),其他计算机可以利用这种代码来预测各种事情:这个蛋白质会发光吗?它会粘附在病毒上吗?它会在水中溶解吗?
长期以来,人们一直假设这些学生模型最“聪明”的部分位于它们大脑的最末端——即最后一层。这就像是假设在读完一整本书后,你读到的最后一句句子承载了最重要的意义。但如果最有用的线索其实隐藏在书的中间,甚至在前几页呢?这篇论文提出了一个简单但棘手的疑问:在这些庞大的 AI 大脑中,真正的魔力究竟发生在何处?我们真的需要通过观察最后一层来获得最佳答案吗,还是说,由于忽略了中间层,我们正在错过一些重要的东西?
这项研究背后的研究人员决定扮演侦探的角色。他们选取了 13 种不同的蛋白质学习模型,并在 15 种不同的任务上对其进行了测试,这些任务涵盖了从预测蛋白质的稳定性到确定它在细胞内哪个位置等各种领域。他们不仅观察了最终答案,还深入观察了模型思考过程中的每一个步骤,从第一层一直到最后一层。
以下是他们的发现,事实证明,旧有的“最后一层是最好的”这一规则大多是错误的。
中间往往是“黄金地带”
当科学家们在涉及整个蛋白质的任务(例如预测蛋白质是否具有溶解性或它在细胞中的位置)上测试这些模型时,他们发现最后一层很少是赢家。相反,“最佳”层通常位于模型的中间位置——通常在模型深度的第 10 到第 90 个百分位之间。这就像是学生读完了书,在中间章节理解了主线剧情,但到了最后一页时,就开始变得困惑或过度分析了。事实上,对于许多任务来说,性能反而会在最深的层级中下降。
取决于你在问什么
研究发现,“最佳”层对于每项工作来说并不相同。这很大程度上取决于你使用的数据类型:
- “突变”数据集: 当数据来自“深度突变扫描”(即科学家对一个特定的蛋白质进行数千次微小的、略有差异的修改)时,模型在使用浅层、早期层级时表现最好。看起来,早期层级擅长捕捉细小的、局部的细节,比如改变一个字母如何改变一个词的含义。
- “多样化”数据集: 当数据来自大量不同且互不相关的蛋白质的巨大混合体(比如一个包含数千本不同书籍的图书馆)时,模型在使用深层层级时表现得更好。在这里,模型需要理解适用于许多不同蛋白质的大型、通用的规则,这需要更多的“思考”和更深的层级才能理清。
“人工”问题
一个最令人惊讶的发现是关于“人工”蛋白质的。研究人员测试了由计算机而非自然界设计的蛋白质。模型在处理这些蛋白质时表现得非常吃力。即使这些人工蛋白质具有功能,模型也无法很好地预测它们的特性。这表明,这些 AI 模型已经学会了理解自然进化的“语言”,但它们尚未完全掌握计算机设计的蛋白质“语言”。它们精通古老的方言,却在面对新的俚语时踉跄跌倒。
为什么最后一层并不总是王者
论文解释了为什么会发生这种情况。这是由这些模型的训练方式决定的。它们首先被训练去猜测句子中缺失的单词(这是一个专注于局部细节的任务)。当你要求它们执行一个宏观任务(如预测整个蛋白质的稳定性)时,最后一层仍在试图完成那个“猜小词”的工作,这干扰了整体判断。然而,如果你针对宏观任务对模型进行“微调”(fine-tuning),那么层级的运作就会变得更有序,最后一层会再次变得最有用。但在标准的预训练状态下,中间层往往蕴藏着金矿。
总结
这项研究表明,科学家们在进行工作时,不应该盲目地直接抓取蛋白质 AI 模型的最后一层。相反,他们应该深入探索模型的“大脑”,以找到与特定任务相匹配的那一层。如果他们研究的是微小的突变,就应该看早期层级;如果他们研究的是多样化的蛋白质混合体,就应该看更深的层级。此外,如果他们处理的是计算机设计的蛋白质,必须格外小心,因为模型对这类蛋白质的理解可能不如对自然创造物的理解那样深刻。
简而言之,这篇论文揭示了这些 AI 模型是复杂且具有层次感的思考者,而它们大脑中最“聪明”的部分会随着你提出的问题而改变。书的最后一页并不总是最重要的那一页;有时,最好的答案就在中间。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。