Unlocking Multimodal Protein Language Models at Inference Time
本文建立了一个三阶段框架,旨在通过经验性地证明优化多模态蛋白质语言模型的推理时采样策略——具体通过任务特定的无分类器指导和奖励引导的束搜索——可以在无需模型重训练的情况下显著提升多种任务的性能,同时也对先前关于基础模型行为的共识提出了挑战。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
蛋白质是维持生命运转的分子机器,它们折叠成复杂的、三维的形状,以在每个细胞内执行必要的任务。构建这些机器的指令是用二十种不同的氨基酸组成的简单链条编写而成的,但这种线性代码与最终的功能性形状之间的关系,是生物学中最深奥的谜题之一。几十年来,科学家一直依赖复杂的计算机模型来预测一段氨基酸序列将如何折叠,或者从头设计全新的蛋白质。最近,新一代人工智能模型的出现,将字母序列和三维结构视为一种统一的语言。这些模型可以生成新的蛋白质,但直到现在,研究人员主要关注的是如何训练它们,并假设计算机在最终生成步骤中如何“阅读”其自身答案的过程是一个已解决的问题。
来自香港的一个研究小组发现,这一假设是不正确的。他们发现,从这些强大的模型中提取最终蛋白质设计的方法,与训练本身一样至关重要。通过系统地测试在生成阶段引导计算机决策过程的不同方法,该团队表明,他们可以在不改变模型底层代码的情况下,显著提高所产生蛋白质的质量。他们的工作揭示了这些模型使用的默认设置往往会导致次优的结果,但通过调整计算机探索可能性与致力于特定路径的方式,他们可以释放出足以媲美甚至超越针对单一任务设计的专门工具的性能。
研究人员首先检查了这些模型目前的运作方式。想象一下,一个模型试图构建蛋白质的过程就像是在逐渐填充一张空白画布,它从一个完全被遮盖的图像开始,然后逐步揭示氨基酸及其位置。该团队在四项基本任务中测试了三种不同的模型:创建全新的蛋白质、设计围绕特定功能部分进行工作的蛋白质、根据序列预测蛋白质的形状,以及设计能够折叠成给定形状的序列。他们首先查看了基本的“香草”(vanilla)设置,即模型用于做出这些决策的标准、开箱即用的指令。他们发现,默认设置通常与手头的特定任务不匹配。例如,当被要求设计一种全新的蛋白质时,模型需要以高度的随机性来探索广泛的可能性,以找到稳定的结构。然而,当被要求预测已知蛋白质的形状时,模型则需要更加精确和确定,紧密遵循已知的约束条件。
通过运行数千种这些基本设置的变体,该团队找到了每项任务的最佳“配方”。他们发现,仅仅是从僵化的、循序渐进的方法转向更灵活的、同步的方法,就能让模型生成远为可行的蛋白质。在涉及创建新蛋白质的一个特定案例中,一个此前在默认设置下被认为较弱的模型,在调整了采样策略后,突然产生了近三倍的功能性设计。这一发现挑战了普遍观点,即某些模型本质上是较差的,而是表明它们只是在使用错误的工具处理任务。
随后,研究人员引入了第二层控制,即引入一种类似于轻微推动以引导模型走向更好结果的技术。在蛋白质设计的语境下,这意味着将模型针对特定目标的猜测与在没有该目标情况下的猜测进行比较,然后放大两者的差异,从而推动结果向预期目标靠拢。这种被称为“无分类器引导”(classifier-free guidance)的方法被证明是一个强大的杠杆。对于从头设计新蛋白质的任务,这种引导帮助模型避免了重复、不自然的模式,并产生了显著更稳定且更多样化的结构。这种改进非常显著,一个此前被视为基准表现者的模型,在默认设置下突然超越了其竞争对手,尽管在进一步优化之前,它仍落后于专门化系统。
最后,该团队探索了第三种关注大局而非仅仅关注下一步的策略。该策略不再是遵循单一路径走向解决方案,而是指示计算机同时生成多个不同版本的蛋白质,就像在地图上保留几条潜在路线一样。在定期的时间间隔,系统会根据结构的整体质量评估哪些路径看起来最有希望,然后剪掉较弱的选择,仅带着最好的候选者继续前进。这种“束搜索”(beam search)方法使模型能够逃离那些可能导致停留在平庸解决方案中的局部陷阱。当应用于最强大的模型时,这种策略将性能推向了新的高度,实现了甚至超越了此前被认为更优越的专门系统的成功率和设计质量,且无需任何额外的训练或外部数据。
研究结论指出,这些模型在生成时刻的使用方式是一个被很大程度上忽视了的隐藏变量。研究人员证明,通过仔细调节探索新可能性与利用已知优选方案之间的平衡,他们可以一致地提升这些模型的整体性能。这项工作表明,当前蛋白质语言模型的潜力被低估了,并不是因为模型本身存在缺陷,而是因为解锁其答案的方法未经过优化。通过改进这些推理策略,科学家们现在可以从现有的工具中获得更多的价值,从而在无需从头构建全新模型的情况下,加速新药物和生物材料的发现。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。