Natural-Language-Guided Generator-Agnostic Shortlisting for Protein Binder Design
本文表明,大型语言模型能够生成可解释的多指标排序策略,通过利用预计算的结构和界面质量评分,从大型设计池中有效地筛选出顶尖蛋白质结合候选者,其表现优于单特征基准模型。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在现代设计新药的探索过程中,科学家们正越来越多地转向利用计算机从头开始发明蛋白质。这些定制的分子被称为“结合剂”(binders),它们被设计用来紧紧锁住特定的致病靶点,就像钥匙契合锁孔一样,以阻止病毒或修复受损细胞。创造这些分子的过程已变得异常迅速;强大的计算机程序现在可以在单次运行中生成数千个潜在的结合剂设计。然而,一个显著的瓶颈仍然存在:虽然计算机可以产生如此大量的设计,但进行测试的物理实验室只能处理极小的一部分。在实验室中测试每一个候选者既昂贵又耗时,因此研究人员必须从生成的数千个设计中挑选出一小组高质量的设计。核心挑战不再仅仅是如何做出这些设计,而是如何从这数千个设计中找出哪几个才是真正值得进行实验测试的。
这正是该研究团队致力于解决的问题。他们并没有试图制造一台更好的生产蛋白质的机器,而是将注意力集中在随后的步骤上:筛选过程。他们提出了一个疑问:一种被称为“大语言模型”的、以理解和生成人类语言而闻名的人工智能,是否可以充当一个智能过滤器。他们的目标是观察这些人工智能系统是否能够观察每个候选者的预计算评分——这些评分估算了蛋白质的稳定性以及它与靶点结合的效果——并据此编写一条自定义规则来进行排名。他们不想依赖于一个单一且僵化的公式(即对每个蛋白质靶点都采用同样的处理方式),而是希望看看人工智能是否能学会根据具体的任务来不同地权衡各种线索。
研究人员收集了来自十个不同蛋白质靶点的数据,每个靶点都拥有一组已经在真实实验室中经过测试的计算机生成结合剂设计。对于每一个设计,他们都拥有一组由十七个不同数字组成的质量预测值,例如计算机对结构能否保持稳定的信心程度,或者两个分子之间的表面匹配程度。随后,他们要求人工智能观察这些数字并提出一种排名策略。这种策略本质上是一套指令,告诉计算机应该关注哪些数字以及应该给予每个数字多少重要性。人工智能可以选择只关注一个评分,也可以将多个评分结合起来,为每一个评分分配不同的权重,从而为每个候选者创建一个最终得分。
结果显示,人工智能生成的规则是有效的。当研究人员使用人工智能从每个候选池中挑选前十名候选者时,它成功识别出的实际有效结合剂的比例高于仅使用单一最佳传统评分的方法。具体而言,当查看前十名选择时,人工智能的方法在约 59% 的情况下找到了正确的结合剂,相比之下,表现最好的单一评分法找到它们的概率约为 57%,这是一个虽小但具有意义的提升。研究表明,人工智能并非只是在瞎猜;它学会了如何结合不同类型的证据。它始终依赖于来自最可靠预测工具的核心置信度评分,但也根据每个蛋白质靶点的独特特征进行了特定的调整。对于某些靶点,它增加了对分子形状匹配程度的权重;而对于另一些靶点,它则优先考虑不同的稳定性指标。
至关重要的是,研究发现人工智能适应每个特定靶点的能力是关键所在。当人工智能被允许观察单个靶点的特定候选池并据此调整其规则时,它在对候选者进行正确排序方面的表现甚至更好,确保了最优秀的设计排在列表的最顶端。这种方法并不是要取代现有的用于生成评分的工具,而是作为一层灵活的覆盖层作用于其上。研究人员得出结论,利用人工智能来综合这些排名规则提供了一种实用且易于理解的方法,用以缩小庞大的候选名单。通过创建一个能够解读多种信号组合的决策层,科学家们可以对哪些设计值得进入实验室进行下一步研究做出更好的选择,从而在无需改变底层设计机制的情况下,潜在地加速新疗法的发现进程。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。