Preference-based Antibody Expression Ranking: Scaling with Large-scale Weak Supervision
本文提出了一种统一的基于偏好的学习框架,该框架通过改进直接偏好优化(Direct Preference Optimization)以整合稀缺的定量表达数据与大规模的弱免疫监督,从而使蛋白质语言模型能够在数据受限的场景下有效地对抗体可表达性进行排序。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明
想象一下你是一位顶级大厨,正试图为一道深受大众喜爱的菜肴创造完美的全新食谱。在医学世界中,这道“菜肴”就是抗体——一种 Y 形的小型蛋白质,它像超级英雄一样守护我们的免疫系统,猎杀病毒和细菌。科学家们一直在努力设计新的、定制化的抗体来对抗疾病,但有一个巨大的难题:仅仅在纸面上看起来完美的食谱,并不代表它在厨房里真的能“做出来”。有些设计能变成美味、高产的佳肴,而有些则完全失败,甚至根本无法生产。
问题在于,弄清楚哪些食谱可行既昂贵又缓慢。这就像是为了看看食材是否能完美混合而必须去烤一个蛋糕,但你每年只能负担得起烤几个蛋糕的费用。科学家们拥有堆积如山的“也许可行”的食谱(数百万个),但只有极少数“确定可行”的食谱(仅有手把之多)。这篇论文正是针对这一瓶颈展开研究的。它介绍了一种聪明的办法,教计算机如何对这些食谱进行排序——不是通过烤出每一个食谱,而是通过学习由少量已知赢家和大量“可能还可以”的猜测组成的混合数据。目标是把好的食谱从坏的食谱中筛选出来,让科学家们只需专注于最有希望的那些,从而节省时间和金钱,在治愈疾病的竞赛中赢得先机。
更优抗体的食谱
把设计抗体想象成尝试用一种你从未完全掌握的语言来写句子。你有一本由 20 种氨基酸(字母)组成的字典,你需要将它们串联起来组成一个句子(蛋白质),使其产生实际的用途。麻烦在于,你写的多数句子可能是胡言乱语,或者更糟的是,它们看起来像个句子,但在你试图说出来时却毫无意义。在实验室中,这种“是否有意义”的部分被称为表达(expression)。如果一种抗体表达能力不好,它就像是一个要求配方里加“一撮魔法粉末”的食谱——在现实世界中根本行不通。
长期以来,科学家们一直受困于一本微小的食谱。他们拥有几百个食谱,并确切知道每个食谱产生了多少“食物”(产量)。但他们需要测试成千上万个新想法。这篇论文提出了一个绝妙的变通方案:为什么不利用一个庞大的“也许可行”的食谱库来帮助教导计算机呢?
两步走的魔术技巧
作者 Josh Qixuan Sun 及其团队想出了一个两步走的策略,来教计算机如何成为一个更好的食谱评判者。
第一步:“沉浸”阶段
首先,他们采用了一个已经了解蛋白质通用规律的智能计算机模型(一种“蛋白质语言模型”)。然后,他们向该模型喂入了一个包含 420 万条在自然界中发现的抗体序列(具体来自骆驼和羊驼)的庞大库。这些序列就像一大堆“可能还可以”的食谱。我们不知道它们具体的烹饪效果如何,但我们知道它们存在于自然界中,因此它们很可能是安全且稳定的。计算机阅读完所有 420 万条序列,学习如何捕捉优秀抗体的“神韵”,而无需知道确切的产量。这就像一名学生在尝试自己写作之前,先读完一百万部悬疑小说,以感受该流派的氛围。
第二步:“品鉴”阶段
接下来,团队引入了一本名为 Exp-1K 的小型、高质量食谱。这本书只有 1,254 个食谱,但对于每一个,他们都知道确切的分数:即该蛋白质产生了多少量。有些产生了大量蛋白质(高产量),有些产生了一点,大约有 27% 的产量为零。
奇迹就在这里发生。他们并没有直接问计算机,“这个食谱有多好?”(因为在数据如此稀少的情况下很难答对),而是问了一个不同的问题:“如果你必须在食谱 A 和食谱 B 之间做出选择,哪一个更好?”
他们使用了一种叫做*直接偏好优化(Direct Preference Optimization, DPO)*的技术。想象你正在训练一只狗。你不仅仅是说“好狗”或“坏狗”,而是拿着两块零食说:“我更喜欢这一个*而不是那一个*。”计算机由此学习如何对抗体进行排序。
- 强监督: 如果食谱 A 产生了 100 毫克蛋白质,而食谱 B 只产生了 10 毫克,计算机就会学习:“A 比 B 好。”
- 弱监督: 如果食谱 C 来自那个 420 万条的大库(我们不知道它的得分,但它存在于自然界中),而食谱 D 产生的蛋白质为零,计算机就会学习:“C 可能比 D 好。”
通过混合这两类教训,计算机学会了对成千上万个新设计进行排序,将最有希望的设计排在列表顶端。
他们的发现
团队在一组多样化的数据集上测试了他们的方法。他们将这种全新的“偏好”方法与旧的教学方式进行了对比,例如简单的回归(猜测一个数字)或者仅仅是观察数据而不进行任何特殊训练。
结果非常明确:
- “两步走”组合获胜: 使用了庞大的“也许可行”库(第一步)和“品鉴”排序(第二步)的方法始终优于其他所有方法。它在预测哪些抗体会真正奏效以及对它们进行优劣排序方面表现得更好。
- “零样本(Zero-Shot)”表现乏力: 如果他们在没有任何这种特殊训练的情况下直接使用计算机(零样本),其表现非常糟糕。它无法区分一个好的食谱和一个坏的食谱。这表明,仅仅了解蛋白质的“字母表”是不够的;你需要学习抗体表达的特定“方言”。
- 数据越多越好: 他们测试了如果向计算机喂入越来越多的 420 万个“也许可行”的食谱会发生什么。喂入的数据越多,计算机就变得越聪明。它并没有感到困惑,反而变得更睿智了。这表明来自大库的“弱”数据起到了安全网的作用,防止计算机基于极少量的完美数据做出荒谬的猜测。
他们排除了哪些可能
论文还测试了一些最终证明是死胡同的想法:
- 仅仅阅读大库是不够的: 如果他们只做第一步(阅读 420 万个序列),然后尝试在小食谱上使用标准的“猜测数字”方法,效果并不理想。计算机学会了语言,但没有学会如何对食谱进行排序。
- 过多的“弱”数据可能会淹没“强”数据: 他们发现,如果不对训练进行仔细平衡,庞大的“也许可行”食谱库可能会压倒极其微小的“确定性”食谱库。他们必须调节一个旋钮(称为 ),以确保计算机在学习庞大库的同时,仍能给予高质量数据足够的关注。
核心结论
这篇论文表明,我们不需要等待数百万次完美的实验室实验来进行更好的抗体设计。相反,我们可以利用少量高质量实验与大量“可能还可以”的自然数据相结合,来教导计算机如何对设计进行排序。
作者展示了这种方法是解决数据稀缺问题的实用且稳健的方式。它不是一个能瞬间解决一切的魔杖,但它表明,通过改变我们教导计算机的方式(侧重于偏好而非仅仅是数字),我们可以让抗体设计变得更快、更便宜、也更可靠。对于一个好奇的青少年来说,可以把它想象成从一位必须亲自品尝每一道菜的大厨,升级为一位拥有超级智能副厨的大厨,这位副厨可以同时品尝成千上万道菜,并准确地告诉你哪些菜值得上桌。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。