想象一下,你的免疫系统就像一支在人体边界巡逻的高级训练有素的安保部队。它的职责是发现入侵者——病毒、细菌或癌细胞——并拉响警报。为了做到这一点,保安们(T细胞)需要看到入侵者的面孔。但保安们并不能直接看到入侵者;他们看到的是入侵者留下的微小碎片,称为肽段(peptides),这些碎片被展示在每个细胞表面的一个特殊公告牌上。这个公告牌被称为主要组织相容性复合体,即 MHC。
问题在于,可能存在的肽段碎片有数十亿种,而公告牌也有数千种不同的形状(等位基因),每种形状都有其独特的“口味”,决定了它喜欢展示什么样的碎片。这就像是试图预测哪一个特定的拼图块能放入那个巨大的、不断变化的拼图中的特定插槽中。科学家们一直在开发计算机程序来猜测这些匹配情况,但这些程序大多是基于一种特定的数据进行训练的:质谱技术(mass spectrometry)。把质谱技术想象成一台高科技相机,它拍摄的是当前悬挂在细胞内公告牌上的肽段。它很出色,但也有盲点。它会遗漏某些类型的碎片,而且无法轻易看到那些“不匹配”的碎片。与此同时,一些新的、更快速的实验正在涌现,它们可以一次性测试数百万个碎片,但它们观察拼图的角度略有不同。大问题在于:我们如何教我们的计算机程序从这些新的、更快的实验中学习,而不至于忘记它们从那台高科技相机中学到的所有知识?
这时,由 Chati 及其同事引入的一个名为 PepCL 的聪明的新框架出现了,它就像是这些计算机模型的“重来”按钮。研究人员意识到,仅仅用新数据重新训练模型就像是通过只说一种语言来学习一门新语言一样;你可能会精通这门新语言,但你会忘记你的母语。相反,他们开发了一种称为**持续学习(continual learning)**的方法。想象一个正在为数学考试复习的学生。通常情况下,如果他们开始学习历史,他们可能会忘记数学公式。但有了 PepCL,这个学生在学习历史时,会被给予一份旧数学题的“小抄”(重放数据/replay data)。每当他们回答一个历史问题时,他们也会看一眼那份数学小抄,以确保自己没有忘记旧的规则。
该团队构建了一个名为 MHCPrime 的新型超灵活模型来充当这个“学生”。然后,他们使用 PepCL 用来自各种新实验(包括酵母展示技术和 EpiScan)的数据来更新这个模型。结果令人印象深刻:模型学习了这些新实验中的特定细节(例如如何识别旧相机错过的那些棘手的、疏水性的肽段),但并没有丧失预测真实人体细胞内发生情况的能力。事实上,当他们尝试使用旧的标准方法(称为“微调/fine-tuning”)来更新模型时,模型变得“困惑”了——它对新实验表现得很出色,但对旧实验的表现却变得很差——这种现象被称为“灾难性遗忘(catastrophic forgetting)”。然而,PepCL 保持了这种平衡,这表明我们可以在不抹除硬盘的情况下,利用新数据来升级我们免疫系统的“面部识别”软件。这种方法可以帮助科学家设计更好的疫苗和癌症疗法,通过让这些预测工具变得更聪明、更具适应性,从而应对新科学工具的发明。
技术摘要:PepCL —— 一种用于肽-MHC模型的基于重放的持续学习框架
问题陈述
预测肽-主要组织相容性复合物(MHC)I 类结合对于疫苗设计和免疫疗法至关重要,但由于存在超过 40,000 种 MHC 等位基因,面临着组合挑战。虽然质谱(MS)已为预测器提供了最大的数据集进行训练,但 MS 衍生的配体组是不完整的且具有偏差,低估了特定的序列类别(例如含有半胱氨酸或高度疏水性的肽),并且未能捕捉到非结合体。新兴的实验检测方法(例如酵母展示、EpiScan、结合亲和力、ESCAPE-seq)提供了互补的数据,包括经过实验验证的非结合体和连续读数。然而,现有的肽-MHC 预测器通常以固定版本模型的形式发布。整合这些新的、正交的数据源通常需要重新进行全量训练或常规微调(FT)。微调往往会导致“灾难性遗忘”,即模型会过度特化于新检测方法特有的偏差和分布,从而覆盖掉从 MS 数据中学习到的具有生物学基础的内源性肽类呈现的宝贵知识。
方法论
为了解决适应新数据与保留先验知识之间的权衡问题,作者引入了 PepCL(肽-MHC 持续学习),一种基于重放的持续学习框架。
- MHCPrime 骨干网络: 作者开发了 MHCPrime,这是一个全新的、最先进的、泛等位基因的、基于 Transformer 的模型,在 MS 洗脱配体(EL)数据上进行了训练。与闭源集成模型(如 HLApollo)不同,MHCPrime 是开源的、经过 GPU 优化的,并设计为可以直接访问参数、逻辑值(logits)和梯度,以促进持续学习。它采用双编码器架构(肽和 MHC 伪序列),通过 Conformer 和 Transformer 模块结合了生化特征和局部上下文。
- PepCL 框架: PepCL 通过结合三种机制来更新预训练的 MHCPrime 模型:
- 新数据更新: 模型在传入的检测数据(例如酵母展示、EpiScan)上进行训练。
- 数据重放: 在更新过程中,交替使用原始 MS 训练数据的批次,以提供能够抵消新数据分布的梯度。
- 漂移正则化: 保留一个冻结的预训练模型副本。如果更新后的模型在重放数据上的预测与冻结模型的预测发生显著漂移,则会对该模型进行惩罚(通过对逻辑值进行均方误差计算)。该惩罚由超参数 λ 控制。
- 训练目标: 该框架结合了来自新数据和重放数据的分类损失(使用用于排序的可微 Smooth-AP 损失)以及漂移正则化损失。对于具有连续读数的检测(例如结合亲和力、ESCAPE-seq),对新数据使用可微软排序损失,同时对重放集保持分类损失。
关键结果
作者在包括传染病和癌症在内的多种生物学背景下,利用多种检测模态评估了 PepCL 和 MHCPrime。
- 基准模型性能: MHCPrime 在留出的 MS 基准测试中实现了最先进的性能,匹配或超过了像 HLApollo 这样的闭源集成模型,同时它是一个单一的、非集成的模型。然而,与其他的 MS 训练模型一样,它在非 MS 数据集上的表现较差。
- 缓解灾难性遗忘: 在使用新的 MS 子集或特定基序簇进行更新的受控实验中,常规微调(FT)导致了在原始数据上性能的严重退化(遗忘)。PepCL 成功地整合了新信息,同时保留了在原始 MS 分布上的性能。
- 检测适应性: 当使用非 MS 数据(酵母展示、EpiScan、结合亲和力、ESCAPE-seq)进行更新时:
- FT 提高了在目标检测上的性能,但导致了在 MS 基准和相关领域上的不成比例的损失。
- PepCL 在获得新检测性能提升的同时,保留甚至提高了在 MS 基准上的性能。
- PepCL 展示了从“硬负样本”(例如在 EpiScan 重训练库中)和连续读数中学习的卓越能力,且不会过度拟合于检测特有的人工偏差。
- 跨等位基因迁移: 一个重要的发现是,PepCL 能够将检测衍生的信号迁移到不在更新集中的等位基因上。通过利用 MHCPrime 的泛等位基因表示,该框架提高了对未见等位基因的预测能力,而 FT 往往会降低这些等位基因在原有 MS 领域的性能。
- 保守适应: 对序列基序的分析表明,虽然 FT 完全吸收了检测特有的偏差(例如,由于特定突变,酵母展示中放宽了 C 端约束),但 PepCL 对这些信号的吸收更为保守,始终锚定在具有生物学意义的 MS 衍生结合偏好上。
意义与主张
论文声称,PepCL 建立了一个灵活的框架,用于扩展肽-MHC 模型在检测方法演进过程中的效用。作者认为:
- 持续学习是必要的: 该领域必须从静态的一次性训练转向可更新的框架,以便在不丢弃先验知识的情况下整合新的实验证据。
- 平衡的适应性: PepCL 提供了一种受控机制,用于吸收来自不同检测(这些检测通常具有不同的偏差和终点)的互补信息,同时防止与常规微调相关的过度特化和灾难性遗忘。
- 临床相关性: 通过保留 MS 先验(反映了内源性细胞呈现)并整合新信号,PepCL 为临床应用(如新抗原优先排序和疫苗设计,其中准确预测自然呈现至关重要)提供了一条更稳健的路径。
- 可扩展性: 该框架允许将有限等位基因的检测数据传播到更广泛的泛等位基因空间,解决了许多具有临床相关性的等位基因数据稀疏的问题。
作者总结道,肽-MHC 预测的进展将不仅取决于模型架构,还将越来越依赖于像 PepCL 这样能够随着新数据集出现而提供实际路径、扩展预测覆盖范围的框架。
每周获取最佳 bioinformatics 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。