想象一下,你正在尝试设计一把定制的钥匙(一种多肽),使其能够完美地契合特定的锁(一个靶蛋白或抗原)以开启大门。这正是许多新药发挥作用的方式。然而,这里有一个难点:使钥匙契合锁具的特征,往往也让它变得危险。例如,一把钥匙可能由一种能很好抓紧锁具的材料制成,但这种材料也会撕裂锁孔(损伤健康细胞)或使锁完全溶解(导致毒性)。
在过去,科学家们必须通过不断试错,或者使用缓慢且复杂的计算机程序来寻找既能契合锁具又不会造成破坏的钥匙。
Pepti-drift 是一种全新的、超快速的计算机方法,它通过将设计过程处理成一场“磁力导航”游戏来解决这个问题。
问题所在:重叠区
想象一张地图,上面的“好钥匙”(能契合锁具的钥匙)和“坏钥匙”(有毒性的钥匙)生活在同一个社区。它们靠得如此之近,以至于如果你仅仅瞄准“好”社区,就会不小心把“坏”的部分也带上。
- 旧方法 就像是一个蒙着眼睛走向“好”标志的人。他们会接近锁具,但因为不知道危险区域在哪里,往往会被“坏”的东西绊倒。
- 挑战: 你需要同时实现一个目标——既要把钥匙拉向锁具,又要把它推离危险。
解决方案:磁力漂移
Pepti-drift 使用了一种被称为**“毒性排斥漂移”**的巧妙技巧。把它想象成一个带有两种相反力量的 GPS 导航系统:
- 磁铁(吸引力): 一个强力磁铁将设计方案拉向“好钥匙”(那些能与靶点结合的钥匙)。
- 排斥器(排斥力): 一个强力排斥器将设计方案推离“坏钥匙”(有毒性的钥匙)。
该系统不仅仅是猜测;它计算出一条单一且完美的路径,让设计方案直接滑动进入“安全区”——这是一个狭窄的地带,在这里,钥匙既能完美契合锁具,又能远离危险。
“热身”策略
这里最棘手的部分在于:如果你在刚开始时就同时开启磁铁和排斥器,计算机就会感到困惑。这就像是在教一只狗坐下的同时,又在命令它跳起来;这些冲突的指令会让它原地打转。
论文介绍了一种**“热身”**策略:
- 阶段 1: 首先,计算机只学习跟随磁铁走向“好钥匙”。它学习锁具的基本形状。
- 阶段 2: 一旦它知道了“好”在哪里,它就会慢慢开启排斥器,以推开“坏”的部分。
这种循序渐进的方法确保了计算机不会产生混乱,并能找到一条稳定且安全的路径。
为什么它意义重大:速度与安全性
论文声称 Pepti-drift 在两个方面实现了巨大的飞跃:
速度极快:
- 与之前的最佳方法 (PepMLM) 相比,Pepti-drift 快了 16 倍。
- 与另一种方法 (PepTune) 相比,它快了 1,000 多倍。
- 类比: 如果说旧方法是像步行穿越城市去寻找钥匙,那么 Pepti-drift 就像是瞬间传送到了那里。它可以在其他方法制作出少量候选药物的时间内,生成数以千计的候选方案。
更安全、更智能:
- 无毒性: 它生成的钥匙极不容易具有“毒性”(对细胞有害)或引起“溶血”(导致红细胞破裂)。
- 独特的设计: 它不仅仅是复制粘贴旧的钥匙。它能创造出高度独特的设计,这些设计针对特定的目标锁具,避免了“复刻”问题(即不同的锁得到相同的通用钥匙)。
- 有效性: 它生成的每一个钥匙都是真实的、可用的氨基酸序列(100% 有效)。
核心结论
Pepti-drift 是一种通过学习在单一步骤中**“向目标拉近”并“向危险推开”**来设计药物候选物的全新工具。它的速度如此之快,安全性如此之高,以至于它可以在以前筛选几个候选药物的时间内,帮助科学家筛选数百万种潜在药物,同时确保这些候选药物不太可能对人体产生危害。
技术摘要:Pepti-drift
问题陈述
治疗性多肽的设计面临着一个根本性的权衡:促进强抗原结合的理化特征(如高正电荷、膜亲和力)往往与导致毒性的特征(如细胞毒性和溶血作用)存在重叠。在学习到的表示空间中,结合肽与毒性肽经常占据重叠区域。因此,仅针对结合进行优化的生成模型往往会产生位于这一“重叠区”的候选序列,导致这些序列虽然是有效的结合剂,但具有显著的安全风险。现有的方法如 PepMLM(掩码语言模型)缺乏明确的规避毒性的机制,而像 PepTune(带有蒙特卡洛树引导的离散扩散模型)这样的方法虽然纳入了安全性约束,但由于迭代采样导致计算成本高昂,限制了大规模抗原筛选的可扩展性。
方法论
Pepti-drift 是一个具有毒性感知能力的、抗原条件的潜空间细化框架,旨在通过单次前向传播生成多肽候选序列。它在一个由冻结的 ESM-2 蛋白质语言模型导出的共享、归一化的潜空间内运行。
1. 表示与架构
- 潜空间: 抗原和多肽序列由 ESM-2 进行编码,并投影到一个紧凑的 ℓ2 归一化嵌入空间(dz=1024)。这种归一化确保了距离受余弦相似度控制,防止向原点塌陷。
- 单步生成: 与迭代扩散模型不同,Pepti-drift 通过单步生成多肽。一个抗原条件的生成器将高斯噪声映射到初始潜变量 z0。随后,一个学习到的**漂移模块(drift module)**通过单次向量场更新将 z0 精炼为最终潜变量 z1:z1=z0+ηΔ。
- 解码: 一个非自回归 Transformer 解码器从 z1 并行预测整个多肽序列,消除了自回归解码的延迟。
2. 漂移机制:吸引与排斥
其核心创新在于构建了一个包含两个相反分量的向量场 V:
- 吸引 (Vatt):将生成的潜变量拉向已知抗原匹配结合肽的嵌入(正向教师)。
- 排斥 (Vrep):将潜变量推离与细胞毒性和溶血作用相关的“硬负样本”多肽的局部邻域。
漂移场定义为 V=Vatt+Vrep。排斥项由核温度和随时间变化的系数 α−(e) 进行加权。
3. 训练策略:预热负向排斥
一个关键的挑战是,当模型尚未学习到稳定的潜空间结构时,吸引和排斥信号可能会产生竞争性的梯度,尤其是在结合与毒性分布存在重叠的情况下。为了解决这个问题,Pepti-drift 采用了预热调度(warm-up schedule):
- 阶段 1: 将排斥系数 α− 设置为零。模型学习向抗原兼容的结合区域移动的稳定轨迹。
- 阶段 2: 一旦建立了面向结合的轨迹,则逐渐增加 α−,引入毒性排斥信号。这使得模型能够先学习“向何处移动”,然后再学习“应避免什么”。
核心贡献
- 潜空间漂移框架: 一种单步生成模型,它将学习到的向量场分解为吸引成分(结合)和排斥成分(毒性),无需迭代采样即可产生目标兼容且具备安全性感知能力的多肽。
- 预热负向排斥: 一种在结合与毒性分布重叠时稳定学习过程的训练策略,使模型能够在相互竞争的目标之间学习兼容的漂移。
- 高效、可扩展的生成: 一个将安全性约束在几何层面编码进生成过程的框架,实现了比现有基准模型高出数个数量级的速度提升。
结果
在抗原级拆分控制的基准测试上(使用 CD-HIT 确保测试集中的抗原簇在训练期间未被见过),Pepti-drift 展示了以下结果:
- 计算效率: Pepti-drift 比 PepMLM 快 16.2×,比 PepTune 快 1,092.0×。它每秒生成约 3,312 个多肽,而 PepTune 仅为每秒约 3 个。
- 序列质量: 生成的多肽实现了 100% 的有效性、98.1% 的唯一性,并具有对比模型中最高的香农熵。至关重要的是,它表现出近乎为零的跨抗原重复使用率 (0.27),表明其具有极高的抗原特异性,而 PepTune (252.30) 和 PepMLM (12.36) 则显著更高。
- 结合倾向: 虽然 Pepti-drift 的预测结合亲和力得分略低于 PepMLM,但仍显著高于 PepTune,这表明毒性排斥并未抹除与目标相关的结合信号。
- 安全性概况:
- 溶血作用: 在大多数多肽长度区间内,Pepti-drift 的预测溶血风险较低或持平。在 1–5 aa 区间,它实现了最低得分 (0.102),优于 PepMLM (0.169) 和 PepTune (0.185)。
- 毒性: 在所有长度区间内,它始终比 PepMLM 具有更低的预测毒性得分,在长肽中降幅尤为显著(例如,21–40 aa 为 0.239 vs 0.352)。
- 验证: 使用 HemoPI2 进行的独立评估证实了这一趋势,显示出 Pepti-drift 相比 PepMLM 具有更低的平均溶血得分和更低的溶血阳性比例。
重要性与主张
论文声称 Pepti-drift 提供了一个快速、可扩展且可控的框架,用于抗原特异性多肽设计。通过将多肽生成表述为单步潜空间漂移,它直接将“安全且活跃”的特性编码进生成轨迹中,而不是依赖于事后过滤或计算昂贵的迭代优化。
作者强调,预热负向排斥对于在结合与毒性分布重叠时稳定训练至关重要,这是多肽表示空间中的常见场景。结果表明,抗原条件的潜空间漂移可以成功地应对结合-毒性的权衡,生成多样、有效且具有抗原特异性的候选序列,同时降低预测的毒性和溶血风险。论文总结道,这种方法代表了迈向可扩展治疗性多肽发现的重要一步,尽管作者也指出,仍需通过实验验证其结合活性和生物安全性。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。