技术摘要:PerturbPFN
问题陈述
预测对未见化学扰动的细胞反应是药物发现中的一个核心挑战。与离散的遗传编辑(如 CRISPR)不同,小分子药物引入了复杂的干预,其靶点、通路和机制往往是未知、依赖于上下文或仅被部分捕获的。目前的预测模型面临三个主要障碍:
- 未知机制: 需要从观测到的响应数据中推断潜在的原子靶点和机制,而不是依赖于预定义的靶点。
- 泛化能力: 小分子的理论设计空间远超物理筛选能力,要求模型能够泛化到未见的扰动,而不仅仅是在已知药物之间进行插值。
- 现有范式的局限性:
- 非结构化黑盒模型 学习统计偏移,但缺乏可解释性。
- 结构化机制模型 提供可解释性,但通常依赖于特定实例的优化或针对数据集的拟合,限制了其在异构上下文(例如不同的细胞系或批次)中分摊知识的能力。
- 基础模型 在大规模真实世界数据(如 scGPT, GenePT)上进行预训练,学习鲁棒的表示,但可能无法显式地建模干预的因果传播。
方法论
作者提出了 PerturbPFN,一种基于先验数据拟合网络(PFN)风格的框架,旨在通过层次化合成结构因果模型(SCM)先验实现扰动效应的摊销推断(amortized inference)。
1. 理论框架
该方法将系统建模为一个 SCM M={G,θ},其中 G 是代表基因调控关系的有向无环图(DAG),θ 参数化局部机制。
- 偏移干预(Shift Interventions): 不同于硬干预(移除对父节点的依赖),PerturbPFN 将扰动建模为局部机制的加性偏移:xi=fi(xGi;θi)+ψi+ϵi,其中 ψi 是针对目标节点 I 的干预强度。
- 情节式预测(Episodic Prediction): 任务定义为给定上下文观测 Dctx 时,预测查询机制 γj 的后验预测分布 p(xj∣γj,Dctx)。该模型通过推断潜在图 G、干预目标 I 和强度 ψ 的点估计来近似这一过程。
2. 层次化合成先验
PerturbPFN 完全在先验预测的合成情节上进行训练,无需在训练期间使用真实的扰动响应。
- 图生成器(Graph Generator): 采样具有模块化结构的基因调控网络(GRNs),以诱导异构的无标度拓扑结构。
- 扰动生成器(Perturbation Generator): 描述符 γ 生成稀疏的原子靶点,遵循截断几何分布。干预强度遵循 Hill 型剂量效应函数。
- 观测模型(Observation Model): 合成数据采样自零膨胀对数正态表达模型,并注入了 SERGIO 噪声。
- 反事实监督(Counterfactual Supervision): 在事实(factual)和干预(intervened)展开中重复使用外生噪声,以确保成对差异反映的是干预引起的改变。
3. 模型架构
该模型利用带有结构化瓶颈的 Transformer 式摊销预测器:
- 上下文干预记忆(Context Intervention Memory): 一个共享编码器处理上下文对 (γi,xi),生成节点表示和机制摘要。目标和强度头预测上下文机制的 I^i 和 ψ^i,并将其编码为干预记忆标记(intervention-memory tokens)。
- 结构分支(Structure Branch): 一个集合对图(set-to-graph)编码器结合上下文响应统计量与推断的干预,以估计系统图 G^。它采用类 NOTEARS 惩罚项(Ldag)来强制执行无环性,并使用贪婪投影来校准边密度。
- 查询推理(Query Inference): 查询机制以上下文记忆为条件。模型预测查询特定的目标 I^j 和强度 ψ^j。
- SCM 解码器(SCM Decoder): 一个受干预的 SCM 解码器进行效应展开。它使用硬投影图 G^ 和预测的干预来传播偏移,输出零膨胀对数正态预测分布。
4. 训练与推理
- 训练目标: 多任务损失结合了图损失(LG)、目标损失(LI)、强度损失(Lψ)、观测似然(Lobs)和无环惩罚项(Adag)。
- 推理: 在测试时,PerturbPFN 执行单次前向传播,无需梯度更新。它将连续的边得分转换为硬 DAG,并展开解码器以预测效应。
核心贡献
- 框架: 引入了 PerturbPFN,这是一个 PFN 式框架,通过层次化合成 SCM 先验来摊销扰动效应的推断。它显式地预测潜在图、稀疏靶点和强度,然后再解码响应,而不是直接回归高维输出。
- 效率与泛化: 通过单次上下文前向传播,展示了在真实单细胞数据上具有竞争力的效应预测能力,消除了在测试时进行数据集特定优化的需求。
- 可解释性: 提供结构化的中间估计(靶点、强度、系统结构),从而提供机制性的洞察,这与黑盒潜空间预测形成对比。
- 评估: 在先验内潜在变量恢复、真实世界效应预测(Sci-Plex 数据集)以及调控结构发现(GeneRNIB 基准)方面进行了全面评估。
结果
先验内潜在变量恢复
在 1,024 个合成情节中,PerturbPFN 成功恢复了潜在变量且未发生崩溃:
- 图恢复: AUROC 为 0.8133,AUPR 为 0.2980(显著高于 0.0363 的边流行度)。
- 靶点识别: AUROC 为 0.9330,F1 为 0.7649。
- 强度估计: 平均绝对强度比为 0.9386。
- 响应预测: 预测与真实干预方向之间的余弦相似度较高(0.7437)。
扰动效应预测 (Sci-Plex)
在 12 个协议中剂量最高的留出基准上进行评估:
- 性能: PerturbPFN 实现了最佳的归一化 Wasserstein-2 (W2) 分数(0.9183),并排名第二(平均分 0.8394),仅次于 RF X-Learner。
- 效率: 一旦预训练完成,其每个协议的推理时间仅需 1.11 秒。这明显快于 GIM (4495s) 和 CondOT (7266s)。即使考虑到摊销预训练成本,它仍然比复杂的基准模型快得多。
- 权衡: 它在预测性能、结构化可解释性和低推理成本之间取得了良好的平衡。
GRN 结构发现 (GeneRNIB)
在 300BCG 基准上评估将学习到的结构迁移到真实生物数据的能力:
- 性能: PerturbPFN 实现了最佳的 GS-F1 (0.6410),表明其与活跃通路高度一致,且具有竞争力的 TFB-F1 (0.1146)。
- 局限性: 在 R-Precision、R-Recall 或 Virtual Cell (VC) 指标上,它并未超越专门的 GRN 基准模型(如 GRNBoost2, PORTIA)。作者指出这是符合预期的,因为 PerturbPFN 针对的是在合成先验下的因果传播进行优化,而非复制静态的精选 GRN 注释。
意义与主张
论文将 PerturbPFN 定位为迈向生物学结构化基础模型的一步。其主要意义在于证明了:
- 合成预训练是可行的: 模型可以在大规模合成任务上进行预训练,以摊销复杂潜在变量(图、靶点、机制)的推断,而无需在训练期间需要真实的带标签扰动数据。
- 摊销逆问题: Transformer 有效地摊销了一个逆问题——即推断哪些潜在图和机制变化解释了观测到的上下文——并将此过程应用于新任务,而无需基于梯度的自适应。
- 结构化瓶颈: 结构化瓶颈具有双重作用:它既作为一种架构约束以提高效率,又暴露了关于扰动如何作用及传播的可检查假设。
作者保持了审慎的态度,承认潜在变量的含义与合成先验紧密相关,且在先验内恢复它们并不保证生物学机制的唯一可辨识性。他们建议未来的工作应专注于更丰富的模拟器、后验不确定性量化以及扩展到全转录组。