想象一下你是一名正在破解谜题的侦探:如何让一把微小的钥匙(药物分子)精准地契合进一个特定的锁(你体内的蛋白质)?如果契合完美,药物就会奏效;如果契合松动,它就会失败。这就是“计算药物发现”的核心领域,科学家们利用计算机在实验室进行化学混合之前,就预判这些契合程度。这节省了时间和金钱,因为在真实实验室中测试每一种可能的药物既缓慢又昂贵。
然而,计算机并非完美无缺。科学家们构建了许多不同的“预测引擎”(就像不同的侦探团队)来猜测药物的契合程度。有时,A 队说契合度极佳,而 B 队却说极其糟糕。处理这种问题的老办法是直接取所有猜测的平均值。但这就像是向五个朋友问路,然后你就走在路中间,忽略了其中一个朋友可能还在看 1990 年的地图,而另一个则在使用 GPS。问题在于,我们以前没有一种好的方法来知道对于“这个特定锁”而言,该信任哪位朋友。我们需要一个不仅能给出答案,还能说出:“我对这一个有 90% 的把握,但对下一个我完全是在瞎猜”的系统。
这正是这篇新论文的切入点。由 Yongchan Hong 及其同事领导的研究人员创建了一个名为 RELIABLE-BA 的智能系统。你可以把它想象成一位超级聪明的“总侦探”,他会倾听所有不同预测引擎(即“专家”)的意见,但并不只是简单地对它们的答案取平均值。相反,总侦探会观察特定的锁和钥匙,并问道:“嘿,专家 A,你通常很擅长处理这类锁,但专家 B,你面对这种形状时往往会感到困惑。”
该系统通过三个巧妙的步骤运作。首先,它将每个预测引擎视为一个“证据专家”。每个引擎不仅仅给出一个单一的数字,而是给出一个可能性的范围,并承认自己的不确定性。第二,系统会根据药物和蛋白质的具体化学特性,学习每个引擎的“可靠性评分”。如果某个引擎在某种特定类型的任务中表现不佳,系统会在最终决策中悄悄降低它的发言权重。第三,它将所有这些经过调整后的意见合并为一个最终的、经过超校准的预测。
结果令人印象深刻。当他们在巨大的已知药物-蛋白质对数据库(称为 PDBbind 和 BDB2020+)上测试这个新系统时,它不仅能很好地预测答案,而且在识别自己何时正确、何时错误方面表现得更为出色。事实上,当系统被允许仅展示其最自信的预测(忽略那些它感到犹豫不决的预测)时,它将预测误差降低了高达 25.7%。这意味着科学家可以丢弃那些冒险的猜测,转而专注于高质量的预测,从而节省大量时间。
团队还在现实世界中棘手的靶点上对其进行了测试,例如 SARS-CoV-2 病毒的主蛋白酶和 5HT2A 受体(一种针对精神健康药物的靶点)。在这些测试中,RELIABLE-BA 的表现优于单个引擎和其他方法,证明了它能够处理困难的现实场景。该论文指出,通过使用这种“感知可靠性”的方法,我们可以让药物发现变得更安全、更高效,确保当计算机说某种药物可能有效时,我们有更充分的理由去信任它。
技术摘要:基于可靠性感知多引擎融合的可信蛋白质-配体结合亲和力预测
问题陈述
准确预测蛋白质-配体结合亲和力是计算药物发现的基石,然而现代对接引擎经常产生相互冲突的预测结果,却无法指出哪些结果值得信任。虽然共识评分(consensus scoring)和集成方法可以提高平均精度,但它们通常将所有预测视为同等对待,缺乏可解释的置信度度量或不确定性分解。至关重要的是,现有方法忽略了特定蛋白质-配体对的化学上下文,未能区分偶然不确定性(aleatoric uncertainty,即数据固有的噪声)与认知不确定性(epistemic uncertainty,即模型知识的匮乏)。此外,单模型不确定性量化(UQ)方法无法捕捉由于不同引擎之间存在分歧而产生的额外认知不确定性,这些引擎依赖于不同的假设、评分函数和训练数据。
方法论:RELIABLE-BA
作者提出了 RELIABLE-BA(基于证据的结合亲和力可靠性感知融合框架),这是一个旨在融合多个对接引擎并考虑上下文相关可靠性的证据框架。该框架主要分为三个步骤:
- 证据专家建模(Evidential Expert Modeling): 每个对接引擎被建模为一个证据专家。每个引擎不再仅输出一个点估计值,而是预测正态-逆伽马(Normal–Inverse-Gamma, NIG)分布的参数 (γi,νi,αi,βi),从而同时捕捉预测均值和不确定性。这实现了将不确定性闭式分解为偶然不确定性(数据噪声)和认知不确定性(模型不确定性)的过程。
- 可靠性感知缩放(Reliability-Aware Scaling): 可靠性网络以共享的分子嵌入(源自用于蛋白质的 ESM-2 和用于配体的 ChemBERTa)为条件,学习每个引擎在特定蛋白质-配体上下文下的信任分数 ri(x)∈(0,1)。这些分数通过缩放变换来调节每个专家的认知不确定性。具体而言,可靠性分数通过缩放证据参数(ν 和 α)来增加在给定上下文中可靠性较低的专家的认知不确定性,同时保留专家的预测均值 (γ)。
- MoNIG 聚合(MoNIG Aggregation): 使用正态-逆伽马混合(Mixture of Normal–Inverse-Gamma, MoNIG)聚合方式对经过可靠性缩放的专家进行融合。它采用一种闭式求和算子来组合 NIG 分布,累积专家内部的不确定性以及引擎间的差异。该融合规则确保了来自不同引擎的冲突预测会导致最终输出具有更高的认知不确定性。
该模型通过联合目标函数进行端到端训练,该目标函数在单个专家层面和融合后的 MoNIG 层面同时最小化负对数边际似然(NLL),并辅以正则化以防止在预测误差较大时出现过度证据积累。
核心贡献
- 首个多引擎证据框架: RELIABLE-BA 被认为是第一个将证据不确定性量化与上下文相关可靠性建模相结合的多引擎结合亲和力框架。
- 可靠性缩放机制: 作者引入了一种新颖的机制,该机制基于学习到的可靠性分数来缩放认知不确定性,而不改变单个专家的预测均值,从而实现了通过 MoNIG 进行连贯的融合。
- 选择性预测能力: 该框架通过基于置信度进行过滤,实现了风险意识决策,证明了在仅保留高置信度对时显著降低预测误差的能力。
实验结果
作者在 PDBbind 2020 基准测试(使用时间分割协议)和独立的 BDB2020+ 测试集上对 RELIABLE-BA 进行了评估。此外,还在 SARS-CoV-2 Mpro 数据集和 5HT2A 受体(一种 GPCR)上进行了额外验证。
- 点预测: RELIABLE-BA 取得了极具竞争力的点预测精度,在 PDBbind 测试集上达到了最低的平均绝对误差(MAE)0.8247 和最高的 R2 0.7017,优于单个引擎和传统的聚合基准(如共识评分、深度集成)。在独立的 BDB2020+ 数据集上,其 MAE 为 0.722。
- 不确定性校准: 与基准模型相比,该模型展示了显著改进的不确定性校准。在 PDBbind 上,与标准证据回归相比,它将期望校准误差(ECE)降低了 71.2%。
- 选择性预测: 通过丢弃低置信度的预测,当仅保留前 10% 最自信的预测时,RELIABLE-BA 将 MAE 降低了高达 25.7%。
- 消融研究: 实验证实了上下文相关的可靠性建模至关重要;移除该机制或使用统一权重都会导致准确性和不确定性质量的下降。此外,增加异构引擎的数量(从 2 个增加到 4 个)能持续提升准确性和校准度。
- 案例研究: 该方法在 SARS-CoV-2 Mpro 数据集和 5HT2A 受体上保持了强劲性能,展示了对临床相关靶点的适用性以及在分布偏移下的鲁棒性。
意义与主张
论文声称 RELIABLE-BA 为可信 AI 引导的药物发现提供了一条原则性的路径。通过提供能够反映个体引擎局限性和引擎间分歧的校准不确定性估计,该框架允许从业者优先处理高置信度的预测用于实验验证,从而减少昂贵的假阳性。作者将 RELIABLE-BA 定位为一种实用的不确定性感知虚拟筛选方法,特别是对于像 GPCR 这样具有构象灵活性和训练数据表示有限等挑战性治疗靶点。该工作强调,该框架具有模块化特征,允许集成多样且非冗余的对接引擎,以增强大规模筛选流程中的鲁棒性。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。