← 最新论文
🤖 machine learning

Conformal Prediction for Molecular Properties under Label Shift

本文介绍了一种针对标签偏移量身定制的符合性预测框架,该框架通过利用边际标签概率比对评分进行加权,为分子特性生成具有统计严谨性的预测区间,从而在无需模型重训的情况下,增强了人工智能驱动药物研发的可靠性与监管合规性。

原作者: Hyeonsu Lee, Juyeon Kim, Erkhembayar Jadamba, Seungjin Choi, Hyunjin Shin

发布于 2026-08-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Hyeonsu Lee, Juyeon Kim, Erkhembayar Jadamba, Seungjin Choi, Hyunjin Shin

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

将一种化学化合物转化为救命药物的过程,是一场充满不确定性的马拉松。这个过程可能耗时十多年,耗资数十亿美元,而且往往以失败告终,因为在计算机模型中看起来完美的分子,在生物体内可能会表现出不可预测的行为。为了加速这一进程,科学家们越来越多地依赖人工智能来预测新分子的作用方式,例如它是否能在水中溶解,或者是否会对细胞产生毒性。然而,这些数字预测的质量取决于它们所训练的数据。当模型遇到与所学习示例显著不同的新型分子时,其信心可能成为一种负担,提供一个看似精确但实际上却自信地错误的单一数值。为了使这些工具在现实世界中安全使用,研究人员需要一种不仅能衡量答案,还能衡量该答案可靠性的方法,尤其是在游戏规则发生变化的时候。

在最近的一项研究中,莫加姆生物医学研究所(Mogam Institute for Biomedical Research)和 Intellicode 的研究人员针对这一特定的“规则变化”问题进行了攻关,这在技术术语中被称为“标签偏移”(label shift)。这种情况发生在模型试图预测的属性分布在训练阶段和实际应用阶段之间发生了变化。例如,一个模型可能是在各种常见的分子上进行训练的,但随后被要求寻找具有极高效能的罕见化合物。在这种情况下,标准的测量不确定性的方法会失效,往往导致预测区间过窄,无法捕捉到真实值。该团队开发了一个新的框架,可以在无需重新训练昂贵的基础模型的情况下,调整这些人工智能预测的置信区间。通过使用一种称为“符合性预测”(conformal prediction)的统计技术——该技术构建的是可能值的范围而非单一的点估计值——他们创建了一个即使在数据分布发生漂移时也能保持可靠的系统。

研究人员使用了一个包含近一万种已知溶解度水平的化合物大型数据集来测试他们的方法,溶解度是药物设计中的一个关键因素。他们采用了一个经过数亿种化学结构训练的高级语言模型来进行初步预测。为了模拟标签偏移这一现实世界的挑战,他们人为地改变了测试数据的分布,使其溶解度值的分布与训练集不同。当他们将标准的、未经调整的方法应用于这些偏移后的数据时,系统未能像预期那样频繁地将真实值捕捉在预测范围内,导致结果表现出危险的过度自信。这种假设测试数据与训练数据一致的传统方法,根本无法跟上这种变化。

为了解决这个问题,团队引入了一个充当预测“校正透镜”的权重系统。他们首先将可用数据分为三个不同的组:一组用于训练模型,一组用于估算数据分布发生了怎样的偏移,第三组用于校准最终的预测范围。利用第二组数据,他们计算了新环境中不同溶解度水平的预期频率与旧环境相比的比率。然后,他们将这些比率作为权重应用于模型在校准期间产生的误差。这一过程有效地告诉系统:要更多地关注那些在新数据中变得越来越常见的误差类型,而减少对那些正在消退的误差类型的关注。通过这样做,他们可以构建出保持统计有效性的预测区间,无论数据如何偏移,都能确保真实值落在预期的置信水平范围内。

他们在模拟实验中重复了一千次以确保稳健性,结果显示出明显的改进。虽然标准方法在标签偏移下经常无法捕捉到真实值,但新的加权方法始终能将覆盖率恢复到目标水平。研究人员发现,当使用一种称为“极大似然估计”(maximum likelihood estimation)的特定统计技术来计算必要的权重时,该方法效果最好,尽管其他方法也展现出了潜力。有趣的是,能够最准确恢复覆盖率的方法往往会产生略宽的区间,这种权衡反映了一种更诚实的对不确定性的评估。研究表明,在无需承担从头开始重新训练的昂贵成本的情况下,使现有的强大人工智能模型适应新的、变化的化学景观是完全可能的。

这项工作为将人工智能整合到高风险的药物研发环境中提供了一条切实可行的路径。通过提供一种能够适应变化条件的、具有统计严谨性的置信度测量方法,该框架有助于弥合理论模型性能与监管透明度要求之间的差距。它确保了当科学家观察一种新型分子的预测结果时,他们看到的不仅仅是一个数字,而是一个对其潜在特性的现实评估,并伴随着对相关风险的清晰理解。这种从“盲目自信”向“审慎可靠”的转变,是使人工智能成为将新药带给患者这一价值数十亿美元事业中值得信赖的伙伴的关键一步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →