← 最新论文
🧬 biology

MolGlueBench reveals heterogeneous transfer of context gains across molecular-glue DC50 domains

MolGlueBench 引入了一个领域感知基准测试框架,该框架揭示了分子胶效能预测中内部骨架泛化能力的提升并不能一致地转移到固定的数据库和目标领域,从而强调了在化学和实验背景重复出现时夸大模型性能所带来的风险。

原作者: Jinsong Shao, XiongJie Wang, Weichen Liu, Lingshuai Kong, Sanjeevi Pandiyan, Gautam Sethi, Li Wang

发布于 2026-09-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Jinsong Shao, XiongJie Wang, Weichen Liu, Lingshuai Kong, Sanjeevi Pandiyan, Gautam Sethi, Li Wang

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

在寻找治愈疾病的方法时,科学家们经常寻找能够充当“分子胶水”的微小分子。这些是设计用来将细胞内两种特定蛋白质粘合在一起的小型化学化合物。当这两种蛋白质被强行结合在一起时,细胞天然的“清理小组”往往会被诱骗去破坏一个有害的目标蛋白,例如驱动癌症生长的蛋白。这种方法为治疗那些被认为无法通过传统药物治疗的疾病带来了希望。然而,寻找合适的“胶水”极其困难。科学家必须测试数千种化学结构,以观察哪些能成功触发这种破坏过程,而这个过程缓慢、昂贵且往往难以预测。为了加快进度,研究人员转向了计算机,希望建立能够预测一种新分子在进入实验室合成前其效能如何的模型。

这些计算机模型的潜力在于它们可以从过去的实验中学习,从而预判未来的成功。但这些模型通常测试方式中隐藏着一个陷阱。通常情况下,一个计算机程序会被展示一组过去的数据,要求它学习其中的模式,然后在一个与该数据相同的不同切片上进行测试。如果测试数据与训练数据的实验条件相同或来自同一来源,该模型可能看起来像个天才。实际上,它可能只是记住了特定实验室或数据库的特性,而不是学习了真正的化学规律。这造成了一种虚假的信心,即模型在理论上看起来很完美,但在面对一种新的实验或新的生物靶点时却完全失败。

南通大学和新加坡国立大学的研究团队致力于通过一项名为 MolGlueBench 的严谨新测试来揭示这一问题。他们设计的挑战不仅仅是检查模型能否猜对已知分子的正确答案,而是迫使模型证明其能够处理全新的情况。他们收集了 1,560 个关于不同分子胶水效能的具体测量值,这些数据取自四个不同的公共数据库。这些测量值涵盖了一千多种独特的化学化合物和数百种不同的结构框架。至关重要的是,他们不仅记录了胶水的化学结构,还记录了实验的完整背景:使用了哪种细胞系、涉及哪些蛋白质以及数据来自哪个数据库。

随后,研究人员让他们的模型经历了一系列难度递增的测试。首先,他们要求模型预测从未见过的全新化学结构的性能,但这些结构来自于与训练数据相同的实验组合。在这种情景下,模型的表现尚可。当计算机被允许同时使用化学结构和实验背景信息时,其预测能力有所提高,这表明了解测试条件有助于模型对分子进行排序。这一结果看起来很有前景,仿佛实验中的额外信息是一个有价值的线索。

然而,当研究人员改变规则以模拟现实世界的场景时,情况发生了剧变。他们要求模型预测在完全陌生的数据库或针对模型在训练期间从未遇到过的全新目标蛋白中的分子性能。这才是检验一个模型是学习到了通用规则还是仅仅记住了特定数据集的真正考验。在这些全新的、未见的领域中,利用实验背景信息的优势消失了。事实上,添加额外的背景信息往往使预测结果变得更差。依赖实验细节的模型无法将其知识转移到新领域,而仅依赖化学结构的模型表现稍好,尽管仍存在显著误差。

研究表明,实验背景的有效性并非普遍真理,而是一种局部捷径。在熟悉的数据内部,背景信息有助于模型对分子进行正确的排序。但当模型走出舒适区,进入新的数据库或新的生物靶点时,这些同样的背景线索就变得具有误导性。模型学会了将特定的实验设置与特定的结果联系起来,但当设置发生变化时,这些关联就不再成立。例如,当尝试预测特定靶点(如 GSPT1 和 CDK2)的结果,或者离开源自名为 TPDdb 的特定数据库的数据时,模型的表现尤为吃力。这些误差并非微小,模型的预测值与实际降解目标蛋白所需的浓度相比,偏差大约在 8 到 10 倍左右。

这一发现为药物研发领域提供了一个至关重要的现实警示。它表明,一个模型在单一数据集内预测良好的能力,并不能保证它在面对未来的发现或不同类型的生物学问题时也能奏效。研究人员得出结论:虽然这些计算机模型可以帮助在已知实验范围内对分子进行排序,但目前还不能信任它们去预测绝对数值,或为新的、未见的靶点筛选候选药物。这项研究并不是说背景信息毫无用处,而是说其价值是脆弱的,完全取决于数据的特定条件。在这些模型能够证明其在不同领域均能奏效之前,科学家在依赖它们做出关于哪些分子值得在实验室进行测试的最终决策时,必须保持谨慎。未来的路径需要构建能够经受住这些更难、更真实挑战的模型,以确保我们所构建的工具确实足够强大,能够应对生命世界的复杂性。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →