← 最新论文
🤖 machine learning

HEDGEHOG: Hierarchical Evaluation of Drug Generators Through Rigorous Filtration

本文介绍了 HEDGEHOG,这是一个受工业工作流启发的严谨的六阶段过滤基准测试,它揭示了当前生成式分子模型的一个关键局限性,即在 230,000 个生成的化合物中,仅有 0.65% 能同时通过理化性质、合成可行性以及 3D 结合相互作用的检查。

原作者: Daria A. Ryabchenko (Ligand Pro, Moscow, Russia, Skolkovo Institute of Science and Technology, Artificial Intelligence Center, Moscow, Russia), Pavel Gurevich (Ligand Pro, Moscow, Russia, Skolkovo Ins
发布于 2026-07-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Daria A. Ryabchenko (Ligand Pro, Moscow, Russia, Skolkovo Institute of Science and Technology, Artificial Intelligence Center, Moscow, Russia), Pavel Gurevich (Ligand Pro, Moscow, Russia, Skolkovo Institute of Science and Technology, Artificial Intelligence Center, Moscow, Russia), Shamil Kadyrov (Ligand Pro, Moscow, Russia), Daria Frolova (Ligand Pro, Moscow, Russia, Skolkovo Institute of Science and Technology, Artificial Intelligence Center, Moscow, Russia), Kseniia Fedisheva (Ligand Pro, Moscow, Russia), Sergei A. Nikolenko (Ligand Pro, Moscow, Russia), Alexander Shapeev (Ligand Pro, Moscow, Russia, Skolkovo Institute of Science and Technology, Artificial Intelligence Center, Moscow, Russia), Marina A. Pak (Ligand Pro, Moscow, Russia)

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一位想要发明世界上最美味汉堡的新型食谱的大师级厨师。你有一个神奇的机器人,它能在眨眼之间为你制作出成千上万种独特的汉堡创意。这太棒了!但问题在于,仅仅因为机器人能写下一份成分清单,并不意味着这个汉堡真的会好吃,甚至不一定能食用。也许它会要求加入“龙鳞”或“液态火焰”;又或者这些成分过于昂贵且稀有,以至于没人能买得到。在科学领域,特别是在药物研发中,研究人员使用类似的“食谱机器人”(称为生成模型)来发明可以成为救命良药的新分子。大问题在于:这些机器人真的在制造有用的药物,还是仅仅在编写华丽的虚构故事?

长期以来,科学家们通过检查这些机器人生成的分子在纸面上是否“有效”来测试它们——就像检查一个汉堡食谱是否有面包和肉饼一样。但在现实世界中,一种药物需要通过更难的测试:它必须完美地契合我们体内一个微小的锁扣,并且在实验室中易于合成,同时不能具有毒性。如果一个机器人制造了一百万个想法,但其中只有一个是真正的药物,那将浪费大量的精力和计算资源。这就是一项新研究所解决的问题。它在问:当我们用现实世界中科学家使用的严格规则来过滤这些机器人制造的分子时,究竟还有多少能幸存下来?

HEDGEHOG:针对机器人制造分子的六阶段障碍赛

该论文介绍了一种名为 HEDGEHOG(通过严苛过滤进行药物生成器分层评估)的新型、极其严苛的测试系统。请记住,HEDGEHOG 不仅仅是一个单一的测试,而是一个巨大的、六层级的障碍赛,旨在精准模拟真实药物猎人的工作方式。研究人员想要观察 23 种不同的 AI “机器人”创造的分子能否在这场障碍赛中幸存。

以下是这个赛程的运作方式,分步骤进行:

  1. 清理小组(预处理): 首先,机器人的混乱输出要经过一次洗礼。系统会对化学“食谱”进行清理,丢弃任何看起来像拼写错误、包含不可能存在的原子或仅仅是杂乱无章的东西。这就像是扔掉一份写着“加入 500 杯盐”或“与一块石头混合”的食谱。
  2. 大小与形状检查(理化描述符): 接下来,对分子进行测量。它们的重量是否合适?它们是太油腻还是太干燥?这一阶段检查分子是否具备作为药物所需的各种基本“体型”。
  3. “危险成分”扫描(结构过滤器): 在这里,系统会寻找有毒或不稳定的部分。想象一下一个要求加入“毒藤”或“爆炸粉末”的食谱。系统拥有一份包含约 2,460 种危险模式(如 PAINS 或有毒环状结构)的清单,并会立即禁止任何含有这些成分的分子。
  4. “我们能造出这个吗?”测试(合成可行性): 即使一个分子很完美,如果人类无法制造它,它也是毫无用处的。系统会尝试判断真实的实验室是否能够制造出该分子。它使用智能软件来规划构建步骤。如果计划过于疯狂或不可能实现,该分子就会被淘汰。
  5. “锁与钥匙”的契合度(对接): 现在,幸存者将针对一个特定的目标进行测试:一种被称为 KRAS G12D 的蛋白质(这与某些癌症有关)。系统尝试将分子塞进该蛋白质的一个微小口袋中。如果它不能紧密贴合,或者计算机认为它无法粘附,它就会被淘汰。
  6. 3D 现实检查(最终过滤器): 最后,系统会在 3D 空间中观察分子。它会扭曲成奇怪的形状吗?它是否真的接触到了蛋白质的正确部位?这是最后的质量控制,以确保该分子不仅仅是一个扁平的图画,而是一个真实的、起作用的 3D 物体。

令人震惊的结果:极低的生存率

研究人员向这 23 个机器人输入了总计 230,000 个生成的分子(每个机器人大约 10,000 个)。他们观察到数字在每一个阶段都在下降,就像一个漏斗在挤出所有不完美的东西。

结果令人大开眼界。当分子到达赛程的最末端时,只有 0.65% 的原始批次幸存了下来。这意味着在 230,000 个想法中,只有 1,490 个分子足以通过所有测试。

研究发现,大多数机器人擅长制造那些在最初几个简单检查中看起来“良好”的东西,但面对更难的、现实世界的规则时,它们就会崩溃。

  • “无条件”机器人: 这些是无需特定目标、随机制造分子的机器人。它们产生了大量在早期清理和尺寸检查阶段就失败的垃圾。
  • “基于配体”的机器人: 这些机器人试图模仿现有的药物。它们表现尚可,但往往制造出在实验室中难以构建的东西。
  • “基于蛋白质”的机器人: 这些是最聪明的,专门为 KRAS 蛋白质设计分子。虽然它们在最后的 3D 契合度方面表现最好,但它们在早期的“我们能造出这个吗?”以及“它是否有毒?”检查中失败的频率比其他机器人更高。

核心教训

论文表明,我们一直在自欺欺人。我们曾以为,如果一个机器人能生成一个在纸面上看起来“有效”或在简单测试中得分很高的分子,那就是成功。但 HEDGEHOG 显示,这是一个陷阱。一个分子可以在纸面上看起来完美,但在你尝试构建它或将其放入蛋白质中时却表现得一败涂地。

这项研究明确排除了当前模型已经准备好投入实用的观点。它认为,仅仅针对单一目标(例如“它是否契合蛋白质?”)进行优化是不够的。机器人需要能够同时平衡所有因素:即具备有效性、安全性、可构建性和有效性。

在针对 KRAS 蛋白的这次特定测试中,一个名为 Dragonfly 的模型脱颖而出,拥有 345 个幸存者。但即便是在最好的模型中,其想法能幸存下来的比例也微乎其微。作者指出,主要问题不在于机器人无法制造出任何好的分子,而在于它们无法一致地制造出能同时满足现实世界医学中所有严格规则的分子。

论文结论认为,我们不应再为机器人制造出“漂亮”的分子而欢呼,而应通过它们在如此残酷的六阶段 HEDGEHOG 赛程中能幸存多少来评判它们。在它们能够做到这一点之前,大多数想法都只是数字噪音,而非下一个伟大的疗法。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →