ShallowBench: Benchmarking Generative Drug Design Models on Shallow-Pocket Targets
本文介绍了 ShallowBench,这是一个包含 5,780 个浅口袋靶点的精选基准测试,旨在评估并揭示当前生成式人工智能模型在设计针对如 KRAS 和 MYC 等历史上“不可成药”的低凹陷界面配体方面的局限性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明
想象一下,你是一位大师级建筑师,正试图设计一把能完美契合特定锁具的定制钥匙。几十年来,最优秀的建筑师(AI 模型)一直致力于为深邃、如洞穴般的锁打造钥匙。这些洞穴很容易处理,因为四周都有墙壁环绕着钥匙,为建筑师提供了清晰的边界。AI 学会了如何让钥匙“蜷缩”进这些深孔中,从而实现紧密且安全的贴合。
然而,在现实世界的医学领域,许多最危险的“锁”(如 KRAS 和 MYC 等疾病靶点)并不是深邃的洞穴,而是平坦、开放的表面,就像桌面或光滑的墙壁一样。这些就是历史上难以攻克的“不可成药”靶点。
这篇论文介绍了一个全新的测试场——ShallowBench,旨在观察我们的 AI 建筑师在为这些平坦表面设计钥匙时表现如何。
问题所在:“平坦表面”的挣扎
作者发现,目前的 AI 模型就像是那些只在洞穴里造过钥匙的建筑师。当你要求他们为一张平坦的桌子设计一把钥匙时:
- 他们会迷失方向: 由于缺乏深邃墙壁的引导,AI 不知道该把钥匙放在哪里。钥匙可能会直接“漂浮”在桌面上方的空中,而不是紧贴着它。
- 他们会犯错: AI 难以将钥匙本身保持得体,有时会创造出不符合化学逻辑的形状。
- 他们会失去抓地力: 即便尝试贴合,钥匙的贴合度也远不如在洞穴中那样紧密。
他们是如何构建测试的 (ShallowBench)
为了证明这一点,研究人员需要一个公平的测试。他们不能直接使用旧的数据集,因为那些数据集中充满了深邃的洞穴。因此,他们利用一个包含 166,500 个蛋白质结构的庞大库,创建了一个名为 ShallowBench 的新数据集。
他们使用了一种巧妙的“体积测量”技巧来寻找那些平坦的表面:
- 想象一下,在蛋白质表面放置一个透明的圆顶盖。
- 他们计算了盖子内部的空间与蛋白质原子本身所占空间的差值。
- 如果这个差值(圆顶下的“空隙”)很小,就意味着该表面是平坦且浅层的。
- 他们过滤掉了深邃的洞穴,保留了 5,780 个仍有足够表面积来承载药物的平坦靶点。
随后,他们将此分为“训练集”和“测试集”,确保 AI 不会通过记忆相似的蛋白质来作弊。
结果:AI 踉跄了
研究人员在这一全新的平坦表面测试中测试了三个顶尖的 AI 模型。结果如下:
- “洞穴”模型失败了: 每一个模型在平坦表面上的表现都比在深邃洞穴中要差。它们预测的“贴合”能力显著下降。
- “漂浮”问题: 其中一个模型 (TargetDiff) 试图拥抱平坦表面,但最终却制造出了化学结构破碎的钥匙(即在现实中无法工作的分子)。它为了极力适应形状,甚至忘记了化学规则。
- “有效但松散”问题: 另一个模型 (DiffSBDD) 制造出了完美的、化学性质有效的钥匙,但这些钥匙过于松散且缺乏形状,完全无法贴合平坦表面。这就像是做了一把完美的钥匙,却把它放在了桌子的错误一侧。
- “评分型”模型: 第三个模型 (SimpleSBDD) 在贴合度方面表现最好,但它并不是在真正“设计”新钥匙,而是在从现有的库中挑选那些恰好能凑合贴合的现有钥匙。
核心启示
论文得出结论:虽然 AI 在为深邃、洞穴状的口袋设计药物方面表现出色,但目前它们对平坦表面是“盲目”的。
作者建议,要解决这个问题,我们不能仅仅沿用旧的训练方式。我们需要:
- 教导 AI 不同的方式: 在训练过程中向它展示更多平坦表面的例子。
- 改变规则: 创建新的“损失函数”(AI 试图最小化的规则),惩罚那些让钥匙从平坦表面“漂浮”开的行为。
- 构建新工具: 或许 AI 需要学会观察整个蛋白质的景观,而不只是眼前的那个小孔,从而理解如何将药物锚定在平坦的墙面上。
简而言之:我们的药物设计 AI 是一个优秀的洞穴探险家,但在平坦地面上建造时却表现糟糕。 ShallowBench 就是那张揭示了 AI 在何处失灵的地图,让我们能够构建更好的工具,去攻克那些“不可成药”的疾病。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。