Empty scaffold allocation bias in molecular distribution shift evaluation
本文揭示了标准的基于骨架的评估方法通过错误地将化学异质性的“无骨架”分子视为单一单元,引入了一种隐藏的分配偏差,从而扭曲了常见基准测试中的泛化指标,并提出了一种“空骨架感知”修复方案,以恢复平衡的表示和准确的性能评估。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你是一位试图教机器人烹饪的厨师。你想知道机器人是真的学会了烹饪的“原理”,还是仅仅记住了特定的食谱。为了测试这一点,你决定给机器人一组练习菜肴(训练集),然后在它从未见过的全新菜肴(测试集)上对其进行测试。
在AI化学领域,科学家们使用一种叫做**骨架拆分(Scaffold Splitting)**的方法来进行这种测试。他们根据分子的“骨架”——即支撑其结构的环状结构和连接键——对分子进行分组。其原理很简单:如果你教机器人学习一种类型的骨架,你应该在另一种不同的骨架上测试它,以观察它是否真正理解了化学。如果机器人在新的骨架上失败了,那就意味着它只是在死记硬背旧的骨架。
但这里有一个转折:有些分子根本没有骨架。
“幽灵”分子
在化学中,有一种确定分子骨架的标准方法。但对于某些奇特、松散或微小的分子,这个过程会返回一个空桶。这些就是“无骨架”分子。它们没有共同的环状结构;它们是各种残余部分的混乱混合物。
由宋涛、王勇及其团队(来自中 petroleum 大学东部及天贡大学)发表的论文发现,我们在测试这些“AI厨师”时存在一个重大的缺陷。
缺陷所在:
标准的测试规则规定:“将具有相同骨架的所有分子放在同一个组中。”但由于“无骨架”分子都拥有一个“空”骨架,计算机会将它们全部视为一个单一的、巨大的整体。它把它们全都放进了同一个桶里。
问题在于: 由于它们被视为一个不可分割的整体,计算机经常会将所有这些“幽灵”分子都丢进测试集,而测试集中却一个也没留在训练集里。
- 类比: 想象你在教一个学生识别水果。你向他展示了苹果、香蕉和橙子。但在期末考试时,你给了他一碗“神秘糊状物”(无骨架分子)。你从未教过他“糊状物”长什么样,但你却期望他能猜出味道。
- 结果: 学生(AI)表现得一塌糊涂。但这究竟是因为学生化学不好,还是因为你在练习阶段通过隐藏整个“糊状物”类别来“作弊”了?
这种情况有多普遍?
作者并不仅仅是靠猜测;他们查看了数据。他们发现这个“幽灵”问题无处不在:
- 在 16 个 热门数据集(MoleculeNet)中,有 8 个 数据集的无骨架分子占比超过了 10%。
- 在像 FreeSolv 和 QM7 这样的特定数据集中,近 50% 的分子都是“幽灵”。
- 在一个大规模的药物测试任务集(Deep-PK/ADMET)中,73 个 任务中有 40 个 的无骨架分子占比超过了 10%。
“空桶”是一个烂摊子
作者检查了这些“幽灵”分子是否真的彼此相似。他们发现事实并非如此。
- 真正的骨架组就像是一群亲戚;它们看起来很像。
- “无骨架”组则像是一堆随机的垃圾。它们之间的平均相似度仅为 0.110,几乎等同于随机噪声。
- 它们也远离了 AI 真正学习到的那些分子。在训练集中,与幽灵分子最接近的“邻居”相似度也仅为 0.300,而真实的家族成员其邻居相似度通常在 0.477 到 0.573 之间。
因为它们与训练数据如此不同,AI 根本没有机会学习它们。
后果:分数是如何失效的
当 AI 在没有见过这些“幽灵”分子的情况下进行测试时,结果非常糟糕,但这并不是因为 AI “聪明但运气不好”。
1. 对于分类问题(是非题):
AI 停止了正确排序的能力。其得分被压缩到了“先验基准线(prior baseline)”。
- 类比: 如果你要求一个学生对 100 件神秘物品进行从“最好”到“最差”的排序,而他对这些东西一无所知,他可能会对所有东西都猜“中等”。
- 数据: 作者发现,排名性能显著下降。在 MoleculeNet 数据集中,中位数得分从 0.259(正常情况)降至 0.035(幽灵分子)。在 ADMET 中,得分从 0.409 降至 0.119。
- 震惊: 在 Tox21 数据集中,幽灵分子的得分从正常分子的 0.303 骤降至 0.018。AI 不仅仅是在失败,它是在放弃并进行随机猜测。
2. 对于回归问题(数值预测):
误差爆炸式增长。
- 数据: 平均相对误差(relMAE)增加了 1.35 倍。
- 极端情况: 在某些情况下,误差是正常情况下的 2 倍 甚至 3 倍。在 MoleculeNet 中,44.8% 的测试点误差至少是正常的两倍。这与通常极小的正常波动相比,差异巨大。
其他方法修复了它吗?
作者检查了其他流行的拆分方法,如 UMAP 聚类、DataSAIL 和 LoHi。他们曾希望这些更智能的方法能解决这个问题。
- 结论: 它们并没有。虽然这些方法没有像标准方法那样把所有幽灵分子都丢进测试集,但它们仍然让训练集中的幽灵分子寥寥无几。
- 数据: 使用标准拆分时,在最坏情况下训练集中的幽灵分子占比为 0%。使用 DataSAIL 时,训练集中的幽灵分子仍仅为 14.7%,而测试集却占了 81.6%。
- 结论: 目前没有任何方法能保证 AI 在测试前能够对这些“幽灵”分子进行练习。
解决方案:“感知空骨架”修复(ESA)
作者不仅指出了问题,还开发了一个名为 ESA 的补丁。
- 工作原理: 他们对“真实”分子(有骨架的分子)保持标准的拆分方式,但对“幽灵”分子进行了仔细的重新分配。他们确保训练集获得了公平份额的幽灵分子,同时仍在测试集中保留了一些,以观察 AI 是否能处理它们。
- 结果: 这修复了不平衡问题。训练集中的幽灵分子比例从 14.7% 增加到了 26.0%。测试集中的比例从 81.6% 下降到了 11.5%。
- 安全性检查: 他们确保这不会通过让 AI “偷看”测试答案来作弊。训练幽灵与测试幽灵之间的相似度依然很低,因此 AI 必须学习它们,而不是仅仅靠记忆。
总结
该论文指出,我们不能仅仅看到高分就说:“太棒了,AI 准备好了!”如果测试集充满了 AI 在训练中从未见过的“幽灵”分子,那么这个分数就是误导性的。这并不是对泛化能力的测试,而是测试 AI 在没有救生圈的情况下被扔进深水区时的应对能力。
作者建议,未来的测试必须清晰地报告三件事:
- 有多少个“幽灵”分子?
- AI 有多少机会进行练习?
- 剩下了多少个用于测试?
在我们解决这个问题之前,我们可能会过度高估我们的分子 AI 到底有多聪明。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。