A Comprehensive Evaluation of Machine Learning Pipelines for Toxic Endpoint Prediction
本研究对预测 52 项 ToxCast 检测中激素受体毒性的机器学习流水线进行了全面基准测试,证明了在不进行降维的情况下,基于理化性质训练的随机森林模型在准确性、效率和可解释性方面始终优于深度学习及其他先进方法。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明
想象一下你是一名正在破解谜题的侦探:哪些新化学化合物可以安全用于药物,而哪些又是等待爆炸的有毒定时炸弹?在现实世界中,弄清这个问题通常意味着在实验室里混合化学物质,并观察它们对活细胞或动物会发生什么。这既昂贵又缓慢,而且往往涉及对那些并不想成为实验对象的生物进行测试。这正是“机器学习”(ML)这一数字侦探介入的地方。这些计算机程序不再通过混合烧杯,而是观察化学物质的分子“指纹”——即其形状和属性的数字地图——并尝试预测它是否危险。但棘手之处在于:就像侦探可能会被错误的线索或混乱的嫌疑人描述所误导一样,这些计算机模型也可能被错误类型的数据或错误的思维方式所迷惑。科学家们多年来一直在争论,我们是否需要超级复杂、高科技的“深度学习”大脑来解决这个问题,还是说传统的、更简单的逻辑实际上更好。这个问题至关重要,因为如果我们选错了工具,我们可能会漏掉有毒药物,或者浪费时间测试安全的药物,从而减慢发现救命药物的速度。
在这项研究中,来自萨尔大学(Saesarland University)的一个研究小组决定通过运行一场大规模、有组织的锦标赛来解决这场争论。他们不仅仅测试了一个模型;他们为 52 种不同的激素相关毒性测试(检查化学物质是否会干扰雌激素、睾酮和其他激素受体)构建了一个“流水线”。你可以把这个流水线想象成一个烹饪食谱,其中你必须选择三样东西:食材(你如何描述这种化学物质)、准备方法(是简化食材还是保留全部内容)以及厨师(执行烹饪的具体计算机算法)。他们针对这 52 种不同的“测定”(特定的毒性测试),测试了 98 种不同选择的组合,训练了超过 7,000 个独立的模型,以观察谁能最准确地预测危险。
结果让高科技人群感到有些震惊。尽管“深度神经网络”(AI 世界中的超级大脑)非常流行,但研究发现它们经常失手。相反,冠军是一个更简单、更传统的旧式方法,叫做随机森林(Random Forest)。想象一下,随机森林不是一个天才,而是一群普通人在对决策进行投票;每个人观察数据的略微不同的部分,然后由群体做出最终决定。这种“群体”方法,在喂入理化性质(关于分子的基本物理事实,如其重量或其油腻程度)且不进行任何数据简化处理的情况下,获胜次数最多。事实上,这种简单的组合在 52 项测试中以第一名的成绩完成了 12 项,并在近一半的测试中保持在前五名之列。
研究人员还测试了先对数据进行“简化”(一个被称为降维的过程)是否有助于提高表现,类似于学生在考试前试图将整本教科书总结成一张单页小抄。令人惊讶的是,研究发现完全不简化数据反而更好。这些模型似乎需要所有杂乱、详细的信息才能做出正确的判断;丢弃“冗余”特征实际上是丢弃了有用的线索。此外,该研究明确反对认为更复杂的模型或更复杂的化学描述(如深度学习嵌入)会自动更优越的观点。在激素毒性这个特定领域,“简单即更好”的原则占据了上风。
然而,论文也给出了一个现实的警示。即使是最好的模型,平均也仅达到了约 0.32 的“马修斯相关系数”(衡量处理棘手的、不平衡数据的得分)。这并不是一个完美的分数,而是一个适中的分数。研究人员发现,最大的障碍不是计算机模型本身,而是数据的本质。他们发现,“活性悬崖”(activity cliffs)——即两种化学物质看起来几乎完全相同,但一个是安全的,另一个是有毒的——使得预测变得极其困难。这就像仅仅通过观察一块饼干就试图猜测它是否有毒一样,当两块看起来完全一样的饼干内部藏着不同的成分时。由于这些“悬崖”在激素数据中如此普遍,即使是最好的 AI 也难以识别其中的差异。这项研究表明,虽然像随机森林这样的简单模型是我们目前最好的工具,但真正的挑战在于数据本身,未来的突破可能需要更好的方法来理解这些微小的、危险的化学结构差异,而不是仅仅构建更大、更复杂的计算机。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。