Development and Evaluation of Target-Specific Machine-Learning Scoring Functions for Monoamine Oxidase B
本研究表明,虽然针对 MAO-B 的特定靶点机器学习评分函数(特别是结合了多种特征的调优回归模型)在独立测试集上的表现显著优于通用评分函数,但其早期识别性能深受与已知活性化合物结构相似性的影响,这强调了进行严格基准设计和前瞻性验证的紧迫性,以确保其对新颖化学空间的泛化能力。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在寻找新药的过程中,科学家们经常面临规模化的问题。他们拥有包含数百万种化学化合物的库,却需要从中找出那极少数可能与特定致病蛋白结合并使其停止工作的分子。为了解决这个问题,研究人员使用计算机模拟来预测哪些分子能有效结合,这一过程被称为虚拟筛选。这一过程的核心是一个评分函数,它像是一个裁判,通过数学工具对数百万个候选者进行排名,以决定哪些值得在真实的实验室中进行测试。几十年来,这些“裁判”一直依赖于简化的规则来估算药物与目标的契合程度。然而,这些规则往往忽略了分子相互作用中复杂而微妙的方式,导致准确率进入了一个瓶景观,即计算机难以区分真正的候选药物与化学死路。
为了克服这一困难,科学家们转向了机器学习,教计算机直接从大量的现有数据中学习结合规则,而不是依赖预先编写的公式。虽然这些新的数字裁判展现出了潜力,但它们的表现并不稳定,往往在受控测试中表现卓越,但在面对现实世界的复杂性时却表现不佳。一个关键问题仍然存在:这些机器学习模型是真的理解药物如何与蛋白质结合,还是仅仅记住了测试数据中的模式,而这些模式并不反映现实?这种不确定性对于像单胺氧化酶 B(一种与帕金森病相关的脑部酶)这样的靶点尤为重要,因为寻找更好的抑制剂可能会带来更有效的治疗手段。
最近的一项研究专门针对这种特定的酶——单胺氧化酶 B,旨在构建并测试新一代机器学习裁判。研究人员首先承认了这些模型通常测试方式中的一个缺陷。标准测试通常使用“诱饵”,即看起来像真实药物但缺乏结合能力的虚假非活性分子。研究发现,当机器学习模型针对这些诱饵进行测试时,表现得异常出色,似乎能高精度地识别出活性药物。然而,当研究人员将其切换到由完全由实验证实的真实非活性化合物组成的更严格测试集时,标准现成模型的表现便崩溃了。此前表现最好的通用模型,曾一度显示能正确找到近 80% 的顶尖候选者,但在严苛测试下,其表现降至几乎与随机猜测无异的水平。这种剧烈的下降表明,早期的超高分是由测试数据设计的特殊性所创造的幻象,而非真正理解能力的体现。
研究团队并未因此退缩,而是构建了一个专门针对单胺氧化酶 B 数据进行训练的定制机器学习模型。他们向计算机输入了数千种已知的活性药物和大量的非活性诱饵,教它识别蛋白质与分子之间相互作用的特定模式。研究人员测试了多种不同的方法,以观察哪种效果最好。他们将仅将分子分类为“活性”或“非活性”的模型,与尝试预测精确结合强度的模型进行了对比。他们还测试了在描述分子如何接触蛋白质的同时,加入对分子化学形状的描述是否会有所帮助。结果显而易见:预测结合强度的模型始终优于仅进行简单是非分类的模型。此外,将分子形状的描述与相互作用细节相结合,可以实现最准确的预测。
表现最成功的模型——一个经过高度调优的机器学习算法版本——在针对严苛的真实非活性化合物集进行测试时,识别活性药物的速率是表现最好的通用模型的三倍。然而,这一成功伴随着一个显著的限制。当研究人员分析该顶尖模型所找到的分子时,他们发现该模型很大程度上是在检索与其在训练期间见过的活性药物非常相似的化合物。该模型非常擅长识别已知药物的“化学亲戚”,但它在寻找计算机从未接触过的全新类型分子方面却显得力不从心。这表明,虽然定制模型是寻找现有疗法变体的一种强大工具,但它尚未具备扩展到全新化学领域的通用能力。
研究结论指出,药物研发的未来路径需要更严格的测试。过去许多机器学习工具表现出的成功,可能由于使用了无法反映真实筛选难度的简单测试集而被人为夸大了。为了构建真正可靠的工具,未来的研究必须使用由真实非活性化合物组成的测试集,并仔细区分一个模型是学会了识别特定的化学形状,还是学会了药物与蛋白质结合的基本规则。对于单胺氧化酶 B 以及可能存在的许多其他药物靶点而言,最有效的策略是使用结合了结构细节与化学描述的定制训练模型,同时要意识到,这些模型目前最擅长的是寻找它们已知的事物,而非发现未知的事物。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。