TAG-lite: a pre-training task-affinity workflow for multi-task ADMET learning with disjoint datasets
本文介绍了 TAG-lite,这是一种基于梯度的预训练工作流,通过估算不相交 ADMET 数据集之间的任务亲和力,从而有效地对端点进行分组,并在化合物重叠极小的情况下提高多任务学习性能。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在将新药带给患者的竞赛中,从化学结构到安全、有效药物的旅程充满了障碍。科学家必须预测一个分子在人体内的行为:它会被肠道吸收吗?它会在血液中流动吗?肝脏会过快地分解它吗?还是它会毒害心脏?这些属性统称为 ADMET,是临床成功的守门员。几十年来,研究人员一直依赖计算机模型进行这些预测,通过训练人工智能来识别分子结构中的模式。然而,一个持久的挑战在于如何高效地教导这些模型。虽然同时教导模型许多不同的属性看似合乎逻辑,但盲目这样做往往会适得其反。如果这些“课程”发生冲突,模型就会变得困惑,导致无法学好任何一项。现代药物研发的核心问题一直是:你如何知道哪些属性可以一起学习而不导致性能崩溃?
一组研究人员开发了一种名为 TAG-lite 的新方法来解决这个难题,它提供了一种映射不同药物属性之间兼容性的方法,即使这些属性的数据来自完全不同的化学物质集合。传统上,科学家试图通过并排测试或基于生物学类别进行猜测来确定哪些任务可以组合在一起。这种方法速度缓慢,且往往依赖于直觉。这项新研究利用了来自 2 种不同药物属性的数据,证明了测量任务之间的“亲和力”(本质上是它们的学习信号如何对齐)是可能的,甚至不需要在两个数据集中看到同一种化学物质。通过分析计算机模型为每个任务调整其内部设置的方向,研究人员发现他们可以非常准确地预测哪些组合会相互促进,而哪些会损害性能。
研究人员将这种方法应用于被称为“治疗数据共同体”(Therapeutics Data Commons)的海量数据集合,其中包含 2 种不同药物属性的信息。该领域的一个主要障碍是数据是“不相交的”,这意味着针对一种属性测试的具体化学物质很少与另一种属性测试的化学物质相同。事实上,对于大多数属性对,化学化合物的重叠率不到 1%。此前的理论认为,当重叠如此之低时,测量任务之间如何关联是不可能的。TAG-lite 工作流挑战了这一假设。团队在一个共享的计算机模型上同时训练了所有 2 种任务。随着模型的学习,它为每个任务生成了一个独特的“梯度”——这是一个数学信号,指示模型需要向哪个方向调整以改进对该特定属性的预测。通过比较不同任务之间这些信号的方向,研究人员创建了一个兼容性图谱。
这张图谱揭示了任务之间的关系并非千篇一律。某些属性组(例如与肝脏处理药物相关的属性)自然会对齐并相互强化。而另一些(如某些清除率和抑制水平)则会向相反方向拉扯。利用这张图谱,研究人员将这 2 种任务聚类为七个不同的组。随后,他们测试了这些组以验证预测是否成立。结果令人瞩目:该方法成功预测了转移方向,AUC 达到 0.745。简单来说,如果系统说一组任务会配合良好,它们几乎总是表现良好;如果它说它们会冲突,它们也几乎总是冲突。即使对于绝大多数几乎没有共同化学数据的任务对,这一结论依然成立。
然而,研究也揭示了一个关键的细微差别。虽然该方法可以可靠地预测一组任务是会有所帮助还是会有所损害,但它并不总能精确预测当化学重叠极低时会产生多大的改进。在共享化合物低于某个阈值时,系统可以告诉你结果是正向还是负向,但效应的大小却变得难以预测。为了解决这个问题,研究人员将他们的亲和力图谱与一个简单的化学物质共享数量检查相结合。这种两步筛选规则——同时检查学习信号的对齐程度和共享数据的量——被证明是一个强大的过滤器。它成功识别了最有希望的组合,同时过滤掉了会导致负面结果的组合,例如某个特定的案例:该任务最初看起来是兼容的,但由于它与其伙伴几乎没有共享的化学空间,最终导致了失败。
研究结果表明,旧有的观点——即低数据重叠使得测量任务兼容性变得不可能——需要被修正。研究表明,虽然低重叠使得估算收益的幅度变得困难,但它并未消除检测关系方向的能力。研究人员发现,即使在稀疏数据环境中,学习信号的对齐仍然是决策的有效指南。通过使用这种方法,科学家现在可以在投入时间训练复杂模型之前筛选潜在的组合,从而节省计算资源并避免“负迁移”的陷阱。该方法并不声称是解决所有问题的万能灵药;它是一种识别哪些组合值得追求的筛选工具。它承认有些分组仍然会失败,但它提供了一种清晰的、数据驱动的方式来避免最明显的错误。
最终,这项工作为未来的药物研发提供了一个实用的工作流。它使该领域从猜测和试错转向更加战略性的方法。通过将任务的兼容性视为一种可以在联合训练开始前进行评估的可测量属性,研究人员提供了一种驾驭多任务学习复杂性的方法。研究证实,即使数据分散在不同的实验中,底层的数学信号也能揭示出连贯的结构。这使得研究人员能够通过将真正属于一类的任务进行分组,从而构建更好的模型,确保人工智能是从正确的伙伴关系中学习,而不是被相互冲突的指令所干扰。其结果是,为理解新分子在人体内的行为提供了一条更高效的路径,这是完成将安全有效的药物带向世界的漫长旅程中的关键一步。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。