Rigorous Evaluation of Large Language Models for Malaria Drug Discovery: Trade-offs in Performance, Scale, and Resource Utility
本文介绍了 Malaria-Instruct 数据集,并证明了针对特定领域的开源大语言模型(尤其是 TxGemma-9B 和 LlaSMol-Mistral-7B)进行微调,在疟疾药物发现的虚拟筛选任务中显著优于传统的机器学习模型和专有的前沿模型,从而证明了专门化训练对于实现可靠性能至关重要。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明
疟疾仍然是地球上最持久且最具致命性的传染病之一,每年夺走数十万人的生命,其中绝大多数病例发生在非洲。长期以来,对抗这种寄生虫的战斗一直依赖于几种关键药物,但这种疾病正在进化,对旨在阻止它的药物产生了抗药性。这产生了一个紧迫的需求:科学家需要发现全新的化学化合物类型,这些化合物能够在杀死寄生虫的同时不伤害人类宿主。传统上,寻找这些新药是一个缓慢且昂贵的过程,需要在实验室中测试数百万个分子。为了加速这一过程,研究人员使用计算机程序来预测哪些分子可能有效,甚至在它们接触试管之前。这个被称为“虚拟筛选”的过程就像一个过滤器,将庞大的可能性列表缩小到一个可用于现实世界测试的小规模、可管理的组别。
最近,一种被称为“大语言模型”的新型人工智能作为一种强大的工具出现在科学领域。这些模型最初是为了理解人类语言而训练的,但现在已被改编为能够阅读并理解分子的“化学语言”。其核心理念是,如果计算机可以从海量数据中学习化学模式,它或许就能预测哪些新分子会对疟疾有效。然而,一个关键问题仍悬而未决:这些以推理和解决问题能力闻名的通用型人工智能系统,是否只需通过展示几个例子就能学会寻找新的疟疾药物,还是说它们必须针对疟疾数据进行专门的重新训练才能发挥作用?来自 Magami Open Sciences Initiative 的一个研究小组决定通过一项旨在模拟药物研发困难现实的严谨测试来回答这个问题。
研究人员首先创建了一个名为 Malaria-Instruct 的专门数据集。他们从一个庞大的公共化学实验数据库中收集信息,并进行了仔细的清洗,以去除重复项并确保数据的连贯性。他们组织这些信息,使计算机能够将其读取为一组指令,将化学结构与其已知的生物效应配对。至关重要的是,他们设计的测试极其困难。在许多计算机测试中,用于训练的分子和用于测试的分子看起来非常相似,这使得计算机可以仅仅通过记忆模式而非真正学习来获胜。为了防止这种情况,研究人员对数据进行了拆分,使得测试组中的分子在结构上与训练组中的分子截然不同。这确保了人工智能必须真正理解化学规则才能取得成功,而不是仅仅识别熟悉的形状。
随后,他们对五种不同的开源人工智能模型进行了测试,将其与传统的计算机方法以及来自大型科技公司的最先进的专用模型进行了对比。团队测试了两种不同的方法:一种是仅向模型展示少量示例并要求其猜测答案,另一种是让模型在特定的疟疾数据上进行深度重新训练。结果是鲜明且具有决定性的。当模型仅被展示少量示例而没有经过任何重新训练时,它们完全失败了。即使是来自大型科技公司最先进的推理模型,表现也不比随机猜测好多少,无法区分出有效的药物和无效的药物。研究人员发现,逻辑推理的能力并不能转化为预测化学活性的能力;这些模型缺乏关于分子结构如何与疟疾寄生虫相互作用的特定且深层的知识。
然而,当相同的模型在疟疾数据上进行专门的重新训练后,结果发生了戏剧性的变化。经过重新训练的模型变得非常高效,其表现远超未经训练的人工智能和传统的计算机方法。其中一个经过生物医学数据预训练的模型,在区分活性药物和非活性药物方面达到了最高的整体准确度。另一个经过广泛化学任务训练的模型,则被证明最擅长在大量候选者中寻找“最优选”,这种技能被称为“富集”(enrichment)。这种特定技能在药物研发中至关重要,因为它意味着计算机可以从数百万个选项中进行筛选,并突出显示那极小部分最有希望成功的候选者,从而为研究人员节省时间和金钱。
这项研究还强调了使用这些工具时的实际情况。虽然重新训练后的人工智能模型更加准确,但它们比旧的、更简单的方法需要更多的计算能力和运行时间。研究人员发现,对于资源有限的研究人员来说,存在着速度与精度之间的权衡。简单的方法可以在一秒钟内筛选大量的化学库,而先进的模型虽然耗时较长,但能提供更好的候选选择。团队得出结论,最有效的策略可能是先使用快速、简单的方法过滤掉明显的失败品,然后再使用强大的、经过重新训练的人工智能来仔细检查剩余的候选者。
最终,这项研究表明,对于寻找新型疟疾药物这一特定且高风险的任务,通用人工智能是不够的。模型必须经过专门的学习,掌握疟疾化学的语言才会有用。研究证明,重新训练这些模型不仅是一个有益的选择,更是实现可靠结果的必要步骤。通过展示这些工具在经过适当训练后可以超越传统方法,研究人员为在资源受限环境下工作的科学家们提供了一条清晰的前行之路。他们表明,只要准备得当,开源人工智能就可以成为发现下一代救命药物的强大且易于获取的引擎。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。