Clinical trial success prediction from open registry text using classical machine learning
本研究表明,经典的机器学习模型(尤其是随机森林)仅利用来自 ClinicalTrials.gov 的公开注册文本,即可有效预测临床试验的成功,通过严格的预处理减轻了数据泄露问题,并在不同的试验阶段和适应症中实现了中等至强劲的性能表现。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
每年,制药公司都会投入数十亿美元和数十年的努力来研发新药。从实验室中一个有前景的想法到药店货架上的药片,这条道路漫长且充满失败。大多数候选药物都无法最终获批,而当它们在多年的工作后宣告失败时,其造成的经济损失是巨大的。更重要的是,参与这些研究的志愿者面临着风险,却未必能获得预期的收益。由于资源是有限的,将每一美元和每一小时浪费在最终会失败的药物上,都是对可能成功药物资源的占用。长期以来,业界一直寻求一种能够及早发现这些注定失败的候选药物的方法,在投入过多时间和金钱之前就将其识别出来,从而让研究人员能够停止那些弱势项目,并将精力集中在强势项目上。
为了实现这一目标,科学家们一直试图预测临床试验的结果,即对新疗法进行严格测试的过程。这些预测非常困难,因为它们依赖于对复杂人体生物学、特定研究设计以及新药行为的理解。传统上,专家们依靠经验来猜测哪些试验会成功,但这个过程缓慢、主观且昂贵。近年来,研究人员转向了机器学习,利用计算机寻找人类可能会忽略的数据模式。然而,许多此类计算机模型依赖于只有大公司才能获取的私有数据,或者需要并不总是可获得的复杂分子信息。这使得小型团体和学术研究人员缺乏一种明确的方法来评估试验成功的可能性。
独立研究员迈克尔·多恩(Michael Doane)的一项新研究探讨了这些临床试验的公开记录(任何人都可以通过网络在线阅读)是否包含足够的信息来进行此类预测。该研究聚焦于来自一个名为 ClinicalTrials.gov 的公共网站的海量试验记录。该网站作为一个全球注册库,要求研究人员在研究开始前进行登记,并发布关于所治疗疾病、所测试药物、涉及患者人数以及研究目标等细节。多恩的工作提出了一个简单的问题:如果你将这些公开记录中的文本描述输入计算机,计算机能否学会区分哪些试验会成功,哪些会失败?
为了回答这个问题,研究人员使用了一个名为“临床试验结果数据集”(Clinical Trial Outcome Dataset)的数据集,该数据集为大约 12.5 万项过去的试验提供了标签,根据其最终结果将其标记为成功或失败。挑战在于构建一个能够仅利用在试验注册时公开注册的文本来预测这些结果的模型,而不去窥探最终结果或使用任何公司的私有数据。研究人员必须极其小心,以避免一个常见的错误,即“数据泄露”——在这种情况下,计算机模型可能会通过阅读试验结束后更新的部分文本而意外地得知答案。例如,一项试验的摘要可能会在几年后被重写以包含最终结果,如果计算机阅读了这段更新后的文本,它就不是在进行预测,而是在阅读过去。
为了防止这种情况,研究人员细致地清洗了数据,删除了任何文本可能在结果已知后被修改过的记录。他们还剔除了直接描述结果的特定字段。数据安全后,他们训练了三种不同类型的计算机模型来寻找剩余文本中的模式。这些模型在不同的开发阶段(称为“期”)进行了测试。1 期试验是药物首次在人体中进行测试,以检查安全性;2 期试验观察药物是否具有实际疗效;3 期试验则是大规模研究,旨在确认药物在获批前的有效性和安全性。
结果显示,计算机模型确实能在公共文本中发现有用的信号。表现最好的模型采用了被称为“随机森林”(random forest)的方法,它能够比随机猜测更好地区分成功与失败的试验。在最早的测试阶段,即 1 期试验中,该模型的表现相当出色,正确排列结果的准确率约为 74%。这意味着,如果你选取一组 1 期试验,该模型能够以高度的准确性识别出那些更有可能成功的试验。对于 2 期试验,其表现较低,因为 2 期试验极难预测,它们在很大程度上取决于药物是否击中了正确的生物靶点,而这一细节往往在公开摘要中是缺失的。然而,该模型在这一阶段的表现仍然优于随机猜测。
最有趣的发现之一是,在广泛的疾病种类上训练模型,实际上有助于它预测神经科学领域的特定结果。神经科学试验处理的是如阿尔茨海默症和抑郁症等疾病,这类领域的试验历史上失败率极高。研究人员发现,当计算机接受涵盖所有医学领域的试验训练,而非仅仅是神经科学领域时,它在预测神经科学试验的成功方面变得更加出色。这表明,临床试验设计的通用规则在不同类型的疾病之间是相似的,通过学习广泛的案例,计算机可以更好地理解神经系统的特定挑战。
该研究还将模型与一组经过人类专家人工审核、确保并非易于猜测的 7,260 个困难案例进行了对比。即使面对这些棘手的例子,该模型仍保持了区分成功与失败的能力,证明它不仅仅是在记忆简单的规则,而是真正学习到了有关临床试验本质的知识。研究人员还检查了模型是否依赖于赞助试验的公司名称或举办地点。当这些细节被移除后,模型的表现仅轻微下降,这表明描述科学内容和研究设计的文本承载了大部分的预测权重。
这项工作证明,多年来一直存在但很大程度上未被如此分析的公共信息,对制药行业具有重大价值。本研究中使用的模型相对简单,不需要强大的超级计算机或秘密数据;它们可以在标准笔记本电脑上运行。这使得该方法对于没有权限访问专有数据库的学术研究人员、非营利组织和小型公司来说是触手可及的。通过提供一种仅利用公开数据来评估成功可能性的方法,该手段为筛选候选药物提供了一种新工具。它并不取代对专家判断的需求或药物开发的复杂工作,但它提供了一个可靠且客观的起点。它可以帮助团队决定哪些项目值得投入更多关注,哪些项目可能需要及早停止,从而有望节省时间、资金以及为这些关键研究提供志愿服务的患者的福祉。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。