← 最新论文
💻 computer science

Leveraging Machine Learning Models to Predict Probability of Technical and Regulatory Success

本文表明,基于 ClinicalTrials.gov 公开临床试验方案特征训练的可解释机器学习模型,能够准确预测小分子药物试验的技术与监管成功概率,其表现优于标准基准,并为风险调整后的估值提供了一种可复现的工具。

原作者: Mason Kim, Michael Doane, James Melican, Kevin Wang, Haewon Jung, Cedric Liu

发布于 2026-07-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Mason Kim, Michael Doane, James Melican, Kevin Wang, Haewon Jung, Cedric Liu

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你是一名正在决定是否投资一家新创公司的风险投资人。你知道大多数初创公司都会失败,但你想知道哪些公司最有成功的机会。在医学领域,这些“初创公司”就是新药,而“投资者”则是制药公司。

你提供的这篇论文是关于为这些制药公司构建一个**“水晶球”**。然而,他们使用的不是魔法,而是数学和公开数据,来预测一种新药能否在通往成为获批药物的漫长且艰辛的旅程中幸存下来。

以下是他们工作的简单化解读:

1. 问题所在:“药物成功率”的黑箱

开发一种新药极其昂贵且充满风险。平均而言,只有约 1/10 的新药能从测试开始到最终获得批准。

  • 传统方式: 公司通常通过观察历史平均水平来猜测成功概率(例如,“心脏病类药物的成功率为 15%”)或询问专家组以利用他们的直觉。
  • 问题在于: 历史平均值过于笼统(它们没有针对特定的药物进行观察),而专家的意见则可能存在偏见或反应过慢。此外,当今许多高科技预测模型就像是“黑箱”——它们能给出答案,但没人知道它们是如何得出结论的,而且它们通常需要普通人无法看到的秘密且昂贵的数据。

2. 解决方案:透明、公开的“天气预报”

作者希望构建一个满足以下条件的模型:

  • 可复现性: 任何人都可以构建它。
  • 可解释性: 你可以查看其内部机制,准确了解它为何做出某种预测。
  • 公开性: 它仅使用互联网上免费获取的数据(具体来说是 ClinicalTrials.gov,一个巨大的公共数据库,记录了大量的医学研究)。

他们将这种预测比作天气预报。正如气象学家利用过去的天气模式来预测降雨一样,该模型利用过去的临床试验数据来预测“药物降雨”(成功)或“药物干旱”(失败)。

3. 他们是如何构建模型的

  • 原料: 他们下载了数千个过去临床试验的信息。他们并没有查看秘密的化学公式或公司的私人报告。他们只观察了试验的“方案”(即规则手册):
    • 谁在出资?(发起机构/赞助商)
    • 它治疗什么疾病?(治疗领域)
    • 试验处于什么阶段?(第一阶段、第二阶段或第三阶段)
    • 试验是如何设计的?(是否是随机对照?患者群体是谁?)
  • 训练: 他们将这些数据输入到一个计算机程序中(“随机森林”模型,类似于由许多决策者组成的投票团队)。他们利用 2017 年之前完成的试验来教导这台计算机。
  • 测试: 然后,他们要求计算机预测 2017 年之后开始的试验结果,而这些试验是它从未见过的。这就像是在用旧的练习题教导学生后,再让他参加一场新的考试。

4. 结果:优于平均水平的猜测

计算机模型的表现优于行业内使用的标准“平均值”猜测。

  • 得分: 该模型的得分(称为 ROC-AUC)为 0.788。在预测领域,这是一个稳健的“B+”或“A-”水平,意味着它显著优于仅仅靠掷硬币或使用通用平均值的水平。
  • 布里尔分数(Brier Score): 这衡量了预测的“校准度”。如果模型说成功的概率是 70%,那么它是否真的在 70% 的情况下取得成功?该模型在这方面表现出色,这意味着它的概率是值得信赖的。

5. 模型学到了什么(“为什么”)

由于该模型具有透明度,作者可以询问它:“哪些因素最重要?”它给了他们三个主要答案,这些答案符合常识,并通过数据得到了证实:

  1. 发起机构很重要: 由大型制药公司资助的试验比由大学或政府资助的试验更有可能成功。(这可以理解为资金充足的初创公司对比车库里的创业项目)。
  2. 疾病类型很重要: 针对传染病代谢问题的试验成功率较高,而**癌症(肿瘤学)**领域的试验则要困难得多(成功率较低)。
  3. 阶段很重要: 随着药物接近终点线(第三阶段),成功的概率会上升。第二阶段是许多药物失败的“危险区”。

6. 局限性(不足之处)

作者诚实地说明了模型的局限性:

  • 它并不完美: 它不是一个 100% 准确的魔力预测器。它仍然会犯错。
  • 时间差距: 如果你用 10 年前的资料来训练模型并尝试预测今天的情况,它的准确性会略有下降,但它仍然比旧的基准要好。
  • 信息缺失: 该模型没有使用药物的实际化学结构或深层的科学文本,仅使用了临床试验的公开“规则手册”。加入这些细节可能会让它变得更聪明。

总结

这篇论文证明了,你不需要秘密、昂贵的数据或复杂且无法解释的 AI,就可以预测药物的成功。通过使用公开数据简单的、透明的数学方法,你可以构建一个工具,帮助公司在决定投资哪些药物时做出更明智的决策。这就像是为每个人提供了一张更好的地图,去应对药物研发这条充满风险的旅程。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →