The Clinical Trial Pipeline Reveals the Next Wave of Artificial Intelligence in Healthcare: A Multidimensional Analysis of 8,532 Registered Studies
本研究分析了 8,532 项已注册的临床试验,旨在揭示尽管医学人工智能领域已迅速从回顾性开发转向前瞻性评估——尤其是在影像学和预后学领域——但由于缺乏产生稳健临床证据所需的大规模、具有地理多样性且完全自主的试验,该领域仍受到限制。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你是一名正在试图破解谜题的侦探,但你寻找线索的地方不是犯罪现场,而是医学的未来。长期以来,科学家们一直在为医生构建“人工智能”(AI)。把 AI 想象成一个超级聪明的数字助手,它可以阅读 X 光片、倾听心跳声,或者扫描成千上万份患者记录以发现人类可能忽略的模式。但问题在于:仅仅因为一个计算机程序擅长解决测试题,并不意味着它已经准备好在真实的医院里拯救生命。为了知道它是否真的有效,医生必须在“临床试验”中对其进行测试。这些就像是严谨的科学实验,将 AI 置于与真实患者共同工作的环境中,以观察它究竟是提供了帮助、造成了伤害,还是毫无作用。目前,世界正处于这些测试的大爆发之中。每个人都想知道:这个数字助手会成为英雄、副手,还是仅仅是一个华丽的玩具?
这篇文章就像是一张覆盖了整个测试场的巨大地图。作者 Lior Rokak 不仅仅研究了几项研究;他挖掘了几乎所有全球 AI 医学试验的官方注册库,找到了 8,532 项已注册的研究。这就像是在统计特定工厂制造出的每一辆汽车,以观察正在制造什么样的车辆、它们被开往何处以及谁在驾驶它们。
这张地图揭示了以下内容:
疾驰的列车
最明显的一点是其发展的速度。在 2020 年之前,AI 试验就像是缓慢的细流。但在 2020 年之后,闸门开启了。事实上,78% 的所有试验(即大约 6,635 项)都是在 2019 年之后开始的。这仿佛整个领域在同一时间决定踩下油门加速。新试验的数量增长如此之快,以至于即便 2026 年尚未结束,它也已经在通往历史上最繁忙一年的轨道上了。
他们在测试什么?
论文将这 8,532 项试验细分为不同的类别,就像按类型对一大堆玩具进行分类一样。
- “眼睛”(影像学): 最大的群体仍然是观察图像(如 X 光片和 MRI)的 AI。这类试验有 2,475 项。它之所以最受欢迎,是因为图像对于计算机来说很容易理解。
- “耳朵和嘴巴”(文本与语言): 这是增长最快的群体。使用 AI 阅读医生笔记或与患者交流的试验在 2018 年至 2025 年间激增了 7 倍。这一激增发生在全球强大的“大语言模型”(即那些能写文章并能与你聊天的 AI)向公众开放之时。
- “水晶球”(预后): 在很长一段时间里,AI 主要用于诊断患者当前患有的疾病(例如“你骨折了”)。但现在,趋势正在发生转变。目前有稍多一些的试验(4,324 项)试图预测未来会发生什么(例如“该患者明年患心脏病的风险很高”),而不仅仅是诊断当前的疾病(3,828 项)。
- “行动英雄”(治疗): 这是房间里最安静的部分。只有 768 项试验(约占 9%)在测试能够实际推荐具体治疗方案或调整剂量的 AI。论文指出,虽然我们在识别问题和预测未来方面做得很好,但在让 AI 明确告诉医生该怎么做这件事上,我们仍然非常谨慎。
“沉默”阶段
一个重要的发现是,大多数试验实际上还没有让 AI 做出决策。约 38% 的试验只是在观察旧数据(回顾性研究),另有 21% 是“沉默”的前瞻性试验。想象一下一名驾驶员实习生坐在真实的教练车里,看着路面并说:“我觉得我们应该左转”,但教练的手仍然握在方向盘上,并由教练完成实际的转向。AI 正在观察和学习,但它并没有在“开车”。论文指出,大部分流程仍在生成“算法证据”(数学逻辑是否成立?)而非“临床证据”(是否对患者有益?)。
极少数的“自主”者
然而,存在着一小部分“等级 4”的试验,在这些试验中,AI 被允许驾驶车辆。这类试验仅有 184 项。其中大部分(约 68%)集中在一个特定领域:管理糖尿病患者的血糖(“人工胰脏”)。这就像 AI 在某一场特定的比赛中拥有完美的战绩,但它还没有被允许参加其他运动。还有一些勇敢的试验在测试控制麻醉或呼吸机的 AI,但对于几乎所有其他医学领域,AI 目前仍只是乘客。
谁在参与,在哪里参与?
地图还显示了一些不公平现象。
- 专业领域: 一些医学领域得到了所有的关注。耳鼻喉科医生有 1,994 项试验,而癌症专家有 1,295 项。但像风湿病学(关节疾病)和医学遗传学等领域进行的试验却很少,尽管有数百万人受这些疾病困扰。这就像是一款电子游戏,每个人都在玩同一个关卡,而其他关卡则是完全空白的。
- 地理分布: 试验主要发生在三个地方:西欧、北美和东亚。它们合计占了所有试验的 86%。与此同时,非洲、南美洲和南亚合计占比不到 5%。这是一个问题,因为基于纽约或伦敦患者训练出来的 AI,可能无法很好地适用于内罗毕或孟买的患者。论文指出,如果我们不解决这个问题,这种“数字医生”可能无法帮助到那些最需要它的人。
底线
论文总结道,临床 AI 已成功完成了它的第一大步:从计算机实验室走向现实世界测试。但它尚未完成第二个、更重要的步骤。我们仍然需要更大规模、更多样化且更严谨的测试,来证明这些系统确实改善了患者的生活。AI 的“下一波浪潮”已经到来,但它目前集中在特定的领域,主要处于“观察”而非“行动”状态,且主要集中在富裕地区。为了确保这项技术能造福所有人,下一阶段的研究需要在地理、专业领域以及现实世界的决策能力方面填补空白。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。