Position: Medical AI Neglects Real Treatment Outcomes
本立场文件认为,医疗人工智能对人类观点和文本综述而非来自观察性和实验性来源的实际治疗结果数据的依赖,严重限制了其潜力,因此必须转向将真实世界的结果数据纳入训练与评估,以更好地实现改善患者健康的最终目标。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
医学领域一直以来都是一个通过数据来区分“良好的猜测”与“挽救生命的决策”的关键领域。几十年来,医生们已经不再仅仅依赖于个人专家的直觉,而是转向了一个建立在成千上万名患者集体经验之上的系统。这种被称为“循证医学”的方法,旨在将每一项决策都建立在治疗的实际结果之上,而非仅仅基于其背后的理论。这个系统不仅询问一种药物“应该”起什么作用,更关注它对服用者的“实际”作用。近年来,一种新的工具进入了这个领域:人工智能。这些被称为大语言模型的计算机系统,在阅读医学文献、诊断疾病以及预测未来健康风险方面展现出了卓越的能力。它们通过学习大量的医学期刊、教科书和临床指南进行训练,从而学会模仿人类专家的语言和推理方式。
然而,在这些智能系统的构建和测试方式上,出现了一个关键性的差距。虽然它们在识别疾病或预测谁可能生病方面变得越来越出色,但它们并未被教导去理解所推荐治疗方案的真实后果。当今研究人员面临的核心问题是:这些机器是在从医学书籍中记载的故事中学习,还是在从患者预后那复杂且往往混乱的现实中学习?如果人工智能仅通过专家的观点和指南中的规则进行训练,它可能会学会如何听起来像一名医生,却从未真正理解当治疗应用于真实人类时会发生什么。这种区别不仅仅是一个学术细节;它是“只会背诵规则的系统”与“能够真正改善健康”之间的本质区别。
一篇新的立场论文指出,当前一代医学人工智能未能从真实的治疗结果中学习。这些作者——来自哈佛·皮利姆医疗保健研究所(Harvard Pilgrim Health Care Institute)和哈佛医学院的研究人员——认为,尽管这些模型被喂入了海量的医学文本,但它们在很大程度上缺失了最重要的资料:即患者接受护理后实际发生了什么的记录。该论文指出,该领域过于关注中间步骤,例如诊断某种疾病或预测某种风险,而忽略了医学的终极目标:通过治疗来改善患者的健康。研究人员指出,大多数医学人工智能模型是基于静态文档进行训练的,例如临床指南、药物标签和发表的病例报告。这些来源代表了医学界在特定时刻的共识,但它们无法捕捉到治疗在不同人群中随时间演变的动态、长期的现实情况。
为了说明依赖这些静态来源的危险性,研究人员观察了当前的 AI 模型如何处理复杂的医学场景。他们研究了一个具体的案例,涉及一名患有罕见胰腺炎的患者,该患者通过使用一种名为 ivacaftor 的药物得到了成功治疗。在现实世界中,这种治疗是有效的,但该药物的官方标签(一种被广泛用于训练许多 AI 系统的政府批准文件)并未列出这一特定用途。当研究人员要求 AI 模型评估该药物对该患者的效用时,该模型由于依赖官方标签,错误地得出结论认为该药物无效。该模型本质上是在遵循书本中的规则,而不是遵循患者康复的现实。尽管 AI 可以获取描述成功治疗的病例报告,但由于其在僵化的药物标签上的训练覆盖了实际结果的证据,导致了这一错误。研究人员发现,这个问题广泛存在。当他们针对涉及临床指南的类似场景测试其他模型时,这些系统经常无法识别出医生可能需要偏离标准规则以帮助特定患者的复杂情况。
该论文进一步强调,这些人工智能系统的评估方式也是问题所在。许多基准测试(即用于衡量 AI 表现的测试)依赖于人类专家对答案进行评分。研究人员认为,让一群医生对答案达成一致并不等同于掌握了真相。在一项分析中,他们发现用于给 AI 答案评分的许多标准仅仅是直接引用指南的内容,而非反映实际的临床成功。这造成了一种循环逻辑:AI 根据指南进行训练,根据指南进行测试,然后因为遵循了指南而受到赞赏,即便这些指南已经过时或并不适用于每一个个体。研究人员认为,这种方法限制了人工智能成为医学真正合作伙伴的潜力,使其无法实现发现新见解,而只能重复已有的内容。
作者们提议对医学人工智能的开发方式进行根本性的转变。他们建议不要主要基于文本来训练这些系统,而是使用纵向患者数据,例如电子健康记录和保险理赔记录,这些记录追踪了给予了哪些治疗以及患者随后发生了什么。这些记录包含了现实世界的证据,展示了疗法与患者康复或恶化之间的因果关系。研究人员还建议,对这些模型的测试应当从“要求其背诵指南”转向“要求其预测现实世界实验的结果”或“模拟临床试验的结果”。通过将这些系统的训练和评估扎根于实际的患者预后,该领域有望迈向一个未来:人工智能能够帮助医生做出不仅在理论上成立,而且在实践中对眼前的患者行之有效的决策。
该论文并不意味着目前的医学人工智能是无用的,也不认为现有的基准测试完全没有价值。研究人员承认,这些工具已经取得了快速进展,并在诊断和信息检索等领域展示了宝贵的能力。然而,他们认为,如果继续沿用相同的方法进行训练和评估,将会阻碍下一次飞跃的到来。目标并非抛弃医学文献中所包含的知识,而是要确保用于利用这些知识的人工智能系统同时也锚定在患者护理的现实之中。通过将真实的治疗结果纳入其核心开发过程,研究人员相信医学人工智能可以从一个“阅读规则的系统”进化为一个“理解后果的系统”,从而最终帮助编写更好的指南,并改善全球患者的健康状况。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。