What Can Artificial Intelligence Learn from Medicine? Generative Analogies and Reliable Machine Learning Systems
本文采用赫塞(Hesse)的框架,将医学与机器学习之间的关系表征为一种“生成性类比”,并认为通过可靠主义视角来阐释临床转化价值,可以建立一种新型且独特的机器学习可靠主义,以应对当前的认识论和方法论上的不确定性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在过去的几年里,医生和计算机科学家开始合作开发人工智能工具,以帮助诊断疾病、预测患者预后并建议治疗方案。这些被称为机器学习系统的工具非常强大,因为它们可以发现人类可能会忽略的海量数据中的模式。然而,存在一个令人困扰的问题:这些系统通常像“黑盒”一样运作。它们产生结果却无法解释是如何得出这些结果的,并且依赖于统计学上的联系,而非关于治疗为何有效的明确理论。这给需要信任这些工具的医生带来了困境。如果计算机说一名患者患有某种疾病,但没有人理解它为什么这么说,医生如何能确定它是正确的?这种不确定性引发了一个难题:我们如何验证这些复杂、不透明的系统是否可靠到足以在真实的医院中使用?
两位哲学家埃马努埃莱·拉蒂(Emanuele Ratti)和莉娜·祖科夫斯基(Lena Zuchowski)提出了一种看待这个问题的新方法,即观察医学本身是如何处理类似的确定性问题的。他们认为,我们不应该试图强迫人工智能像我们通常期望的那样变得透明或具有可解释性。相反,他们主张我们应该借鉴医学验证新药的悠久历史。正如医生并不总是完全了解某种特定药物在体内的确切作用机制,但他们仍然知道它是安全且有效的,因为有经过严格测试的过程。研究人员建议,可以借鉴用于测试药物的这种严谨测试过程,来为信任人工智能建立一个新的标准。
他们论点的核心在于将两个截然不同的过程进行比较:新药的研发与机器学习系统的构建。在医学领域,当一种新药被发现时,科学家往往并不完全理解其背后的生物学机制。他们可能不知道该分子如何与人体细胞相互作用。尽管缺乏这种理论知识,该药物仍可以被证明是有效的。这是通过一个被称为“临床转化”的过程实现的,研究人员在该过程中系统地测试药物在许多不同条件下的表现。他们确定了正确的剂量、受益的具体患者类型以及可能失效的情境。通过收集这些信息,他们为药物的用途创建了一个详细的剖面,即使其内在的“原因”仍然是一个谜。
拉蒂和祖科夫斯基认为,机器学习系统面临着完全相同的情况。这些系统通常是“非理论性的”(atheoretic),这意味着它们不依赖于人类制造的理论;它们是“关联性的”(associationist),意味着它们寻找数据点之间的联系而不理解因果关系;它们也是“不透明的”(opaque),意味着它们的内部决策过程是隐藏的。因此,试图让人工智能解释其逻辑往往是不可能的。与其对抗这种本质,作者建议我们应该模仿医学的方法。我们不应该再要求人工智能解释其逻辑,而应该要求知道它工作的具体条件。
为了使这一想法具体化,研究人员开发了一个名为“学习系综”(learning ensemble)的新框架。可以将它想象成一本详细的说明书,其内容远不止仅仅说“这个计算机程序有效”。在医学中,一种药物不仅仅是一种化学物质;它是在特定方式下、针对特定人群使用的化学物质。同样,一个机器学习系统不仅仅是一段代码;它是一个只有在满足某些条件时才能运行的系统。“学习系综”就是定义这些条件的各种信息的集合。它包括关于用于训练该系统的数据的细节、运行该系统的特定硬件、接受过测试的患者类型,以及用于衡量其成功的精确指标。
作者将这些信息分为三个主要类别。第一类是“可靠性边界”。这一部分记录了构建该系统的环境。它会提出类似这样的问题:数据是干净且多样化的,还是杂乱且有限的?系统是在强大的计算机上测试的,还是在基础硬件上遇到了困难?如果数据仅来自一家医院,那么该系统在配合不同设备的其他医院使用时可能会失效。通过记录这些边界,使用者可以准确知道该系统在何处是安全的,以及在何处可能会崩溃。
第二类是“性能”。这不仅仅是一个表示系统准确率为 90% 的数字。相反,它要求一份关于系统在不同情况下表现如何的详细报告。例如,它对年轻人和老年人,或者对不同性别的人群是否同样有效?如果数据与训练数据略有不同,它的错误率是否会增加?研究人员强调,了解系统在哪里失败与了解它在哪里成功同样重要。如果一个系统擅长诊断一种癌症但对另一种癌症表现很差,那么这种特定的失败必须被记录下来,以免医生将其用于错误的病例。
第三类是“功能维度”。这关注的是该系统在现实世界中实际应该做什么。一个系统在数学上可能完美地预测一个数字,但如果这个数字不能帮助医生做出更好的决策,那么这个系统就是无用的。这部分内容检查系统的输出是否符合医疗团队的需求。例如,如果一个系统旨在帮助医生决定是否将患者收治入院,那么它必须经过测试,以验证它是否确实有助于做出该特定决策。如果系统被用于其并非设计的用途,那么无论它在原始任务上的表现多么出色,它都会变得不可靠。
研究人员通过现实世界的失败案例说明了这一方法的威力。他们指出了一项研究,在该研究中,一个人工智能系统声称通过观察人体内的细菌遗传组成来检测癌症。该系统最初看起来表现完美,准确率极高。然而,当研究人员仔细查看数据时,他们发现该系统根本没有学习到任何关于癌症的知识。它只是学会了识别数据采集过程中发生的一种特定错误,而这种错误恰好在癌症患者中更为常见。由于该系统是不透明的,这种错误被隐藏了起来。如果研究人员使用了“学习系应”框架,他们就会被要求记录数据来源和具体的测试条件。这种记录过程会揭示数据存在缺陷,并显示该系统依赖的是捷径而非真实的生物学联系。
另一个例子涉及一个旨在预测哪些肺炎患者有死亡高风险的系统。该系统学到,患有哮喘的患者实际上风险较低。这看起来违反直觉。原因是该系统了解到,哮下患者在医院接受了非常积极且有效的治疗,从而降低了他们的死亡风险。然而,如果医生使用这个系统来决定谁需要治疗,他们可能会误以为哮喘患者不需要护理。该系统基于数据在数学上是正确的,但从功能上看是危险的,因为它不理解医疗处理的背景。学习系应框架可以通过要求明确定义系统的用途并对照现实世界的医学知识来捕捉到这一点。
作者谨慎地指出,这个框架并没有解决机器学习如何运作的奥秘。这些系统仍然是不透明的,仍然依赖统计模式而非清晰的理论。学习系应的价值不在于使人工智能透明,而在于使“使用”人工智能的过程透明。它将焦点从问“计算机是如何思考的?”转向问“在哪些确切条件下我们可以信任计算机的答案?”这是一个微妙但至关重要的转变。它允许医生使用强大的工具,而无需理解其背后的复杂数学原理,只要他们拥有一张清晰的地图,指明这些工具在何处可以安全使用。
这种方法为我们在医学领域监管和评估人工智能提供了一种新途径。监管机构和医院不应要求每个算法都具有可解释性,而应要求为每个系统提供完整的“学习系应”。这份文件将作为可靠性证书,详细说明数据、性能和预期用途。如果一家医院想要使用某个系统,他们可以检查该系应,看其特定情况是否符合该系统已被证明有效的条件。如果条件不匹配,则不应使用该系统。这种方法接受了当前技术的局限性,同时提供了一种管理风险的稳健方式。
文章最后总结道,这个框架是向前迈出的务实一步。它并不声称解决了人工智能的所有问题,也不承诺这些系统永远不会犯错。相反,它提供了一种建立信任的结构化方式。通过将机器学习系统视为医疗手段——即重点在于使用的条件而非内在机制——我们可以为将这些技术整合到医疗保健中开辟一条更安全、更可靠的路径。目标不是让黑盒变得透明,而是建立一个可靠的指南,告诉我们究竟在何处可以安全地观察其内部。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。