Trust gap in clinical artificial intelligence: a meta-systematic review
这项针对130项临床AI研究的元系统性综述揭示了一个显著的“信任差距”,即技术性能被置于有意义的伦理整合之上,这由声称的与实际进行的信任相关考量之间的21.4%的一致性所证实,并由此提出了一个用于实现更负责任AI实施的新型多维框架。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
大局观:建立在摇晃地基上的大厦
想象一下,医疗人工智能(AI)领域就像一个宏大的建筑工程。在过去的几年里,工程师们一直在建造极其高耸、华丽的塔楼(即 AI 系统),以帮助医生诊断疾病和规划手术。他们投入了数以亿计的时间来确保这些塔楼结构稳固,测量高度,并检查它们是否能承重。
然而,这篇论文指出,尽管工程师们痴迷于塔楼的高度和强度,但他们完全忘记了建造一个地基或一个门铃,好让人们能够真正信任这些建筑。
作者 Asefeh Asemi 研究了 130 份不同的“关于报告的报告”(称为元系统综述),这些报告发表于 2022 年至 2025 年之间。这些报告本应是对 AI 塔楼进行的最终检查。重大的发现是:检查员只检查了砖块,却忽略了建筑内部居住者的安全性。
核心问题:“伦理洗白”(Ethics-Washing)
这篇论文引入了一个概念——“伦理洗白”。
这就像是一个汽车销售员在车身上贴了一个巨大的、闪亮的标签,上面写着“100% 安全家庭用车”。但当你打开引擎盖时,却发现刹车缺失,安全带也无法使用。销售员在谈论安全,但他们并没有在汽车中真正构建安全性。
研究发现,在临床 AI 领域:
- 言论: 许多报告在摘要中提到了“伦理”、“信任”或“公平性”等词汇(就像那个闪亮的标签)。
- 现实: 当作者仔细查看这些报告的实际内容时,几乎没有一份报告真正解释了如何衡量信任,或者如何解决不公平问题。
- 结果: 他们发现了一个“信任差距”。在 130 份综述中,零份报告真正从多维度的角度定义了什么是“信任”。他们只是假设只要 AI 足够准确,它就是值得信赖的。
信任的四个缺失支柱
论文认为,“信任”不仅仅是一件事(比如准确性)。它就像一张需要四条腿才能站稳的桌子。目前,AI 领域正试图仅靠一条腿来平衡这张桌子。
- 技术支柱(唯一站立的一条): 这关乎准确性、速度和数学。论文指出,89% 的综서仅关注这一点。它们在问:“AI 的诊断是否正确?”
- 人际支柱(缺失): 这关乎医生、患者与机器之间的关系。医生在使用它时是否感到舒适?患者是否感到安全?研究发现几乎没有人讨论这个问题(仅占 2.3% 的综述)。
- 制度支柱(摇摇欲坠): 这关乎规则、法律以及如果 AI 犯错谁来承担责任。如果 AI 导致患者死亡,谁该坐牢?是医生?程序员?还是医院?研究发现这一点几乎未被讨论(1 占 18.5%)。
- 认知支柱(完全消失): 这关乎“知识”。AI 是如何“知道”它所知道的东西的?如果 AI 给出了一个答案,我们是否理解其背后的原因?研究发现,在 99% 的情况下,这一点被忽略了。
危险区域:高风险领域
这项研究最令人警觉的部分在于缺乏信任发生的地点。
想象一家医院。最危险的地方是急诊室、手术室和心脏科病房。在这些地方,一个错误就可能瞬间夺走生命。
研究发现,在这些高风险领域使用的 AI 系统,其技术性能受到了最多的关注。然而,这些也是伦理检查做得最少的领域。
- 类比: 这就像是在拥挤的城市里给一名赛车手一辆赛车。这辆车速度极快(高性能),但没有人检查驾驶员是否有驾照、车辆是否有安全带,或者道路对行人是否安全。车开得越快,撞车时的后果就越惨烈。
“孤岛”效应:人们互不沟通
论文还注意到,构建这些系统的人与应该检查它们的人之间缺乏沟通。
- 技术人员在编写关于数学和代码的报告。
- 医生在编写关于患者护理的报告。
- 伦理学家在编写关于对与错的报告。
他们都处于各自独立的房间(孤岛)中。很少有报告尝试将这三组人聚集在一起。研究发现,只有 6.9% 的综述是真正的“跨学科”研究(融合了这三个群体)。这意味着我们正在制造一些在数学上近乎完美,但在真实医院中却毫无用处甚至可能带来危险的工具。
解决方案:CAIEE 框架
为了解决这个问题,作者提出了一个名为 CAIEE 框架(临床 AI 伦理参与)的新蓝图。
你可以将其理解为一套新的建筑检查清单,用于建造 AI 医院。与其只检查塔楼的高度,这套清单会强制要求建设者检查:
- 技术信任: 它准确吗?
- 人际信任: 医生和患者使用它时感到安全吗?
- 制度信任: 规则和责任是否明确?
- 认知信任: 我们理解它的思考方式吗?
底线结论
论文总结道,医疗 AI 领域正面临一场**“真实性危机”**。我们口头上说关心伦理和信任,但我们的行动(以及研究报告)表明,我们真正关心的只有速度和准确性。
在我们开始为信任之桌搭建另外三条腿之前,医院里的 AI 系统可能会非常聪明,但它们对于那些最需要它们的人来说,将是不安全、不公平且无法获得真正信任的。论文敦促研究人员停止仅仅“谈论”伦理,而是开始在系统中真正衡量并构建伦理。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。