← 最新论文
📄 medicine

Trust gap in clinical artificial intelligence: a meta-systematic review

这项针对130项临床AI研究的元系统性综述揭示了一个显著的“信任差距”,即技术性能被置于有意义的伦理整合之上,这由声称的与实际进行的信任相关考量之间的21.4%的一致性所证实,并由此提出了一个用于实现更负责任AI实施的新型多维框架。

原作者: Asefeh Asemi

发布于 2026-07-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Asefeh Asemi

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

大局观:建立在摇晃地基上的大厦

想象一下,医疗人工智能(AI)领域就像一个宏大的建筑工程。在过去的几年里,工程师们一直在建造极其高耸、华丽的塔楼(即 AI 系统),以帮助医生诊断疾病和规划手术。他们投入了数以亿计的时间来确保这些塔楼结构稳固,测量高度,并检查它们是否能承重。

然而,这篇论文指出,尽管工程师们痴迷于塔楼的高度和强度,但他们完全忘记了建造一个地基或一个门铃,好让人们能够真正信任这些建筑。

作者 Asefeh Asemi 研究了 130 份不同的“关于报告的报告”(称为元系统综述),这些报告发表于 2022 年至 2025 年之间。这些报告本应是对 AI 塔楼进行的最终检查。重大的发现是:检查员只检查了砖块,却忽略了建筑内部居住者的安全性。

核心问题:“伦理洗白”(Ethics-Washing)

这篇论文引入了一个概念——“伦理洗白”

这就像是一个汽车销售员在车身上贴了一个巨大的、闪亮的标签,上面写着“100% 安全家庭用车”。但当你打开引擎盖时,却发现刹车缺失,安全带也无法使用。销售员在谈论安全,但他们并没有在汽车中真正构建安全性。

研究发现,在临床 AI 领域:

  • 言论: 许多报告在摘要中提到了“伦理”、“信任”或“公平性”等词汇(就像那个闪亮的标签)。
  • 现实: 当作者仔细查看这些报告的实际内容时,几乎没有一份报告真正解释了如何衡量信任,或者如何解决不公平问题。
  • 结果: 他们发现了一个“信任差距”。在 130 份综述中,零份报告真正从多维度的角度定义了什么是“信任”。他们只是假设只要 AI 足够准确,它就是值得信赖的。

信任的四个缺失支柱

论文认为,“信任”不仅仅是一件事(比如准确性)。它就像一张需要四条腿才能站稳的桌子。目前,AI 领域正试图仅靠一条腿来平衡这张桌子。

  1. 技术支柱(唯一站立的一条): 这关乎准确性、速度和数学。论文指出,89% 的综서仅关注这一点。它们在问:“AI 的诊断是否正确?”
  2. 人际支柱(缺失): 这关乎医生、患者与机器之间的关系。医生在使用它时是否感到舒适?患者是否感到安全?研究发现几乎没有人讨论这个问题(仅占 2.3% 的综述)。
  3. 制度支柱(摇摇欲坠): 这关乎规则、法律以及如果 AI 犯错谁来承担责任。如果 AI 导致患者死亡,谁该坐牢?是医生?程序员?还是医院?研究发现这一点几乎未被讨论(1 占 18.5%)。
  4. 认知支柱(完全消失): 这关乎“知识”。AI 是如何“知道”它所知道的东西的?如果 AI 给出了一个答案,我们是否理解其背后的原因?研究发现,在 99% 的情况下,这一点被忽略了。

危险区域:高风险领域

这项研究最令人警觉的部分在于缺乏信任发生的地点。

想象一家医院。最危险的地方是急诊室手术室心脏科病房。在这些地方,一个错误就可能瞬间夺走生命。

研究发现,在这些高风险领域使用的 AI 系统,其技术性能受到了最多的关注。然而,这些也是伦理检查做得最少的领域。

  • 类比: 这就像是在拥挤的城市里给一名赛车手一辆赛车。这辆车速度极快(高性能),但没有人检查驾驶员是否有驾照、车辆是否有安全带,或者道路对行人是否安全。车开得越快,撞车时的后果就越惨烈。

“孤岛”效应:人们互不沟通

论文还注意到,构建这些系统的人与应该检查它们的人之间缺乏沟通。

  • 技术人员在编写关于数学和代码的报告。
  • 医生在编写关于患者护理的报告。
  • 伦理学家在编写关于对与错的报告。

他们都处于各自独立的房间(孤岛)中。很少有报告尝试将这三组人聚集在一起。研究发现,只有 6.9% 的综述是真正的“跨学科”研究(融合了这三个群体)。这意味着我们正在制造一些在数学上近乎完美,但在真实医院中却毫无用处甚至可能带来危险的工具。

解决方案:CAIEE 框架

为了解决这个问题,作者提出了一个名为 CAIEE 框架(临床 AI 伦理参与)的新蓝图。

你可以将其理解为一套新的建筑检查清单,用于建造 AI 医院。与其只检查塔楼的高度,这套清单会强制要求建设者检查:

  1. 技术信任: 它准确吗?
  2. 人际信任: 医生和患者使用它时感到安全吗?
  3. 制度信任: 规则和责任是否明确?
  4. 认知信任: 我们理解它的思考方式吗?

底线结论

论文总结道,医疗 AI 领域正面临一场**“真实性危机”**。我们口头上说关心伦理和信任,但我们的行动(以及研究报告)表明,我们真正关心的只有速度和准确性。

在我们开始为信任之桌搭建另外三条腿之前,医院里的 AI 系统可能会非常聪明,但它们对于那些最需要它们的人来说,将是不安全、不公平且无法获得真正信任的。论文敦促研究人员停止仅仅“谈论”伦理,而是开始在系统中真正衡量并构建伦理。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →