Regulatory Approval Is Not Enough: Gaps in Trustworthy AI Reporting in FDA-Cleared Medical Devices
这项研究表明,FDA 对人工智能赋能的医疗器械的批准并不保证其人工智能的可信度,因为对 519 份报告的全面分析显示,在记录可解释性和可追溯性等关键原则方面存在显著且持续的差距,这表明仅凭监管批准不足以验证系统的可信度。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个这样的世界:你的医生拥有一个超级智能的数字助手,它能帮助诊断疾病、识别 X 光片中的肿瘤,或者在心脏病发作前做出预测。这并非科幻小说,而是医疗保健领域的人工智能(AI)。但就像一辆新车在驶上公路前需要进行安全检查一样,这些“数字医生”也需要一份“执照”才能上岗。在美国,食品药品监督管理局(FDA)扮演着交通警察的角色,负责检查 AI 的计算是否准确,并确保其运行无误后才给予绿灯通行。
然而,获得执照仅仅是故事的一半。当你买车时,你会得到一本手册,告诉你它在雨中如何操控、在冰面上如何刹车,以及如果轮胎爆裂会发生什么。对于 AI,我们需要一份类似的“用户手册”,解释该系统是否对每个人都公平、在出现问题时是否值得信赖,以及我们能否理解它为何做出特定的决策。这个概念被称为“可信 AI”(Trustworthy AI)。它不仅仅关乎准确性,更关乎安全性、公平性、可解释性以及在现实世界中的适用性。核心问题在于:当 FDA 说一个 AI 已被“批准”使用时,公开的文书资料是否真的足以让我们信任它来守护我们的健康?
重大 AI 文书之谜
一群充满好奇心的研究人员决定扮演侦探,去破解 FDA 的文件柜。他们想看看官方的“摘要报告”是否真的包含了我们信任这些 AI 设备所需要的关键信息。他们不仅查看了 AI 是否取得了合格成绩,还观察了“成绩单”本身,看它是否提到了“可信 AI”的六条金律:公平性(是否存在偏见?)、普遍性(是否适用于所有人?)、可追溯性(能否追踪其历史记录?)、可用性(医生使用起来是否方便?)、稳健性(在压力下是否会崩溃?)以及可解释性(它能否说明做出选择的原因?)。
他们扫描了 2021 年至 2025 年间发布的 1,105 份 FDA 报告。经过严格的筛选以确保查看的是正确的文档后,他们最终得到了 519 份报告进行研究。这就像是打开 519 个神秘盒子,看看里面装了什么。
他们的发现:“缺失的手册”问题
结果有点像是打开一盒精美的新型电子产品,却发现大多数产品都没有附带说明书。
- 沉默的大多数: 近四分之一的报告(24.7%)完全没有提到任何一条关于可信度的规则。这就像制造商说:“这是一个机器人医生,”却没告诉你它是否公平、安全或易于理解。
- 单调的交响乐: 在那些确实包含信息的报告中,大多数仅讨论了一到两条规则。几乎没有任何一份报告涵盖了全部六条规则。事实上,零份报告能够为每一个原则提供证据。这就像一家餐厅只告诉你食物味道很好,却拒绝说明食材来源或厨房是否卫生。
- 明星表现者: 唯一受到大量关注的规则是稳健性。大约 57.6% 的报告提到了这一点。这就是“如果 Wi-Fi 变慢了,它会崩溃吗?”这类测试。制造商非常喜欢展示他们的 AI 是多么强韧。
- 机器中的幽灵: 两个对于理解 AI 最重要的规则几乎被完全忽略了。可追溯性(了解 AI 的历史)仅在 8.3% 的报告中被提及,而可解释性(AI 解释其推理过程)则是最大的缺口,仅出现在 3.5% 的报告中。这就像一位法官给出了判决,却拒绝告诉你他依据哪条法律做出的裁决。
时间或地点是否会产生影响?
你可能会想:“也许随着时间的推移,报告变得越来越好了?”或者“也许心脏科医生比眼科医生更擅长这些?”研究人员检查了这些想法,但答案是明确的:不。
- 时间旅行并无帮助: 无论报告是来自 2021 年还是 2025 年,可信度信息的质量并没有发生实质性的变化。设备获批的年份并不能预示更好的透明度。
- 专业领域也无法挽救局面: 无论 AI 是用于放射科(X 光)、心脏科(心脏)还是病理科(组织样本),情况都一样。无论是在哪些你预期会有高科技透明度的领域,这种“为什么”和“如何做”的缺失现象依然普遍存在。
核心启示
论文得出结论:获得 FDA 的“批准印章”不足以证明一个 AI 是可信的。仅仅因为一个设备被批准使用,并不意味着公开的文书资料向公众展示了全貌。目前的系统就像一辆通过了速度测试,却没告诉你刹车是否灵敏或安全气囊是否真实的汽车。
研究人员建议,我们需要一种新型的 AI“成绩单”。与其仅仅列出技术统计数据,不如要求制造商填写一份涵盖所有六项可信度规则的标准表格。他们需要解释如何检查偏见、如何确保 AI 对不同的人群有效,以及医生如何理解 AI 的决策。在此之前,我们对可信 AI 的期望与文书资料实际展示的内容之间的差距,依然是一个巨大的鸿沟。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。