← 最新论文
📄 medicine

Premarket transparency and postmarket observability in FDA-authorized AI-enabled medical devices: a source-linked cross-sectional study

这项针对经 FDA 授权的 AI 赋能医疗器械的横断面研究表明,尽管上市前报告的完整性在近年来显著提高,但前瞻性证据记录仍然稀少,且上市后可观测性并不均衡,这强调了需要通过透明度措施来支持证据监测,而非用于设备排名或缺乏依据的安全结论。

原作者: Olga Lavinda

发布于 2026-07-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Olga Lavinda

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,医疗技术的世界就像一座规模宏大、繁忙有序的图书馆,每一项新发明都会获得一张特殊的身份卡。多年来,这座图书馆里最令人兴奋的新书都是由“智能”计算机编写的——即人工智能(AI),它们可以帮助医生识别疾病、阅读X光片或监测心跳。但棘手之处在于:仅仅因为一本书有一个闪亮的封面,并不意味着我们完全了解其内部的内容,也不意味着当灯光熄灭、现实世界变得复杂混乱时,这个故事依然站得住脚。

为了了解这些“AI医生”是否已经准备好胜任工作,我们需要观察两件事。首先是“上市前”(Premarkal)检查。这就像作者在书出版之前,向一位严厉的图书管理员(FDA)展示他们的作业。我们想知道:他们是否在不同类型的人群中进行了测试?他们是否在许多不同的医院中进行了测试?他们是否展示了得出答案背后的数学逻辑?其次是“上市后”(Postmarket)检查。这是在书售出之后发生的事情。这就像观察图书馆的“读者反馈”箱。如果一本书有错别字或章节令人困惑,人们会写信来投诉吗?如果图书馆没有足够的反馈表,或者反馈表丢失了,我们就无法真正判断这本书对每个人是否都是安全的。大问题在于:新的AI医疗设备是否越来越擅长向我们展示他们的作业,并且一旦它们开始投入使用,我们是否真的能看到他们的反馈表?


作业检查:作者们是否在展示他们的过程?

在这项研究中,一位名叫 Olga Lavinda 的研究人员决定扮演一名非常细心的图书管理员。她查阅了 FDA 公开的 AI 医疗设备名单,查看了 2011 年至 2026 年 3 月期间做出的 1,491 项不同决策。她并不是在检查这些设备是否完美,她只是在检查公开摘要(交给图书管理员的“作业”)是否包含了重要的内容。

她创建了一份包含七个关键项目的“成绩单”,这是她希望看到的项目:

  1. 他们是否提到了使用真实的患者数据?
  2. 他们是否给出了至少一个关于 AI 表现如何的清晰评分?
  3. 他们是否描述了患者的特征(如年龄或性别)?
  4. 他们是否在不止一家医院进行了测试?
  5. 他们是否在 AI 从未见过的数据上进行了测试?
  6. 他们是否使用了不同类型的扫描仪或机器?
  7. 他们是否展示了 AI 在特定人群中的表现?

结果既有令人欣喜的消息,也有“仍在努力中”的消息。在早期阶段(2011–2020 年),这些设备中只有约 16.5% 的摘要勾选了这七项中的五项或更多。但到了 2024–2026 年,这个数字跃升至 59.5%。这就像作者们突然开始为他们的故事编写更加详细的引言了。他们更有可能说明:“我们在三家医院进行了测试,”或者“我们确保了它适用于不同年龄的人群。”

然而,有一件事并没有得到明显的改善:“前瞻性或读者研究”(Prospective or Reader Study)。这是一个高级说法,意思是:“我们是在真实患者走进诊室时进行测试的,还是让一群医生来看 AI 的答案以观察他们是否达成一致?”这种情况仍然很少见,在所有年份中一直维持在 16–18% 左右。这仿佛作者们仍然主要是在向我们展示他们的练习题,而不是正在进行的实时期末考试。

反馈箱:我们能否看到后续情况?

一旦这些设备进入现实世界,研究人员就开始观察“上市后”的一面。她尝试将每件设备与其公开的反馈历史联系起来,特别关注了 MAUDE 数据库(一个医生和医院报告问题的系统)。

在这里,故事变得更加复杂。在 1,477 件可以关联到反馈记录的设备中,只有约 54% 拥有足够的历史记录来甚至计算出趋势。可以把这想象成评价一家新开的餐厅。如果餐厅上周才开业,你还无法判断食物的好坏,因为还没有足够的人去吃过并留下评论。研究发现,对于最新的设备(2024–2026 年),只有约 45% 拥有足够的公开反馈历史来进行分析。而对于较旧的设备(2011–2020 年),这个比例较高,达到了 71.7%。

研究人员还调查了“召回”(即产品被撤离货架)的情况。她发现,在过去两年中,约 47.7% 的设备在其产品类别中出现了召回通知。但她非常谨慎地指出,这并不意味着该特定设备被召回了。这就像看到一个针对整个汽车品牌的“警告:检查您的轮胎”通知;这并不意味着你的那辆车就有胎压不足的问题,只是说明该类别存在一些问题。

大局观

那么,这一切意味着什么?这项研究表明,AI 医疗设备的公开“作业”正变得越来越完整。制造商在告知我们他们测试了哪些工具以及测试了哪些人群方面做得越来越好了。然而,“期末考试”——即在真实患者发生的实时测试——仍然很罕见。

此外,尽管“作业”做得越来越好,但对于最新的设备来说,“反馈箱”往往是空的,仅仅是因为它们投放市场的时间还不够长,还没有积累起足够多的评论者。研究人员强调,仅仅因为一份摘要很详细,并不意味着设备是完美的;同样,即便我们目前在公开反馈箱中没看到问题,也不代表不存在问题——可能只是时间还太早,尚无法判断。

简而言之,图书馆在整理书籍和编写更清晰的摘要方面做得越来越好了,但我们仍需再等待一段时间,才能看到这些故事在现实世界中被阅读时是否依然站得住脚。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →