← 最新论文
📄 medicine

Real-World Diagnostic Accuracy of Fully Autonomous, FDA-Approved Artificial Intelligence Systems for Diabetic Retinopathy Screening in the United States: A Systematic Review and Meta-Analysis

这项针对五项涉及超过10.8万次筛查接诊的美国真实世界研究进行的系统评价和荟萃分析显示,虽然经FDA批准的完全自主型糖尿病视网膜病变人工智能系统的敏感性(95.8%)保持在高水平,但其特异性(83.5%)在不同临床设置中表现出显著的变异性,这表明关键性试验的表现可能无法统一推广至真实世界的实践中。

原作者: Shreya Parimoo

发布于 2026-08-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Shreya Parimoo

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你的眼睛就像一台永不眠的高清摄像机,不断捕捉着周围的世界。但对于数百万糖尿病患者来说,一个被称为“糖尿病视网膜病变”的隐形小偷,正在慢慢划伤这台摄像机的镜头。如果任其发展,这个小偷会让画面变得模糊,直到彻底消失。好消息是,这个小偷通常动作缓慢且可预测。如果我们每年检查一次镜头,就能在划痕变得永久之前发现并修复它们。

然而,检查镜头并不容易。它需要专门的医生、昂贵的设备和大量的时间。许多人错过了预约,而且眼科医生的数量也远远不够。于是,“数字侦探”——人工智能(AI)登场了。这些是经过训练的计算机程序,能够观察眼底照片,并比人类更快地发现那些划痕。最近,政府的规则制定者——美国食品药品监督管理局(FDA)批准了两款特定的数字侦探,它们可以独立工作,无需人类医生先行复核。它们承诺会非常精准,几乎像是在电子游戏中拿到了满分。

但转折点在于:电子游戏是在受控的环境中进行的,光线完美且没有干扰。而现实生活是混乱的。当这些数字侦探被派往现实世界,进入灯光昏暗、员工疲惫、甚至患者无法保持完美坐姿的繁忙诊所时,会发生什么?它们还能抓到每一处划痕吗,还是会开始感到困惑?这就是年轻研究员希蕾亚·帕里穆(Shreya Parimoo)决定去回答的大问题。


野外环境中的数字侦探

希蕾亚的项目就像一个侦探故事,但她不是在破获犯罪案,而是在解开一个关于两款特定的AI系统——名为 LumineticsCore(原名 IDx-DR)和 EyeArt——在真实的美国诊所中实际表现如何的谜团。

你可能会想:“既然政府批准了它们,它们一定是完美的!”但希礼亚想要看透那些一切顺利的华丽实验室测试。她想看看当这些AI系统置身于医生办公室那种混乱、真实的现实世界时,究竟会发生什么。她收集了涉及超过 10.8万 次眼科筛查的五项不同研究的数据。那可是非常多的眼睛!

重大发现:擅长捕捉,有时过于敏感

以下是故事揭示的结果:

1. “绝不错过”的超能力
这些AI侦探在不漏掉坏情况方面表现得极其出色。在现实世界中,它们捕捉到了 95.8% 的患病眼底。把它想象成机场的金属探测器。如果你把金属探测器设置得极其灵敏,它会对皮带扣、钥匙或硬币发出鸣叫。它可能会针对非武器物品频繁鸣叫,但它绝不会让任何武器溜过去。这正是这些AI系统的做法。它们对问题的察觉如此敏锐,以至于极少漏掉病例。如果AI说“这只眼睛看起来没问题”,那么你可以非常确信它确实没问题。

2. “过于敏感”的问题
然而,这里有一个陷阱。虽然它们擅长不漏掉疾病,但在判定“一切正常”时却有点过于敏感。在现实世界中,当眼睛确实健康时,AI在 83.5% 的情况下能正确判断。但在某些地方,这个数字甚至降到了 60.3%

想象一下你厨房里的烟雾报警器。如果你把它的灵敏度调得极高,哪怕只是把面包烤焦了一点,它也会尖叫着说“起火了!”虽然并不是真正的火灾,但报警器因为太敏感而误以为是火灾。这就是AI在某些诊所中的表现。它看到了看起来像划痕的东西,但其实并不是,从而将健康的眼睛标记为“需要医生查看”。这被称为“假阳性”。

为什么会有差异?混乱的现实世界

希礼亚发现,AI并没有改变它的“大脑”,而是周围的世界改变了。在那些AI获得“A+”成绩的华丽实验室测试中,照片是由专家使用完美的光照和特殊的散瞳药物拍摄的。而在现实世界中,照片通常是由普通护士或技术人员在普通的诊所中拍摄的,有时瞳孔较小,或者眼睛看起来有些浑浊(就像透过一层雾气看东西)。

因为照片并不总是完美的,AI变得有些困惑。它开始把阴影误认为划痕。此外,一些诊所使用AI的方式也不尽相同。他们告诉AI:“要格外小心!如果你不确定,就标记出来!”这使得AI能捕捉到更多的潜在问题,但也导致它将更多的健康眼睛标记为有问题。

结论:优秀的工具,但并非魔法

那么,最终得分是多少?论文得出结论,这些AI系统在排除疾病方面是极其优秀的。如果AI说你是安全的,那么你几乎肯定是安全的。这是一个巨大的胜利,因为这意味着我们可以利用这些工具快速筛选出健康人群,让眼科医生能够专注于真正需要帮助的人。

然而,论文也警告我们不要期望AI在任何地方都是完美的。这种“过于敏感”的行为意味着,在某些诊所,AI可能会送太多人去接受二次检查。这可能会堵塞诊疗预约,并让人们等待更长时间。研究发现,AI的表现很大程度上取决于它在哪里以及如何被使用。

核心要点

希礼亚的研究告诉我们,虽然这些经FDA批准的AI侦探是能够拯救视力的强大工具,但它们并不是在每个房间里都能发挥同样作用的魔法棒。它们就像是一个超灵敏的烟雾报警器:它们能救你免于真正的火灾,但当你只是在烤面包时,它们也可能尖叫起来。

这项研究表明,我们可以信任这些系统来发现坏消息,但我们需要谨慎处理那些“虚假警报”。在全面推广之前,诊所需要针对其特定的环境进行测试,以确保它们不会变得过于敏感。技术已经准备好了,但现实世界的设置仍需一些微调,以确保每个人都能在不被虚假警报淹没的情况下获得所需的护理。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →