Automated triage of open globe injury from external-eye photographs for low-resource settings
本文介绍了首个可部署的离线智能手机应用程序,该程序利用深度学习技术,通过眼外部照片准确分诊开球伤,从而在无需互联网连接或专业设备的情况下,实现在低资源环境下的快速手术升级。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在眼科领域,时间往往是挽救视力与永久失明的区别。视觉面临的最紧迫威胁之一是眼球开放性损伤,这是一种严重的状况,即眼睛的外壁被刺穿或撕裂。发生这种情况时,眼睛本质上是在向外泄漏其内部液体,如果没有在通常一天之内进行快速手术修复,永久性失明或感染的风险会急剧上升。在设备完善的城市中,专家可以使用一种称为裂隙灯的高倍显微镜快速发现这种危险。然而,在偏远的村庄、活跃的战区或农村诊所,这些专家及其昂贵的机器往往在数小时甚至数天之外。在这些地方,做出是否将患者送往紧急手术这一关键决策的人,通常是从未见过眼部损伤的医护人员、护士或全科医生,他们缺乏观察眼睛内部的工具。他们必须决定是等待还是立即将患者送往外科医生处,这一选择承载着巨大的分量。
一个研究小组开发了一种新方法,来帮助这些前线人员做出这种改变命运的决策。他们创建了一个智能手机应用程序,可以查看一张受损眼睛的标准照片,并判断其是否可能为眼球开放性损伤。该系统不需要互联网连接,不会将照片发送到云端服务器,而是完全在手机本身上运行,从而在缺乏数字基础设施的地区保护患者隐私。研究人员使用了一千多张真实的眼睛照片训练了一个计算机模型,这些照片涵盖了从严重损伤到轻微瘀伤的各种情况,并由专家团队进行了标注。他们在另一组从未见过的图像上测试了该系统。结果显示,该软件能够以极高的准确度识别危险损伤,其表现几乎与需要强大计算能力的先进计算机模型不相上下。这项工作表明,由非专业人士拍摄的一张简单照片,可能很快就足以触发正确的紧急响应,为资源匮乏的环境带来了一种此前无法实现的诊断安全性。
构建这一工具的过程始于大规模的图像收集。研究人员从各种在线来源(包括医学教学档案和公共图像库)收集了超过一万一千张眼睛的照片。他们将这些照片筛选并精简为最终的 1,305 张独特图像,确保没有重复或几乎相同的图片被包含在内,否则可能会误导计算机,让它认为自己看到了比实际更多的有效数据。在这些图像中,只有 58 张显示了确定的眼球开放性损伤,其余则描绘了其他类型的眼部创伤或没有损伤。由于这种情况较为罕见,团队在如何划分数据方面必须极其谨慎。他们保留了一个包含仅 12 例眼球开放性损伤案例的特定 261 张图像组,将其完全隐藏起来。这个“冻结”的测试集仅在最后阶段用于观察模型在面对全新、未见数据时的表现,从而确保结果是诚实的,而不仅仅是记忆了示例后的反映。
为了教会计算机如何识别这种损伤,团队测试了几种不同类型的人工智能“骨干网络”(即处理视觉信息的底层引擎)。他们尝试使用了在数百万张日常图像上训练的通用模型,以及专门针对眼科数据进行训练的专业化模型。他们测试了两种主要方法:一种是允许计算机从头开始重新学习所有内容,另一种是让计算机利用其现有的知识作为固定基础,仅学习如何解释最终输出。最强大的结果来自于一个经过微调以识别特定眼球开放性损伤模式的模型。该模型在标准性能量表上达到了 0.934 的得分,这意味着它在区分危险损伤与其他情况方面非常有效。令人惊讶的是,一种不需要对重型计算机模型进行重新训练的更简单的方法,其表现也几乎与之持平。通过使用一个专门的眼科模型作为固定特征提取器并在其上添加一个简单的决策层,研究人员获得了 0.906 的得分。这一发现至关重要,因为它意味着该工具可以在较旧、性能较低的智能手机上运行,而无需昂贵的硬件或互联网接入。
研究人员还探索了将多个模型组合在一起是否会让系统变得更聪明。他们尝试了各种融合不同计算机引擎预测的方法,希望通过集体决策能比单一决策更准确。然而,他们发现增加模型数量并不会显著提高结果。那个使用固定特征方法的单一专业化模型已经足够出色,以至于将其与其他模型结合并不能带来任何优势。这种简洁性是部署过程中的一项优势,因为它使软件保持轻量级且易于在实地维护。团队还检查了以确保计算机不会依赖于与损伤无关的伪相关性,例如使用的相机类型或照片背景。他们确认,无论照片来自何处,或者画面中是否出现面部,模型都在真实地学习损伤本身的视觉特征。
最终产品是一个适用于 iPhone 和 Android 设备的可用应用程序,它可以完全离线运行。当用户拍摄一张受伤眼睛的照片时,应用程序会立即进行分析并提供明确的建议:是立即升级病例以进行紧急手术,还是将患者转诊进行常规随访护理。这种二元决策正是非专业人员在危机中所需做出的决策。该应用并不试图诊断具体的损伤类型或提供完整的医疗报告;它仅仅回答最关键的问题——眼睛是否已经开放并正在泄漏。通过完全在设备上运行,该工具绕过了对互联网连接的需求,并确保没有任何患者照片或个人数据离开手机,解决了阻碍数字医疗工具在偏远地区发挥作用的主要隐私和基础设施障碍。
尽管结果令人鼓舞,但研究人员谨慎地指出其目前工作的局限性。测试集规模较小,仅包含 12 例确定的眼球开放性损伤案例,这意味着统计置信区间较宽。该模型尚未在现实世界的实地试验中进行测试,即在农村诊所或战斗区由医护人员实际使用。此外,该工具仅设计为第一层分诊信号。它无法检测其他虽然严重但并不涉及眼球开放的眼部损伤,例如眼眶周围的骨折或视神经损伤,这些情况同样需要紧急护理。研究人员计划进行前瞻性研究,以观察该工具在整合进实际急救流程时的表现,并在新的低资源临床环境中进行验证。尽管存在这些局限性,这项研究仍为该领域树立了新的基准,证明了从不受控的真实世界照片中学习眼球开放性损伤的视觉信号是可行的。它为实现这样一个未来提供了一条具体路径:即通过智能手机摄像头,帮助世界上资源最匮乏的角落挽救视力。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。