← 最新论文
📄 medicine

An Intelligent Multimodal Deep Learning Framework for Early Diagnosis of Diabetic and Hypertensive Retinopathy Using Retinal Fundus Images

本研究提出了一种多模态深度学习框架,该框架将视网膜眼底图像与全身临床生物标志物及电子健康记录相结合,旨在实现对糖尿病视网膜病变和高血压视网膜病变的 98% 早期诊断准确率,从而为资源匮乏地区的筛查和远程医疗提供一种可扩展且具有成本效益的解决方案。

原作者: Arti Utikar, Milind Bongulwar, Chetankumar Patil

发布于 2026-08-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Arti Utikar, Milind Bongulwar, Chetankumar Patil

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

技术摘要:用于糖尿病视网膜病变与高血压视网膜病变早期诊断的智能多模态深度学习框架

问题陈述
糖尿病视网膜病变(DR)和高血压视网膜病变(HR)是全球范围内导致不可逆性视力丧失的主要原因。虽然早期诊断对于预防失明至关重要,但目前的诊断实践面临着显著的局限性。大多数现有系统仅依赖于视网膜眼底图像分析,往往忽略了至关重要的全身性临床生物标志物,如血糖水平(糖化血红蛋白)和血压。这种“仅图像”的方法可能会导致诊断准确度降低,尤其是在早期阶段或图像质量波动的情况下。此外,许多现有模型要么专注于 DR,要么专注于 HR,两者孤立存在,未能在一个统一的框架内同时解决这两种疾病。在临床实现方面,利用 MATLAB 等易于使用的原型设计工具来整合影像学与电子健康记录(EHR)的多模态系统也存在空白。

方法论
作者提出了一种在 MATLAB (R2023a) 中实现的混合多模态深度学习框架,通过融合视网膜眼底图像与全身性临床数据来诊断 DR 和 HR。

  1. 数据采集: 本研究利用了来自印度浦那一家医院的 1,200 张眼底图像数据集,并附带相应的临床记录。该数据集包括 300 例正常病例、825 例 DR 病例(轻度、中度、重度)和 35 例 HR 病例。临床属性包括糖化血红蛋白(文中称为电子健康记录)、收缩压(称为收缩电子健康记录)以及病程。
  2. 预处理:
    • 图像: 眼底图像通过直方图均衡化进行对比度增强,使用中值滤波进行降噪,并进行灰度转换和亮度归一化。
    • 临床数据: 数值型临床变量使用 z-score 标准化进行归一化。
  3. 分割与特征提取:
    • 图像处理: 该框架采用 U-Net 进行血管和视盘分割,使用主动轮廓模型进行病灶轮廓提取,并使用区域生长法识别渗出物。
    • 特征提取: 利用卷积神经网络(CNN)从分割区域中提取深度特征。
  4. 多模态融合与分类:
    • 系统采用中间(联合)融合策略。图像特征(通过 CNN/Vision Transformer 提取)与临床特征(通过 MLP 或文本编码器编码)进行拼接或通过注意力机制进行融合,以构建联合潜在表示。
    • 融合后的特征被传递至分类层(Softmax),以预测疾病标签。
    • 模型架构集成了深度学习(CNN)与临床数据处理(MLP 编码器)以及门控融合机制。
  5. 验证: 数据集被划分为训练集(70%)、验证集(15%)和测试集(15%)。模型通过 10 折交叉验证进行评估,以确保稳定性并防止过拟合。

核心贡献

  • 双重病理检测: 与许多专注于单一疾病的前期工作不同,该框架能够同时诊断糖尿病视网膜病变和高血压视网膜病变。
  • 多模态集成: 研究展示了将视网膜影像与全身性生物标志物(糖化血红蛋白和血压)进行融合的有效性,从而克服了仅靠图像模型的局限性。
  • MATLAB 实现: 该框架完全在 MATLAB 中开发,为医疗原型设计和资源受限环境提供了一种可扩展、低成本的解决方案。
  • 混合架构: 深度学习(CNN)与临床数据处理(MLP)的集成创建了一个鲁棒的诊断工具,能够同时捕捉局部视网膜病灶和全身生理背景。

结果
所提出的多模态框架表现出优于单模态基准模型的性能:

  • 准确率: 混合模型实现了 98% 的总体准确率。
  • 对比: 这优于仅图像的 CNN 模型(准确率为 91.82%)和仅临床数据的随机森林模型(准确率为 85.90%)。
  • 指标: 模型实现了 96.04% 的灵敏度、98.10% 的特异度、0.976 的 F1 分数以及 0.98 的 AUC。
  • 误差减少: 与基准 CNN 方法相比,临床数据的整合使假阴性率降低了约 40%,特别是在提高早期 DR 和 HR 的检测方面。
  • 统计显著性: 配对 t 检验确认了纳入临床特征后准确率的提升具有统计学显著性(p < 0.001)。ANOVA 测试也显示了模态类型具有显著的主效应(F(2, 27) = 23.6, p < 0.0005)。
  • 泛化能力: 该模型在不同人口统计学群体(年龄 35-75 岁)和疾病阶段均保持了 95% 以上的准确率。

意义与主张
论文声称,该多模态框架通过显著增强诊断灵敏度(特别是在视觉征象细微的早期阶段),实现了从传统仅图像方法到“量子飞跃”的跨越。通过结合全身性背景(糖化血红蛋白和血压),该系统减少了假阴性并改善了风险分层。

作者断言,该框架对于以下领域具有重要价值:

  • 筛查与远程医疗: 为大规模眼科筛查提供一种可扩展、低成本的解决方案,特别是在专家资源有限的地区。
  • 临床决策支持: 提供完整的风险评估,有助于更快、更准确地做出决策。
  • 双重诊断: 通过单一的图像采集路径实现 DR 和 HR 的共同筛查。

研究结论指出,尽管目前的成果令人鼓舞,但未来的工作应侧重于使用多中心数据验证模型、将系统部署在移动设备上进行点对点诊断,以及开展纵向研究以追踪疾病进展和治疗反应。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →