← Últimos artigos
📄 medicine

An Intelligent Multimodal Deep Learning Framework for Early Diagnosis of Diabetic and Hypertensive Retinopathy Using Retinal Fundus Images

Este estudo propõe um framework de aprendizado profundo multimodal que integra imagens de fundo de retina com biomarcadores clínicos sistêmicos e registros eletrônicos de saúde para alcançar uma precisão de 98% no diagnóstico precoce de retinopatia diabética e hipertensiva, oferecendo uma solução escalável e de baixo custo para triagem em ambientes com recursos limitados e telemedicina.

Autores originais: Arti Utikar, Milind Bongulwar, Chetankumar Patil

Publicado 2026-08-20
📖 1 min de leitura☕ Leitura rápida

Autores originais: Arti Utikar, Milind Bongulwar, Chetankumar Patil

Artigo original sob licença CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Resumo Técnico: Um Framework de Aprendizado Profundo Multimodal Inteligente para o Diagnóstico Precoce de Retinopatia Diabética e Hipertensiva

Problema
A Retinopatia Diabética (RD) e a Retinopatia Hipertensiva (RH) são causas principais de perda de visão irreversível em todo o mundo. Embora o diagnóstico precoce seja crítico para prevenir a cegueira, as práticas diagnósticas atuais enfrentam limitações significativas. A maioria dos sistemas existentes baseia-se exclusivamente na análise de imagens de fundo de retina, muitas vezes ignorando biomarcadores clínicos sistêmicos vitais, como os níveis de glicose no sangue (hemoglobina glicada) e a pressão arterial. Essa abordagem de "apenas imagem" pode levar a uma redução na precisão diagnóstica, particularmente em casos de estágio inicial ou quando a qualidade da imagem varia. Além disso, muitos modelos existentes focam ou na RD ou na RH isoladamente, em vez de abordar ambas as condições simultaneamente dentro de um framework unificado. Existe também uma lacuna na implementação clínica de sistemas multimodais que integrem imagens com registros eletrônicos de saúde (EHR) usando ferramentas de prototipagem acessíveis como o MATLAB.

Metodologia
Os autores propõem um framework de aprendizado profundo híbrido e multimodal implementado no MATLAB (R2023a) para diagnosticar tanto a RD quanto a RH, fundindo imagens de fundo de retina com dados clínicos sistêmicos.

  1. Aquisição de Dados: O estudo utilizou um conjunto de dados de 1.200 imagens de fundo de retina de um hospital em Pune, Índia, acompanhadas de registros clínicos correspondentes. O conjunto de dados incluiu 300 casos normais, 825 casos de RD (leve, moderada, grave) e 35 casos de RH. Os atributos clínicos incluíram hemoglobina glicada (referida como registros de saúde eletrônicos no texto), pressão arterial sistólica (referida como registros eletrônicos sistólicos) e duração da doença.
  2. Pré-processamento:
    • Imagens: As imagens de fundo de retina passaram por realce de contraste via equalização de histograma, redução de ruído usando filtragem de mediana, conversão para escala de cinza e normalização de brilho.
    • Dados Clínicos: Variáveis clínicas numéricas foram normalizadas usando escalonamento z-score.
  3. Segmentação e Extração de Características:
    • Processamento de Imagem: O framework empregou U-Net para segmentação de vasos sanguíneos e disco óptico, modelos de contorno ativo para contornos de lesões e crescimento de região para identificação de exsudatos.
    • Extração de Características: Características profundas foram extraídas das regiões segmentadas utilizando Redes Neurais Convolucionais (CNNs).
  4. Fusão Multimodal e Classificação:
    • O sistema utiliza uma estratégia de Fusão Intermediária (Conjunta). As características da imagem (extraídas via CNN/Vision Transformer) e as características clínicas (codificadas via MLP ou codificadores de texto) são concatenadas ou fundidas usando mecanismos de atenção para criar uma representação latente conjunta.
    • As características fundidas são passadas por uma camada de classificação (Softmax) para prever os rótulos das doenças.
    • A arquitetura do modelo integra aprendizado profundo (CNN) com processamento de dados clínicos usando codificadores MLP e mecanismos de fusão por portão (gated fusion).
  5. Validação: O conjunto de dados foi dividido em conjuntos de treinamento (70%), validação (15%) e teste (15%). O modelo foi avaliado usando validação cruzada de 10 dobras para garantir estabilidade e evitar overfitting.

Principais Contribuições

  • Detecção de Dupla Patologia: Diferente de muitos trabalhos anteriores que focam em uma única doença, este framework diagnostica simultaneamente a Retinopatia Diabética e a Hipertensiva.
  • Integração Multimodal: O estudo demonstra a eficácia da fusão de imagens de retina com biomarcadores sistêmicos (hemoglobina glicada e pressão arterial) para superar as limitações dos modelos de apenas imagem.
  • Implementação em MATLAB: O framework é desenvolvido inteiramente no MATLAB, oferecendo uma solução escalável e de baixo custo adequada para prototipagem médica e ambientes com recursos limitados.
  • Arquitetura Híbrida: A integração de aprendizado profundo (CNN) com processamento de dados clínicos (MLP) cria uma ferramenta diagnóstica robusta que captura tanto lesões retinianas locais quanto o contexto fisiológico sistêmico.

Resultos
O framework multimodal proposto demonstrou desempenho superior em comparação com baselines de modalidade única:

  • Acurácia: O modelo híbrido alcançou uma acurácia geral de 98%.
  • Comparação: Este desempenho superou os modelos CNN de apenas imagem (91,82% de acurácia) e os modelos Random Forest de apenas dados clínicos (85,90% de acurácia).
  • Métricas: O modelo alcançou uma Sensibilidade de 96,04%, Especificidade de 98,10%, F1-Score de 0,976 e um AUC de 0,98.
  • Redução de Erro: A integração de dados clínicos reduziu os falsos negativos em aproximadamente 40% em comparação com as abordagens de baseline de CNN, melhorando particularmente a detecção de RD e RH em estágios iniciais.
  • Significância Estatística: Um teste t pareado confirmou que a inclusão de características clínicas resultou em uma melhoria estatisticamente significativa na acurácia (p < 0,001). Testes ANOVA também mostraram um efeito principal significativo do tipo de modalidade (F(2, 27) = 23,6, p < 0,0005).
  • Generalização: O modelo manteve a acurácia acima de 95% em diferentes grupos demográficos (idades 35–75) e estágios da doença.

Significância e Alegações
O artigo afirma que este framework multimodal representa um "salto quântico" em relação aos métodos tradicionais de apenas imagem ao aumentar significativamente a sensibilidade diagnóstica, especialmente para casos de estágio inicial onde os sinais visuais são sutis. Ao incorporar o contexto sistêmico (hemoglobina glicada e pressão arterial), o sistema reduz falsos negativos e melhora a estratificação de risco.

Os autores afirmam que o framework é particularmente valioso para:

  • Triagem e Telemedicina: Fornecendo uma solução escalável e de baixo custo para triagem oftalmológica em larga escala, especialmente em áreas com acesso limitado a especialistas.
  • Suporte à Decisão Clínica: Oferecendo uma avaliação de risco completa que auxilia em decisões mais rápidas e precisas.
  • Diagnóstico Duplo: Permitindo a triagem tanto de RD quanto de RH através de uma única via de aquisição de imagem.

O estudo conclui que, embora os resultados atuais sejam promissores, o trabalho futuro deve focar na validação do modelo com dados de múltiplos centros, na implementação do sistema em dispositivos móveis para diagnóstico no ponto de atendimento e na condução de estudos longitudinais para acompanhar a progressão da doença e a resposta ao tratamento.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →