← Últimos artículos
💻 computer science

Conv-Guided Mamba Vision Transformer and SPP-DenseNet121 based Hybrid Multi-Feature Fusion and Query Expansion in Content-Based Medical Image Retrieval

Este artículo propone un novedoso marco de Recuperación de Imágenes Médicas Basada en Contenido que integra un Conv-Guided Mamba Vision Transformer con SPP-DenseNet121 para la fusión híbrida de características múltiples y emplea la expansión de consultas para lograr una alta precisión de recuperación en conjuntos de datos de tejido vesical endoscópico y gastrointestinal.

Autores originales: Mathana Gopal Arulsamy, Pallikonda Rajasekaran Murugan, Md. Jakir Hossen, Wai Kit Wong, Poh Kiat Ng, Gomathy Nayagam M

Publicado 2026-07-17
📖 4 min de lectura☕ Lectura para el café

Autores originales: Mathana Gopal Arulsamy, Pallikonda Rajasekaran Murugan, Md. Jakir Hossen, Wai Kit Wong, Poh Kiat Ng, Gomathy Nayagam M

Artículo original bajo licencia CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás caminando a través de una biblioteca masiva e infinita donde cada libro es una fotografía del interior de un cuerpo humano. Si fueras un médico tratando de encontrar una foto de un tipo específico de tumor de vejiga para ayudar a un paciente, no querrías pasar millones de páginas una por una. Querrías un bibliotecario superinteligente que pudiera tomar instantáneamente las fotos exactas que necesitas. Este es el mundo de la Recuperación de Imágenes Médicas Basada en el Contenido (CBMIR, por sus siglas en inglés). En lugar de buscar mediante etiquetas de texto como "cáncer" o "pólipo", este sistema busca mirando el contenido real de la imagen: los colores, las formas y las texturas. El desafío es que las imágenes médicas son complicadas; dos imágenes pueden parecer casi idénticas pero significar cosas muy diferentes para un médico, o dos imágenes de la misma enfermedad pueden verse muy diferentes dependiendo de cómo se sostuvo la cámara o de la iluminación. El objetivo es construir un detective digital que entienda tanto los detalles diminutos como la visión general para encontrar las imágenes médicas adecuadas de forma rápida y precisa.

En este estudio, los investigadores construyeron un nuevo tipo de detective digital llamado marco de trabajo de Fusión de Características Múltiples Híbrida y Expansión de Consulta. Piensa en esto como un equipo de dos detectives expertos trabajando juntos para resolver un caso. El primer detective es un especialista en detalles locales, utilizando una herramienta llamada SPP-DenseNet121. Este detective es excelente detectando pistas diminutas como la textura de un tejido o el borde de una lesión, sin importar cuán grande o pequeño sea el punto. El segundo detective es un maestro del contexto global, utilizando una nueva y eficiente herramienta llamada Conv-Guided Mamba Vision Transformer (CG-MViT). Este detective observa toda la escena para comprender cómo se relacionan las diferentes partes de la imagen a largas distancias, algo así como entender la disposición de una habitación completa en lugar de solo un solo ladrillo.

Usualmente, cuando combinas dos conjuntos diferentes de pistas, podrías terminar con una pila desordenada de información redundante. Para solucionar esto, el equipo utilizó un truco matemático especial llamado Análisis de Correlación Canónica Múltiple Discriminativo (DMCCA). Imagina esto como un sistema de archivo superorganizado que toma las notas de ambos detectives, elimina los duplicados y las fusiona en un informe único, perfecto y cristalino. Pero el equipo no se detuvo ahí. Sabían que, a veces, la primera suposición no es perfecta, así que añadieron un paso de "segunda opinión" llamado Retroalimentación de Relevancia Pseudo (PRF). Esto es como preguntarle a la computadora: "Oye, las 10 fotos que encontraste se ven bien, ¿verdad? Asumamos que todas son correctas y utilicémoslas para refinar nuestra búsqueda". Esto ayuda al sistema a comprender mejor la intención del médico y a encontrar imágenes aún más relevantes.

Los investigadores probaron su nuevo equipo de detectives en dos bibliotecas de fotos médicas del mundo real: el conjunto de datos Kvasir (que contiene imágenes del tracto gastrointestinal) y el conjunto de datos de Tejido de Vejiga Endoscópica. Los resultados fueron impresionantes. En el conjunto de datos Kvasir, el sistema encontró las imágenes correctas con un alto grado de precisión, obteniendo una tasa de éxito del 97.72% al buscar en los 5 mejores resultados, y manteniendo aún un sólido 91.02% incluso al mirar los 100 mejores resultados. En el conjunto de datos de tejido de vejiga, que es más desafiante, logró un 92.60% de precisión para los 5 mejores resultados y un 66.82% para los 100 mejores.

Para asegurarse de que su nuevo sistema fuera realmente el héroe y no solo tuviera suerte, los investigadores realizaron una serie de "estudios de ablación". Esto es como desarmar el motor de un coche para ver qué pieza lo hace ir más rápido. Probaron el sistema solo con el primer detective, luego solo con el segundo, después con ambos sin el sistema de archivos, y finalmente con el equipo completo. Encontraron que cada parte contribuía al éxito; el equipo completo con el sistema de archivos y el paso de la "segunda opinión" fue el que mejor funcionó. El estudio sugiere que, al combinar las visiones locales y globales, organizar los datos de manera inteligente y permitir que el sistema aprenda de sus propias suposiciones iniciales, la recuperación de imágenes médicas puede volverse mucho más confiable. Esto podría ayudar a los médicos a encontrar casos pasados similares más rápido, ayudando en el diagnóstico y la planificación del tratamiento, aunque los autores señalan que se necesitan más pruebas en imágenes médicas de mayor tamaño y de diferentes tipos para confirmar qué tan bien funciona esto en cada entorno hospitalario.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →