← Últimos artículos
💻 computer science

Low-light Image Enhancement via Multi-scale Attention combined with Fourier Transform

Este artículo propone MSFT, una red de aprendizaje profundo supervisada de una sola etapa que integra la atención multiescala con la fusión de amplitud de la transformada de Fourier para mejorar eficazmente los detalles de la textura y el contexto global en imágenes con poca luz, logrando un rendimiento de vanguardia en múltiples conjuntos de datos de referencia.

Autores originales: Wenbin Du, Jian Long, Zhu Cao

Publicado 2026-07-28
📖 1 min de lectura☕ Lectura para el café

Autores originales: Wenbin Du, Jian Long, Zhu Cao

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Resumen Técnico: Mejora de Imágenes con Baja Iluminación mediante Atención Multiescala combinada con la Transformada de Fourier (MSFT)

1. Planteamiento del Problema

La mejora de imágenes con baja iluminación (LLIE, por sus siglas en inglés) tiene como objetivo recuperar imágenes de alta calidad y con iluminación normal a partir de entradas capturadas en entornos desafiantes caracterizados por una iluminación insuficiente, como entornos interiores oscuros o escenas exteriores con variaciones dramáticas de brillo. Estas condiciones provocan la degradación de la luminancia, un desenfoque sustancial de la imagen y ruido.

Los métodos existentes de aprendizaje profundo basados en LLIE enfrentan varias limitaciones:

  • Recuperación de Textura e Iluminación: Muchos tienen dificultades para capturar con precisión las distribuciones de iluminación del mundo real y restaurar simultáneamente los detalles finos de la textura.
  • Limitaciones de Adaptabilidad: Los métodos convencionales a menudo no logran ajustar la brillantez de forma adaptativa basándose en la información de la textura regional, lo que genera problemas de sobreexposición o subexposición.
  • Dependencia de Cómputo y Priores: Aunque los modelos de difusión ofrecen un alto realismo, a menudo dependen de procesos de degradación asumidos o de priors preentrenados pesados, lo que limita su aplicabilidad en escenarios del mundo real donde la degradación es ambigua. Además, los métodos que dependen de priors semánticos demandan recursos computacionales excesivos.
  • Manejo de Ruido y Fondo: Técnicas como la optimización consciente de la SNR mejoran la relación señal-ruido, pero a menudo fallan al capturar información de escala profunda o al mejorar adecuadamente las regiones de fondo que contienen elementos de primer plano aurorales.

2. Metodología

Los autores proponen MSFT (Atención Multiescala combinada con la Transformada de Fourier), una red de aprendizaje profundo supervisada en el dominio de la frecuencia. La arquitectura es un marco en forma de U de dos etapas que integra Redes Neuronales Convolucionales (CNN) y Transformers, guiados por los principios de la transformada de Fourier.

Componentes Arquitectónicos Centrales

A. Atención Multiescala Guiada por la Transformada de Fourier (FTG-MSA)
Este es el módulo de recuperación central embebido dentro de las escalas de la red. Aprovecha la observación de que la amplitud en el dominio de la frecuencia codifica la información de brillo, mientras que la fase se relaciona con los detalles estructurales.

  • Construcción de la Guía: La red crea un mapa de brillo de características de cuatro canales concatenando la imagen de baja luz con un mapa de prior de valor de gris máximo (derivado de la capa de iluminación mediante la teoría de Retinex).
  • Fusión de Frecuencia: El módulo realiza una Transformada Rápida de Fourier (FFT) tanto en las características de la imagen de baja luz como en el mapa de guía de cuatro canales. Se añade el espectro de amplitud del mapa de guía al espectro de amplitud de la imagen de baja luz, preservando la fase de la imagen de baja luz.
  • Transformación Inversa: Una FFT Inversa (IFFT) reconstruye el mapa de características guiado, el cual sirve como un prior de brillo para prevenir la sobre/subexposición.
  • Mecanismo de Atención: Esta información de amplitud fusionada guía un mecanismo de autoatención de múltiples cabezales (multi-head self-attention). Los pesos de atención se calculan dinámicamente para extraer selectivamente características relevantes, enriqueciendo el contenido de la imagen mientras se preserva la textura.

B. Atención Sinérgica de Múltiples Formas (MSSA)
Diseñado para extraer información de textura de escala profunda e integrar características dispersas de alta dimensión, el módulo MSSA se inserta en la escala de mayor canal. Consta de tres componentes conectados en serie:

  1. Atención Sinérgica Espacial y de Canal (SCSA): Pesa adaptativamente la importancia de los canales y aumenta la información espacial crítica.
  2. Atención de Múltiples Formas (MSA): Consiste en una Atención Cuadrada Dilatada (DSA) y una Atención Rectangular Dilatada (DRA) en paralelo.
    • DSA: Utiliza una activación de tangente hiperbólica (Tanh) en lugar de Softmax para evitar las limitaciones del filtro de paso bajo, mejorando los componentes de alta frecuencia.
    • DRA: Agrega información en regiones rectangulares para capturar características de múltiples formas.
  3. CMUNeXt: Un módulo ligero que extrae información global a través de todos los canales simultáneamente, reduciendo los parámetros y los costos computacionales mientras integra la información espacial-canal.

C. Estructura de la Red
El marco general es una arquitectura en forma de U de tres escalas.

  • Codificación: Las imágenes de baja luz y el mapa de guía de cuatro canales son procesados a través de capas convolucionales y bloques FTGT (Fourier Transform-Guided Transformer) para generar características jerárquicas.
  • Decodificación: Las características multiescala del codificador se alimentan directamente a los canales correspondientes del decodificador para guiar la reconstrucción, eliminando la necesidad de extracción adicional de características y reduciendo la redundancia.
  • Función de Pérdida: El modelo se entrena utilizando la pérdida de Charbonnier para minimizar el error entre la salida mejorada y la verdad de campo (ground truth).

3. Contribuciones Clave

  1. Arquitectura MSFT: La propuesta de una red integrada de dos etapas que combina transformadas de Fourier con un marco U-net de mezcla cruzada CNN-Transformer. Este diseño híbrido equilibra la eficiencia de la CNN para capturar características locales con la capacidad del Transformer para modelar el contexto global.
  2. Módulo FTG-MSA: El diseño de un mecanismo de autoatención que incorpora información de amplitud del dominio de la frecuencia como una señal de guía dinámica. Esto permite a la red ajustar adaptativamente los pesos de mejora basados en el valor de gris máximo en áreas de baja luz, evitando artefactos de exposición.
  3. Módulo MSSA: La introducción de un módulo de Atención Sinérgica de Múltiples Formas en el espacio de guía de mayor dimensión. Este módulo integra eficazmente información dispersa, homogeneiza la densidad de los canales y extrae información de textura de escala profunda utilizando una combinación de SCSA, MSA (DSA/DRA) y CMUNeXt.
  4. Desempeño Superior: Experimentos extensos demuestran que MSFT supera a los métodos de estado del arte (SOTA) en múltiples conjuntos de datos (LOL, SID, SMID, SDSD) en términos de PSNR y SSIM, particularmente en la preservación de detalles de textura y la restauración de la iluminación sin sobreexposición.

4. Resultados Experimentales

Los autores evaluaron MSFT en siete conjuntos de datos: LOL-v1, LOL-v2-real, LOL-v2-synthetic, SID, SMID, SDSD-indoor y SDSD-outdoor.

  • Desempeño Cuantitativo:
    • En el conjunto de datos SDSD-outdoor, MSFT logró un PSNR de 41.76 dB y un SSIM de 0.988. Esto representa una mejora de 11.92 dB sobre Retinexformer y una mejora del 13.80% en SSIM.
    • Comparado con el método supervisado SOTA Retinexformer, MSFT logró ganancias significativas de PSNR en todos los benchmarks, que van desde 0.11 dB hasta 11.92 dB.
    • Comparado con el método no supervisado Retinexformer, las mejoras fueron aún más pronunciadas, con ganancias de hasta 16.48 dB en ciertos conjuntos de datos.
  • Eficiencia:
    • MSFT tiene 1.25 millones de parámetros y 18.07 GFLOPs. Esto es relativamente bajo comparado con otros modelos de alto rendimiento como SNR-Net (4.01M de parámetros, 26.35 GFLOPs) y ofrece un mejor equilibrio entre desempeño y costo computacional.
  • Estudios de Ablación:
    • Eliminar la guía de Retinex (entrada de cuatro canales) causó una caída significativa en el desempeño (por ejemplo, ~9 dB en SDSD-outdoor), validando la importancia de los priors de iluminación.
    • Eliminar el módulo MSSA provocó descensos sustanciales tanto en PSNR como en SSIM, confirmando su rol en la similitud estructural y la restauración de texturas.
    • Eliminar el componente FFT dentro de FTGT resultó en la degradación de desempeño más severa, probando que la guía en el dominio de la frecuencia es indispensable para la consistencia global.
  • Resultados Cualitativos: Las comparaciones visuales muestran que MSFT captura eficazmente las texturas del fondo y mantiene una iluminación realista, mientras que otros métodos a menudo introducen puntos oscuros, artefactos o sobreexposición en regiones brillantes.

5. Significado y Limitaciones

Significado:
El artículo afirma que MSFT proporciona una solución robusta para la mejora de baja luz al fusionar eficazmente la información de amplitud del dominio de la frecuencia con mecanismos de atención multiescala. Ofrece una referencia para construir modelos que utilicen la atención guiada por el dominio de la frecuencia para restaurar imágenes degradadas, logrando un equilibrio entre la recuperación precisa de la iluminación y la mejora de detalles de textura sin la pesada carga computacional de los modelos de difusión o las limitaciones de las estructuras fijas de ViT.

Limitaciones:
Los autores reconocen varias restricciones:

  • Contaminación Lumínica: El método es limitado en el manejo de imágenes contaminadas por luz fuerte, ya que lucha por eliminar el ruido de las partes sobreexpuestas.
  • Procesamiento en Tiempo Real: No es lo suficientemente eficiente para el procesamiento en tiempo real de escenarios de luz natural.
  • Dependencia de Datos: El modelo requiere una gran cantidad de datos emparejados para el entrenamiento y actualmente no es adecuado para campos de aumentación no supervisados que carecen de datos emparejados.
  • Sensibilidad al Ruido: El modelo no tiene en cuenta imágenes adquiridas en escenarios con contaminación severa de ruido; requiere conjuntos de datos emparejados relativamente limpios o una limpieza previa.

Trabajo Futuro:
Los autores sugieren direcciones de investigación futuras que incluyen:

  • Integrar verdaderamente la transformada de Fourier en la capa de atención para realizar cálculos de atención directamente en el dominio de la frecuencia (usando espectros de amplitud y fase).
  • Explorar la aplicación de modelos de difusión en el dominio de la frecuencia, potencialmente optimizando la estructura de difusión para reducir los recursos computacionales mientras se aprovechan sus capacidades generativas para la mejora no supervisada.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →