← Derniers articles
💻 computer science

Low-light Image Enhancement via Multi-scale Attention combined with Fourier Transform

Cet article propose MSFT, un réseau d'apprentissage profond supervisé à une seule étape qui intègre une attention multi-échelle avec une fusion d'amplitude par transformée de Fourier pour améliorer efficacement les détails de la texture et le contexte global dans les images en faible luminosité, atteignant des performances de pointe sur plusieurs ensembles de données de référence.

Auteurs originaux : Wenbin Du, Jian Long, Zhu Cao

Publié 2026-07-28
📖 1 min de lecture☕ Lecture pause café

Auteurs originaux : Wenbin Du, Jian Long, Zhu Cao

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Résumé Technique : Amélioration d'images en faible luminosité via l'attention multi-échelle combinée à la transformée de Fourier (MSFT)

1. Énoncé du problème

L'amélioration d'images en faible luminosité (LLIE - Low-light Image Enhancement) vise à récupérer des images de haute qualité, à luminosité normale, à partir d'entrées capturées dans des environnements difficiles caractérisés par une illumination insuffisante, tels que des intérieurs sombres ou des scènes extérieures avec des variations de luminosité dramatiques. Ces conditions entraînent une dégradation de la luminance, un flou d'image substantiel et du bruit.

Les méthodes existantes de LLIE basées sur l'apprentissage profond font face à plusieurs limitations :

  • Récupération de la texture et de l'illumination : Beaucoup peinent à capturer précisément les distributions d'illumination du monde réel et à restaurer simultanément les détails fins de la texture.
  • Limitations adaptatives : Les méthodes dominantes échouent souvent à ajuster la luminosité de manière adaptative en fonction des informations de texture régionales, ce qui entraîne des problèmes de surexposition ou de sous-exposition.
  • Dépendances aux calculs et aux priors : Bien que les modèles de diffusion offrent un réalisme élevé, ils reposent souvent sur des processus de dégradation supposés ou sur des priors pré-entraînés lourds, limitant leur applicabilité dans des scénarios réels où la dégradation est ambiguë. De plus, les méthodes dépendant de priors sémantiques exigent souvent des ressources de calcul excessives.
  • Gestion du bruit et de l'arrière-plan : Les techniques telles que l'optimisation sensible au SNR améliorent les rapports signal sur bruit mais échouent souvent à capturer les informations d'échelle profonde ou à améliorer adéquatement les régions d'arrière-plan contenant des éléments de premier plan auroraux.

2. Méthodologie

Les auteurs proposent MSFT (Multi-scale Attention combined with the Fourier Transform), un réseau d'apprentissage profond supervisé opérant dans le domaine fréquentiel. L'architecture est un cadre en forme de U à deux étapes, intégrant des réseaux de neurones convolutifs (CNN) et des Transformers, guidés par les principes de la transformée de Fourier.

Composants architecturaux clés

A. Attention multi-échelle guidée par la transformée de Fourier (FTG-MSA)
Il s'agit du module de récupération central intégré dans les échelles du réseau. Il exploite l'observation selon laquelle l'amplitude dans le domaine fréquentiel encode l'information de luminosité, tandis que la phase est liée aux détails structurels.

  • Construction du guidage : Le réseau crée une carte de luminosité de caractéristiques à quatre canaux en concaténant l'image en faible luminosité avec une carte de priorité de valeur grise maximale (dérivée de la couche d'illumination via la théorie de Retinex).
  • Fusion de fréquence : Le module effectue une transformée de Fourier rapide (FFT) à la fois sur les caractéristiques de l'image en faible luminosité et sur la carte de guidage à quatre canaux. Il ajoute le spectre d'amplitude de la carte de guidage au spectre d'amplitude de l'image en faible luminosité tout en préservant la phase de l'image en faible luminosité.
  • Transformation inverse : Une transformée de Fourier inverse (IFFT) reconstruit la carte de caractéristiques guidée, qui sert de priorité de luminosité pour éviter la surexposition ou la sous-exposition.
  • Mécanisme d'attention : Cette information d'amplitude fusionnée guide un mécanisme d'auto-attention multi-têtes. Les poids d'attention sont calculés dynamiquement pour extraire sélectivement les caractéristiques pertinentes, enrichissant le contenu de l'image tout en préservant la texture.

B. Attention synergique multi-forme (MSSA)
Conçu pour extraire des informations de texture à échelle profonde et intégrer des caractéristiques éparses de haute dimension, le module MSSA est inséré à l'échelle de canal la plus élevée. Il comprend trois composants connectés en série :

  1. Attention synergique spatiale et de canal (SCSA) : Pondère de manière adaptative l'importance des canaux et augmente l'information spatiale critique.
  2. Attention multi-forme (MSA) : Se compose d'une attention dilatée carrée (DSA - Dilated Square Attention) et d'une attention dilatée rectangulaire (DRA - Dilated Rectangle Attention) en parallèle.
    • DSA : Utilise une activation tangente hyperbolique (Tanh) au lieu de Softmax pour éviter les limitations du filtre passe-bas, améliorant ainsi les composantes haute fréquence.
    • DRA : Agrège les informations dans des régions rectangulaires pour capturer des caractéristiques multi-formes.
  3. CMUNeXt : Un module léger qui extrait l'information globale à travers tous les canaux simultanément, réduisant les paramètres et les coûts de calcul tout en intégrant l'information spatio-canale.

C. Structure du réseau
L'architecture globale est une structure en U à trois échelles.

  • Encodage : Les images en faible luminosité et la carte de guidage à quatre canaux sont traitées par des couches convolutives et des blocs FTGT (Fourier Transform-Guided Transformer) pour générer des caractéristiques hiérarchiques.
  • Décodage : Les caractéristiques multi-échelles de l'encodeur sont injectées directement dans les canaux du décodeur correspondants pour guider la reconstruction, éliminant ainsi le besoin d'extraction de caractéristiques supplémentaire et réduisant la redondance.
  • Fonction de perte : Le modèle est entraîné à l'aide de la perte Charbonnier pour minimiser l'erreur entre la sortie améliorée et la vérité terrain.

3. Contributions clés

  1. Architecture MSFT : La proposition d'un réseau intégré à deux étapes combinant les transformées de Fourier avec un cadre U-net cross-mixé CNN-Transformer. Cette conception hybride équilibre l'efficacité du CNN pour capturer les caractéristiques locales avec la capacité du Transformer à modéliser le contexte global.
  2. Module FTG-MSA : La conception d'un mécanisme d'auto-attention qui incorpore l'information d'amplitude du domaine fréquentiel comme un signal de guidage dynamique. Cela permet au réseau d'ajuster de manière adaptative les poids d'amélioration en fonction de la valeur grise maximale dans les zones de faible luminosité, évitant ainsi les artefacts d'exposition.
  3. Module MSSA : L'introduction d'un module d'attention synergique multi-forme dans l'espace de guidage de plus haute dimension. Ce module intègre efficacement les informations éparses, homogénéise la densité des canaux et extrait les informations de texture à échelle profonde grâce à une combinaison de SCSA, MSA (DSA/DRA) et CMUNeXt.
  4. Performance supérieure : Des expériences approfondies démontrent que MSFT surpasse les méthodes de l'état de l'art (SOTA) sur plusieurs jeux de données (LOL, SID, SMID, SDSD) en termes de PSNR et de SSIM, particulièrement pour la préservation des détails de texture et la restauration de l'illumination sans surexposition.

4. Résultats expérimentaux

Les auteurs ont évalué MSFT sur sept jeux de données : LOL-v1, LOL-v2-real, LOL-v2-synthetic, SID, SMID, SDSD-indoor et SDSD-outdoor.

  • Performance quantitative :
    • Sur le jeu de données SDSD-outdoor, MSFT a atteint un PSNR de 41,76 dB et un SSIM de 0,988. Cela représente une amélioration de 11,92 dB par rapport à Retinexformer et une amélioration de 13,80 % du SSIM.
    • Comparé à la méthode supervisée SOTA Retinexformer, MSFT affiche des gains de PSNR significatifs sur tous les benchmarks, allant de 0,11 dB à 11,92 dB.
    • Comparé à la méthode non supervisée Retinexformer, les améliorations sont encore plus marquées, avec des gains allant jusqu'à 16,48 dB sur certains jeux de données.
  • Efficacité :
    • MSFT possède 1,25 million de paramètres et 18,07 GFLOPs. C'est relativement faible comparé à d'autres modèles performants comme SNR-Net (4,01M de paramètres, 26,35 GFLOPs) et offre un meilleur équilibre entre performance et coût computationnel.
  • Études d'ablation :
    • Le retrait du guidage Retinex (entrée à quatre canaux) a provoqué une chute significative des performances (ex: ~9 dB sur SDSD-outdoor), validant l'importance des priors d'illumination.
    • Le retrait du module MSSA a entraîné des déclins substantiels du PSNR et du SSIM, confirmant son rôle dans la similitude structurelle et la restauration de la texture.
    • Le retrait du composant FFT au sein de FTGT a entraîné la dégradation de performance la plus sévère, prouvant que le guidage par le domaine fréquentiel est indispensable pour la cohérence globale.
  • Résultats qualitatifs : Les comparaisons visuelles montrent que MSFT capture efficacement les textures d'arrière-plan et maintient une illumination réaliste, là où d'autres méthodes introduisent souvent des zones sombres, des artefacts ou une surexposition dans les zones claires.

5. Signification et limites

Signification :
L'article affirme que MSFT fournit une solution robuste pour l'amélioration de la faible luminosité en fusionnant efficacement l'information d'amplitude du domaine fréquentiel avec des mécanismes d'attention multi-échelles. Il offre une référence pour la construction de modèles utilisant l'attention guidée par le domaine fréquentiel pour restaurer des images dégradées, atteignant un équilibre entre la précision de la récupération de l'illumination et l'amélioration des détails de texture sans la lourde charge de calcul des modèles de diffusion ou les limitations des structures ViT fixes.

Limites :
Les auteurs reconnaissent plusieurs contraintes :

  • Pollution lumineuse : La méthode est limitée dans le traitement des images polluées par une lumière forte, car elle peine à supprimer le bruit des parties surexposées.
  • Traitement en temps réel : Elle n'est pas suffisamment efficace pour un traitement en temps réel dans des scénarios de lumière naturelle.
  • Dépendance aux données : Le modèle nécessite une grande quantité de données appariées pour l'entraînement et n'est pas actuellement adapté aux domaines d'augmentation non supervisés manquant de données appariées.
  • Sensibilité au bruit : Le modèle ne prend pas en compte les images acquises dans des scénarios avec une forte pollution par le bruit ; il nécessite des jeux de données appariés relativement propres ou pré-nettoyés.

Travaux futurs :
Les auteurs suggèrent des directions de recherche futures, notamment :

  • L'intégration réelle de la transformée de Fourier dans la couche d'attention pour effectuer les calculs d'attention directement dans le domaine fréquentiel (en utilisant les spectres d'amplitude et de phase).
  • L'exploration de l'application des modèles de diffusion dans le domaine fréquentiel, potentiellement en optimisant la structure de diffusion pour réduire les ressources de calcul tout en tirant parti de leurs capacités génératives pour l'amélioration non supervisée.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →