← Nieuwste papers
💻 computer science

Low-light Image Enhancement via Multi-scale Attention combined with Fourier Transform

Dit artikel stelt MSFT voor, een gesuperviseerd eenstaps diep leerend netwerk dat multi-schaal aandacht integreert met Fourier-transformatie amplitude fusie om textuurdetails en de globale context in afbeeldingen met weinig licht effectief te verbeteren, waarmee het state-of-the-art prestaties bereikt over meerdere benchmark-datasets.

Oorspronkelijke auteurs: Wenbin Du, Jian Long, Zhu Cao

Gepubliceerd 2026-07-28
📖 1 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Wenbin Du, Jian Long, Zhu Cao

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Technische Samenvatting: Low-light Beeldverbetering via Multi-scale Attention gecombineerd met Fourier Transformatie (MSFT)

1. Probleemstelling

Low-light beeldverbetering (LLIE) beoogt hoogwaardige beelden met normaal licht te herstellen uit inputs die zijn vastgelegd in uitdagende omgevingen die worden gekenmerkt door onvoldoende verlichting, zoals donkere binnenruimtes of buitenomgevingen met dramatische variaties in helderheid. Deze omstandigheden leiden tot degradatie van de luminantie, aanzienlijke beeldonscherpte en ruis.

Bestaande deep learning-gebaseerde LLIE-methoden kampen met verschillende beperkingen:

  • Textuur- en Verlichtingsherstel: Veel methoden hebben moeite met het accuraat vastleggen van realistische verlichtingsdistributies en het gelijktijdig herstellen van fijne textuurdetails.
  • Adaptieve Beperkingen: De mainstream methoden slagen er vaak niet in om de helderheid adaptief aan te passen op basis van regionale textuurinformatie, wat leidt tot problemen zoals overbelichting of onderbelichting.
  • Computationele en Prior Afhankelijkheden: Hoewel diffusiemodellen een hoge mate van realisme bieden, vertrouwen ze vaak op veronderstelde degradatieprocessen of zware vooraf getrainde priors, wat hun toepasbaarheid in real-world scenario's waar degradatie ambigu is, beperkt. Bovendien vereisen methoden die steunen op semantische priors vaak excessieve computationele middelen.
  • Ruis en Achtergrondafhandeling: Technieken zoals SNR-bewuste optimalisatie verbeteren de signaal-ruisverhoudingen, maar falen vaak in het vastleggen van diepe schaalinformatie of het adequaat verbeteren van achtergrondregio's die aurorale voorgrond-elementen bevatten.

2. Methodologie

De auteurs stellen MSFT (Multi-scale Attention gecombineerd met de Fourier Transformatie) voor, een gesuperviseerd, in het frequentiedomein gebaseerd deep learning netwerk. De architectuur is een twee-fasen, U-vormig framework dat Convolutional Neural Networks (CNN's) en Transformers integreert, gestuurd door Fourier-transformatieprincipes.

Kerncomponenten van de Architectuur

A. Fourier Transform-Guided Multi-Scale Attention (FTG-MSA)
Dit is het kernherstelmodule ingebed binnen de schalen van het netwerk. Het maakt gebruik van de observatie dat de amplitude in het frequentiedomein helderheidsinformatie codeert, terwijl de fase gerelateerd is aan structurele details.

  • Constructie van de Guidance: Het netwerk creëert een vierkanaals feature brightness map door de low-light afbeelding te concateneren met een maximum grijswaarde prior map (afgeleid van de illuminatielaag via Retinex-theorie).
  • Frequentie Fusie: De module voert een Fast Fourier Transform (FFT) uit op zowel de low-light feature als de vierkanaals guidance map. Het voegt het amplitudenspectrum van de guidance map toe aan het amplitudenspectrum van de low-light afbeelding, terwijl de fase van de low-light afbeelding behouden blijft.
  • Inverse Transformatie: Een Inverse FFT (IFFT) reconstrueert de geleide feature map, die dient als een brightness prior om over- of onderbelichting te voorkomen.
  • Attention Mechanisme: Deze gefuseerde amplitude-informatie stuurt een multi-head self-attention mechanisme aan. De attention gewichten worden dynamisch berekend om relevantie features selectief aan te trekken, waardoor de beeldinhoud wordt verrijkt terwijl de textuur behouden blijft.

B. Multi-Shape Synergistic Attention (MSSA)
Ontworpen om diepe schaaltextuurinformatie te extraheren en hoogdimensionale ijle (sparse) features te integreren, wordt de MSSA-module geplaatst op de hoogste kanaalschaal. Deze bestaat uit drie serieel verbonden componenten:

  1. Spatial and Channel Synergistic Attention (SCSA): Weegt adaptief de kanaalbelangrijkheid en vergroot kritieke ruimtelijke informatie uit.
  2. Multi-Shape Attention (MSA): Bestaat uit parallelle Dilated Square Attention (DSA) en Dilated Rectangle Attention (DRA).
    • DSA: Gebruikt een hyperbolic tangent (Tanh) activatie in plaats van Softmax om beperkingen van low-pass filters te vermijden, waardoor hoogfrequente componenten worden versterkt.
    • DRA: Aggregeert informatie in rechthoekige regio's om multi-shape features te vangen.
  3. CMUNeXt: Een lichtgewicht module die gelijktijdig globale informatie over alle kanalen extraheert, wat de parameters en computationele kosten vermindert terwijl de ruimtelijke-kanaal informatie wordt geïntegreerd.

C. Netwerkstructuur
Het algehele framework is een drie-schaals U-vormige architectuur.

  • Encoding: Low-light afbeeldingen en de vierkanaals guidance map worden verwerkt door convolutionele lagen en FTGT (Fourier Transform-Guided Transformer) blokken om hiërarchische features te genereren.
  • Decoding: Multi-scale features van de encoder worden direct naar de corresponderende decoderkanalen gevoed om de reconstructie te sturen, wat de noodzaak voor extra feature extractie elimineert en redundantie vermindert.
  • Loss Functie: Het model wordt getraind met een Charbonnier loss om de fout tussen de verbeterde output en de ground truth te minimaliseren.

3. Belangrijkste Bijdragen

  1. MSFT Architectuur: De voorstel van een twee-fasen geïntegreerd netwerk dat Fourier-transformaties combineert met een CNN-Transformer Cross-mixed U-net framework. Dit hybride ontwerp balanceert de efficiëntie van de CNN bij het vastleggen van lokale features met het vermogen van de Transformer om globale context te modelleren.
  2. FTG-MSA Module: Het ontwerp van een self-attention mechanisme dat frequentiedomein amplitude-informatie als een dynamisch sturingssignaal incorporeert. Dit stelt het netwerk in staat om de enhancement gewichten adaptief aan te passen op basis van de maximale grijswaarde in low-light gebieden, wat expositie-artefacten voorkomt.
  3. MSSA Module: De introductie van een Multi-Shape Synergistic Attention module in de hoogste-dimensionale guidance ruimte. Deze module integreert effectief ijle informatie, homogeniseert de kanaaldichtheid en extraheert diepe schaal textuurinformatie via een combinatie van SCSA, MSA (DSA/DRA) en CMUNeXt.
  4. Superieure Prestaties: Uitgebreide experimenten tonen aan dat MSFT andere SOTA-methoden (State-of-the-Art) overtreft op meerdere datasets (LOL, SID, SMID, SDSD) wat betreft PSNR en SSIM, met name in het behoud van textuurdetails en het herstellen van verlichting zonder overbelichting.

4. Experimentele Resultaten

De auteurs hebben MSFT geëvalueerd op zeven datasets: LOL-v1, LOL-v2-real, LOL-v2-synthetic, SID, SMID, SDSD-indoor en SDSD-outdoor.

  • Kwantitatieve Prestaties:
    • Op de SDSD-outdoor dataset behaalde MSFT een PSNR van 41.76 dB en een SSIM van 0.988. Dit is een verbetering van 11.92 dB ten opzichte van Retinexformer en een verbetering van 13.80% in SSIM.
    • Vergeleken met de SOTA gesuperviseerde methode Retinexformer, behaalde MSFT significante PSNR-winsten over alle benchmarks, variërend van 0.11 dB tot 11.92 dB.
    • Vergeleken met de ongesuperviseerde methode Retinexformer waren de verbeteringen nog prominenter, met winsten tot 16.48 dB op bepaalde datasets.
  • Efficiëntie:
    • MSFT heeft 1.25 miljoen parameters en 18.07 GFLOPs. Dit is relatief laag vergeleken met andere hoogpresterende modellen zoals SNR-Net (4.01M parameters, 26.35 GFLOPs) en biedt een betere balans tussen prestaties en computationele kosten.
  • Ablatie Studies:
    • Het verwijderen van de Retinex guidance (vierkanaals input) veroorzaakte een significante daling in prestaties (bijv. ~9 dB op SDSD-outdoor), wat het belang van illuminatie priors valideert.
    • Het verwijderen van de MSSA module leidde tot substantiële dalingen in zowel PSNR als SSIM, wat de rol ervan in structurele gelijkenis en textuurherstel bevestigt.
    • Het verwijderen van de FFT component binnen FTGT resulteerde in de meest ernstige prestatiedegradatie, wat bewijst dat frequentiedomein guidance onmisbaar is voor globale consistentie.
  • Kwalitatieve Resultaten: Visuele vergelijkingen laten zien dat MSFT effectief achtergrondtexturen vastlegt en realistische verlichting behoudt, terwijl andere methoden vaak donkere plekken, artefacten of overbelichting in heldere regio's introduceren.

5. Betekenis en Beperkingen

Betekenis:
Het artikel beweert dat MSFT een robuuste oplossing biedt voor low-light beeldverbetering door effectief frequentiedomein amplitude-informatie te fuseren met multi-scale attention mechanismen. Het biedt een referentie voor het construeren van modellen die frequentiedomein gestuurde attention gebruiken om gedegradeerde beelden te herstellen, waarbij een balans wordt gevonden tussen precieze verlichtingsherstel en gedetailleerde textuurverbetering zonder de zware computationele last van diffusiemodellen of de beperkingen van vaste ViT-structuren.

Beperkingen:
De auteurs erkennen enkele beperkingen:

  • Lichtvervuiling: De methode is beperkt in het afhandelen van beelden die vervuild zijn door sterk licht, aangezien het moeite heeft met het verwijderen van ruis uit overbelichte delen.
  • Real-time Verwerking: Het is niet voldoende efficiënt voor real-time verwerking van natuurlijke lichtscenario's.
  • Data Afhankelijkheid: Het model vereist een grote hoeveelheid gepaarde data voor training en is momenteel niet geschikt voor ongesuperviseerde augmentatievelden die een gebrek aan gepaarde data hebben.
  • Ruisgevoeligheid: Het model houdt geen rekening met beelden die zijn opgenomen in scenario's met ernstige ruisvervuiling; het vereist relatief schone gepaarde datasets of pre-cleansing.

Toekomstig Werk:
De auteurs suggereren de volgende onderzoeksrichtingen:

  • Het werkelijk integreren van de Fourier-transformatie in de attention layer om attention berekeningen direct in het frequentiedomein uit te voeren (gebruikmakend van amplitude en fase spectra).
  • Het verkennen van de toepassing van diffusiemodellen in het frequentiedomein, mogelijk door de diffusiestructuur te optimaliseren om computationele middelen te verminderen terwijl de generatieve capaciteiten worden benut voor ongesuperviseerde verbetering.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →