← नवीनतम पेपर
💻 computer science

Low-light Image Enhancement via Multi-scale Attention combined with Fourier Transform

यह शोध पत्र MSFT का प्रस्ताव करता है, जो एक सुपरवाइज्ड वन-स्टेज डीप लर्निंग नेटवर्क है जो कम रोशनी वाली छवियों में बनावट के विवरण और वैश्विक संदर्भ को प्रभावी ढंग से बढ़ाने के लिए मल्टी-स्केल अटेंशन को फूरियर ट्रांसफॉर्म एम्प्लीट्यूड फ्यूजन के साथ एकीकृत करता है, जिससे कई बेंचमार्क डेटासेट पर अत्याधुनिक प्रदर्शन प्राप्त होता है।

मूल लेखक: Wenbin Du, Jian Long, Zhu Cao

प्रकाशित 2026-07-28
📖 1 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Wenbin Du, Jian Long, Zhu Cao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

तकनीकी सारांश: मल्टी-स्केल अटेंशन और फूरियर ट्रांसफॉर्म (MSFT) के माध्यम से कम-प्रकाश वाली छवियों का संवर्धन

1. समस्या विवरण

लो-लाइट इमेज एनहांसमेंट (LLIE) का लक्ष्य उन चुनौतीपूर्ण वातावरणों में कैप्चर की गई छवियों से उच्च गुणवत्ता वाली, सामान्य-प्रकाश वाली छवियों को पुनः प्राप्त करना है, जो अपर्याप्त रोशनी जैसे कि अंधेरे इनडोर सेटिंग्स या नाटकीय चमक भिन्नताओं वाले बाहरी दृश्यों द्वारा चिह्नित होते हैं। ये स्थितियाँ ल्यूमिनेंस क्षरण (luminance degradation), पर्याप्त इमेज ब्लर और शोर (noise) का कारण बनती हैं।

मौजूदा डीप लर्निंग-आधारित LLIE विधियाँ कई सीमाओं का सामना करती हैं:

  • टेक्सचर और इल्यूमिनेशन रिकवरी: कई विधियाँ वास्तविक दुनिया के इल्यूमिनेशन वितरण को सटीक रूप से पकड़ने और सूक्ष्म टेक्सचर विवरणों को एक साथ बहाल करने में संघर्ष करती हैं।
  • अनुकूली सीमाएँ (Adaptive Limitations): मुख्यधारा की विधियाँ अक्सर क्षेत्रीय टेक्सचर जानकारी के आधार पर ब्राइटनेस को अनुकूल रूप से समायोजित करने में विफल रहती हैं, जिससे ओवरएक्सपोज़र या अंडरएक्सपोज़र जैसी समस्याएँ होती हैं।
  • कंप्यूटेशनल और प्रायर डिपेंडेंसी: जबकि डिफ्यूजन मॉडल उच्च यथार्थवाद प्रदान करते हैं, वे अक्सर अनुमानित क्षरण प्रक्रियाओं या भारी प्री-ट्रेन्ड प्रायर पर निर्भर होते हैं, जो वास्तविक दुनिया के परिदृश्यों में उनकी प्रयोज्यता को सीमित करता है जहाँ क्षरण अस्पष्ट होता है। इसके अलावा, सिमेंटिक प्रायर पर निर्भर रहने वाली विधियों को अत्यधिक कंप्यूटेशनल संसाधनों की आवश्यकता होती है।
  • शोर और बैकग्राउंड हैंडलिंग: SNR-अवेयर ऑप्टिमाइज़ेशन जैसी तकनीकें सिग्नल-टू-नॉइज़ रेशियो में सुधार करती हैं, लेकिन वे अक्सर डीप-स्केल जानकारी को कैप्चर करने या ऑरोरल फोरग्राउंड तत्वों वाले बैकग्राउंड क्षेत्रों को पर्याप्त रूप से बढ़ाने में विफल रहती हैं।

2. कार्यप्रणाली

लेखक MSFT (मल्टी-स्केल अटेंशन कंबाइंड विद द फूरियर ट्रांसफॉर्म) का प्रस्ताव करते हैं, जो एक सुपरवाइज्ड, फ्रीक्वेंसी-डोमेन डीप लर्निंग नेटवर्क है। इसकी आर्किटेक्चर एक दो-चरणीय, U-आकार का फ्रेमवर्क है जो फूरियर ट्रांसफॉर्म सिद्धांतों द्वारा निर्देशित CNN और ट्रांसफॉर्मर को एकीकृत करता है।

मुख्य आर्किटेक्चरल घटक

A. फूरियर ट्रांसफॉर्म-गाइडेड मल्टी-स्केल अटेंशन (FTG-MSA)
यह नेटवर्क के स्केल्स के भीतर एम्बेडेड मुख्य रिकवरी मॉड्यूल है। यह इस अवलोकन का लाभ उठाता है कि फ्रीक्वेंसी डोमेन एम्प्लीट्यूड ब्राइटनेस जानकारी को एनकोड करता है, जबकि फेज स्ट्रक्चरल विवरणों से संबंधित होता है।

  • गाइडेंस कंस्ट्रक्शन: नेटवर्क लो-लाइट इमेज और एक मैक्सिमम ग्रे वैल्यू प्रायर मैप (रेटिनेक्स थ्योरी के माध्यम से इल्यूमिनेशन लेयर से प्राप्त) को जोड़कर एक चार-चैनल फीचर ब्राइटनेस मैप बनाता है।
  • फ्रीक्वेंसी फ्यूजन: मॉड्यूल लो-लाइट इमेज फीचर्स और चार-चैनल गाइडेंस मैप दोनों पर फास्ट फूरियर ट्रांसफॉर्म (FFT) करता है। यह लो-लाइट इमेज के फेज को सुरक्षित रखते हुए, गाइडेंस मैप के एम्प्लीट्यूड स्पेक्ट्रम को लो-लाइट इमेज के एम्प्लीट्यूड स्पेक्ट्रम में जोड़ देता है।
  • इनवर्स ट्रांसफॉर्मेशन: एक इनवर्स FFT (IFFT) गाइडेड फीचर मैप को पुनर्गठित करता है, जो ओवर/अंडर-एक्सपोज़र को रोकने के लिए ब्राइटनेस प्रायर के रूप में कार्य करता है।
  • अटेंशन मैकेनिज्म: यह फ्यूज्ड एम्प्लीट्यूड जानकारी एक मल्टी-हेड सेल्फ-अटेंशन मैकेनिज्म को निर्देशित करती है। अटेंशन वेट्स को गतिशील रूप से गणना किया जाता है ताकि प्रासंगिक फीचर्स को चुनिलेक्टिव रूप से खींचा जा सके, जिससे टेक्सचर को संरक्षित करते हुए इमेज कंटेंट समृद्ध होता है।

B. मल्टी-शेप सिनर्जिस्टिक अटेंशन (MSSA)
डीप-स्केल टेक्सचर जानकारी निकालने और उच्च-आयामी स्पार्स फीचर्स को एकीकृत करने के लिए डिज़ाइन किया गया, MSSA मॉड्यूल उच्चतम चैनल स्केल पर डाला गया है। इसमें तीन सीरियली जुड़े घटक शामिल हैं:

  1. स्पेशियल और चैनल सिनर्जिस्टिक अटेंशन (SCSA): यह चैनल महत्व को अनुकूल रूप से तौलता है और महत्वपूर्ण स्थानिक जानकारी को बढ़ाता है।
  2. मल्टी-शेप अटेंशन (MSA): इसमें समानांतर डाइलेटेड स्क्वायर अटेंशन (DSA) और डाइलेटेड रेक्टेंगल अटेंशन (DRA) शामिल हैं।
    • DSA: लो-पास फिल्टर सीमाओं से बचने के लिए सॉफ्टमैक्स के बजाय हाइपरबोलिक टेंगेंट (Tanh) एक्टिवेशन का उपयोग करता है, जिससे हाई-फ्रीक्वेंसी कंपोनेंट्स बेहतर होते हैं।
    • DRA: मल्टी-शेप फीचर्स को कैप्चर करने के लिए आयताकार क्षेत्रों में जानकारी को एकत्रित करता है।
  3. CMUNeXt: यह एक लाइटवेट मॉड्यूल है जो सभी चैनलों में वैश्विक जानकारी को एक साथ निकालता है, जिससे पैरामीटर्स और कंप्यूटेशनल लागत कम होती है और स्थानिक-चैनल जानकारी एकीकृत होती है।

C. नेटवर्क स्ट्रक्चर
समग्र फ्रेमवर्क एक तीन-स्केल U-आकार की आर्किटेक्चर है।

  • एनकोडिंग: लो-लाइट इमेज और चार-चैनल गाइडेंस मैप को पदानुक्रमित फीचर्स उत्पन्न करने के लिए कनवल्शनल लेयर्स और FTGT (फूरियर ट्रांसफॉर्म-गाइडेड ट्रांसफॉर्मर) ब्लॉक्स के माध्यम से प्रोसेस किया जाता है।
  • डिकोडिंग: एनकोडर से मल्टी-स्केल फीचर्स को सीधे संबंधित डिकोडर चैनल्स में फीड किया जाता है ताकि पुनर्निर्माण को निर्देशित किया जा सके, जिससे अतिरिक्त फीचर एक्सट्रैक्शन की आवश्यकता समाप्त हो जाती है और रेडंडेंसी कम हो जाती है।
  • लॉस फंक्शन: मॉडल को एन्हांस्ड आउटपुट और ग्राउंड ट्रुथ के बीच त्रुटि को कम करने के लिए चारबोनियर लॉस (Charbonnier loss) का उपयोग करके प्रशिक्षित किया जाता है।

3. प्रमुख योगदान

  1. MSFT आर्किटेक्चर: फूरियर ट्रांसफॉर्म को CNN-ट्रांसफॉर्मर क्रॉस-मिक्सड U-नेट फ्रेमवर्क के साथ जोड़ते हुए एक दो-चरणीय एकीकृत नेटवर्क का प्रस्ताव। यह हाइब्रिड डिज़ाइन स्थानीय फीचर्स को कैप्चर करने में CNN की दक्षता और ग्लोबल कॉन्टेक्स्ट को मॉडल करने की ट्रांसफॉर्मर की क्षमता के बीच संतुलन बनाता है।
  2. FTG-MSA मॉड्यूल: एक सेल्फ-अटेंशन मैकेनिज्म का डिज़ाइन जो फ्रीक्वेंसी-डोमेन एम्प्लीट्यूड जानकारी को एक डायनेमिक गाइडेंस सिग्नल के रूप में शामिल करता है। यह नेटवर्क को लो-लाइट क्षेत्रों में अधिकतम ग्रे वैल्यू के आधार पर एन्हांसमेंट वेट्स को अनुकूल रूप से समायोजित करने की अनुमति देता है, जिससे एक्सपोज़र आर्टिफैक्ट्स को रोका जा सकता है।
  3. MSSA मॉड्यूल: उच्चतम-आयामी गाइडेंस स्पेस में एक मल्टी-शेप सिनर्जिस्टिक अटेंशन मॉड्यूल का परिचय। यह मॉड्यूल SCSA, MSA (DSA/DRA), और CMUNeXt के संयोजन का उपयोग करके स्पार्स जानकारी को प्रभावी ढंग से एकीकृत करता है, चैनल डेंसिटी को सुसंगत बनाता है और डीप-स्केल टेक्सचर जानकारी निकालता है।
  4. श्रेष्ठ प्रदर्शन: व्यापक प्रयोगों से पता चलता है कि MSFT कई डेटासेट्स (LOL, SID, SMID, SDSD) पर PSNR और SSIM के मामले में SOTA विधियों से बेहतर प्रदर्शन करता है, विशेष रूप से टेक्सचर विवरणों को संरक्षित करने और बिना ओवरएक्सपोज़र के इल्यूमिनेशन को बहाल करने में।

4. प्रयोगात्मक परिणाम

लेखकों ने सात डेटासेट्स पर MSFT का मूल्यांकन किया: LOL-v1, LOL-v2-real, LOL-v2-synthetic, SID, SMID, SDSD-indoor, और SDSD-outdoor।

  • मात्रात्मक प्रदर्शन (Quantitative Performance):
    • SDSD-outdoor डेटासेट पर, MSFT ने 41.76 dB का PSNR और 0.988 का SSIM प्राप्त किया। यह Retinexformer की तुलना में 11.92 dB का सुधार और SSIM में 13.80% का सुधार है।
    • SOTA सुपरवाइज्ड मेथड Retinexformer की तुलना में, MSFT ने सभी बेंचमार्क में महत्वपूर्ण PSNR लाभ प्राप्त किए, जो 0.11 dB से 11.92 dB तक हैं।
    • अनसुपरवाइज्ड मेथड Retinexformer की तुलना में, सुधार और भी स्पष्ट थे, जिसमें कुछ डेटासेट्स पर 16.48 dB तक की वृद्धि देखी गई।
  • दक्षता (Efficiency):
    • MSFT में 1.25 मिलियन पैरामीटर्स और 18.07 GFLOPs हैं। यह SNR-Net (4.01M पैरामीटर्स, 26.35 GFLOPs) जैसे अन्य उच्च-प्रदर्शन वाले मॉडलों की तुलना में अपेक्षाकृत कम है और प्रदर्शन एवं कंप्यूटेशनल लागत के बीच बेहतर संतुलन प्रदान करता है।
  • एब्लेशन स्टडीज (Ablation Studies):
    • Retinex गाइडेंस (चार-चैनल इनपुट) को हटाने से प्रदर्शन में महत्वपूर्ण गिरावट आई (जैसे, SDSD-outdoor पर ~9 dB), जो इल्यूमिनेशन प्रायर के महत्व की पुष्टि करता है।
    • MSSA मॉड्यूल को हटाने से PSNR और SSIM दोनों में भारी गिरावट आई, जो स्ट्रक्चरल सिमिलरिटी और टेक्सचर रेस्टोरेशन में इसकी भूमिका की पुष्टि करता है।
    • FTGT के भीतर FFT घटक को हटाने से सबसे गंभीर प्रदर्शन गिरावट हुई, जो साबित करता है कि ग्लोबल कंसिस्टेंसी के लिए फ्रीक्वेंसी-डोमेन गाइडेंस अपरिहार्य है।
  • गुणात्मक परिणाम (Qualitative Results): विजुअल तुलना दर्शाती है कि MSFT प्रभावी रूप से बैकग्राउंड टेक्सचर को कैप्चर करता है और यथार्थवादी इल्यूमिनेशन बनाए रखता है, जबकि अन्य विधियाँ अक्सर डार्क स्पॉट्स, आर्टिफ़ेक्ट्स या ब्राइट क्षेत्रों में ओवरएक्सपोज़र पेश करती हैं।

5. महत्व और सीमाएं

महत्व:
पेपर का दावा है कि MSFT फ्रीक्वेंसी-डोमेन एम्प्लीट्यूड जानकारी को मल्टी-स्केल अटेंशन मैकेनिज्म के साथ प्रभावी ढंग से फ्यूज करके कम-प्रकाश संवर्धन के लिए एक मजबूत समाधान प्रदान करता है। यह उन मॉडलों के निर्माण के लिए एक संदर्भ प्रदान करता है जो डिग्रेड की गई छवियों को बहाल करने के लिए फ्रीक्वेंसी-डोमेन गाइडेड अटेंशन का उपयोग करते हैं, जिससे डिफ्यूजन मॉडल के भारी कंप्यूटेशनल बोझ या फिक्स्ड ViT संरचनाओं की सीमाओं के बिना सटीक इल्यूमिनेशन रिकवरी और विस्तृत टेक्सचर एन्हांसमेंट के बीच संतुलन प्राप्त होता है।

सीमाएं:
लेखक कई बाधाओं को स्वीकार करते हैं:

  • प्रकाश प्रदूषण (Light Pollution): यह विधि मजबूत प्रकाश से प्रदूषित छवियों को संभालने में सीमित है, क्योंकि यह ओवरएक्सपोज़्ड हिस्सों से शोर को हटाने में संघर्ष करती है।
  • रियल-टाइम प्रोसेसिंग: यह प्राकृतिक प्रकाश परिदृश्यों के लिए पर्याप्त कुशल नहीं है।
  • डेटा डिपेंडेंसी: मॉडल को प्रशिक्षण के लिए बड़ी मात्रा में पेयर्ड (paired) डेटा की आवश्यकता होती है और यह वर्तमान में उन अनसुपरवाइज्ड ऑग्मेंटेशन क्षेत्रों के लिए उपयुक्त नहीं है जहाँ पेयर्ड डेटा की कमी है।
  • शोर संवेदनशीलता: मॉडल उन छवियों पर विचार नहीं करता है जो गंभीर शोर प्रदूषण वाले परिदृश्यों में ली गई हैं; इसके लिए अपेक्षाकृत स्वच्छ पेयर्ड डेटासेट्स या प्री-क्लींजिंग की आवश्यकता होती है।

भावी कार्य (Future Work):
लेखक भविष्य के अनुसंधान दिशाओं का सुझाव देते हैं:

  • अटेंशन लेयर में फूरियर ट्रांसफॉर्म को पूरी तरह से एकीकृत करना ताकि फ्रीक्वेंसी डोमेन (एम्प्लीट्यूड और फेज स्पेक्ट्रा का उपयोग करके) में सीधे अटेंशन गणना की जा सके।
  • फ्रीक्वेंसी डोमेन में डिफ्यूजन मॉडल्स के अनुप्रयोग की खोज करना, संभावित रूप से डिफ्यूजन स्ट्रक्चर को अनुकूलित करके उनके जेनेरेटिव गुणों का लाभ उठाना और कंप्यूटेशनल संसाधनों को कम करना।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →