← नवीनतम पेपर
💻 computer science

Frequency-Decomposed INR for NIR-Assisted Low-Light RGB Image Denoising

यह शोध पत्र FDINR का प्रस्ताव करता है, जो एक नियर इन्फ्रारेड-असिस्टेड लो-लाइट इमेज डिनोइज़िंग विधि है, जो लुमिनेंस और हाई-फ्रीक्वेंसी टेक्सचर विवरणों को प्रभावी ढंग से बहाल करने के साथ-साथ मनचाहे रिज़ॉल्यूशन पुनर्निर्माण को सक्षम करने के लिए क्रॉस-मोडल डिफरेंशियल सुपरविजन के साथ एक फ्रीक्वेंसी-डिकपल्ड इम्प्लिसिट न्यूरल रिप्रेजेंटेशन का उपयोग करता है।

मूल लेखक: Ligen Shi, Zengyu Pang, Chang Liu, Shuchen Sun, Jun Qiu

प्रकाशित 2026-04-21
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ligen Shi, Zengyu Pang, Chang Liu, Shuchen Sun, Jun Qiu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक ड्रोन का उपयोग करके रात में एक सुंदर जंगल की तस्वीर लेने की कोशिश कर रहे हैं। समस्या यह है कि अंधेरा इतना अधिक है कि आपका "दृश्य प्रकाश" सेंसर (RGB कैमरा) संघर्ष कर रहा है। यह बिल्कुल वैसा ही है जैसे किसी अंधेरे कमरे में किताब पढ़ने की कोशिश करना; आप इतनी ज़ोर से अपनी आँखें सिकोड़ते हैं कि तस्वीर दानेदार, धुंधली और रंग अजीब (बहुत अधिक हरा या बैंगनी) दिखाई देने लगते हैं।

हालाँकि, आपके ड्रोन में एक विशेष "नाइट विज़न" कैमरा (NIR कैमरा) भी है। यह कैमरा दुनिया को अलग तरह से देखता है। इसे रंगों की परवाह नहीं है, लेकिन यह अंधेरे में भी पेड़ों और चट्टानों के आकार और बनावट (shapes and textures) को बहुत स्पष्ट रूप से देखता है, क्योंकि यह एक अलग तरह के प्रकाश (इन्फ्रारेड) का उपयोग करता है जो अंधेरे को चीर देता है।

चुनौती वैज्ञानिकों के लिए हमेशा से यह रही है: हम खराब रात वाली फोटो से "रंग" और नाइट विज़न फोटो से "स्पष्ट आकार" को बिना किसी गड़बड़ी के कैसे मिलाएँ?

पुराने तरीके इन दोनों तस्वीरों को एक पहेली (puzzle) की तरह जोड़ने की कोशिश करते थे, लेकिन उनके टुकड़े आपस में ठीक से फिट नहीं बैठते थे। रंग मटमैले हो जाते थे और स्पष्ट किनारे धुंधले पड़ जाते थे।

नया समाधान: FD-INR (द "फ्रीक्वेंसी शेफ")

यह पेपर एक नई विधि पेश करता है जिसे FD-INR कहा जाता है। इसे एक पहेली के रूप में नहीं, बल्कि एक मास्टर शेफ के रूप में सोचें जो खाना पकाने से पहले सामग्रियों को ठीक से अलग करना जानता है।

यह इस प्रकार काम करता है, सरल उपमाओं (analogies) का उपयोग करते हुए:

1. "फ्रीक्वेंसी" का पृथक्करण (किचन काउंटर)

कल्पना कीजिए कि इमेज एक सूप है।

  • लो फ्रीक्वेंसी (Low Frequencies) सूप का शोरबा (broth) है: बड़े, चिकने स्वाद (कुल रंग और चमक)।
  • हाई फ्रीक्वेंसी (High Frequencies) मसाले और क्रंच हैं: सूक्ष्म विवरण (पेड़ की पत्तियाँ, छाल की बनावट)।

एक अंधेरी फोटो में, "शोरबा" (रंग) वास्तव में ठीक होता है, लेकिन "मसाले" (विवरण) शोर (static) में डूब जाते हैं। नाइट विज़न फोटो में, "मसाले" एकदम सही होते हैं, लेकिन वहां कोई "शोरबा" नहीं होता (वह ब्लैक एंड व्हाइट होता है)।

पुराने तरीके इन दोनों सूपों को तुरंत मिलाने की कोशिश करते थे, जिससे परिणाम एक नमकीन और दानेदार मिश्रण जैसा होता था। FD-INR कहता है: "पहले शोरबे को मसालों से अलग करते हैं!"

2. दो विशेषज्ञ शेफ (डुअल ब्रान्च)

यह सिस्टम समानांतर में काम करने वाले दो अलग-अलग "AI शेफ" का उपयोग करता है:

  • शेफ A (कलर स्पेशलिस्ट): केवल अंधेरे RGB फोटो को देखता है। उनका काम शोरबा (रंग और चमक) को ठीक करना है। उन्हें सूक्ष्म विवरणों को अनदेखा करने के लिए कहा जाता है क्योंकि वे बहुत शोर भरे होते हैं। वे सुनिश्चित करते हैं कि आसमान नीला और घास हरी दिखे, न कि बैंगनी या ग्रे।
  • शेफ B (डिटेल स्पेशलिस्ट): केवल नाइट विज़न (NIR) फोटो को देखता है। उनका काम मसाले (स्पष्ट किनारे और बनावट) को ठीक करना है। उन्हें रंगों को अनदेखा करने के लिए कहा जाता है क्योंकि उस फोटो में रंग मौजूद नहीं होते। वे सुनिश्चित करते हैं कि पत्तियाँ कुरकुरी दिखें और पेड़ की छाल खुरदरी दिखे।

3. "मैजिक ब्लेंडर" (इम्प्लिसिट न्यूरल रिप्रेजेंटेशन)

आमतौर पर, कंप्यूटर पिक्सेल के एक निश्चित ग्रिड (जैसे मोज़ेक) के साथ काम करते हैं। यदि आप ज़ूम करते हैं, तो मोज़ेक ब्लॉक जैसा दिखने लगता है।
FD-INR इम्प्लिसिट न्यूरल रिप्रेजेंटेशन (INR) का उपयोग करता है। कल्पना कीजिए कि मोज़ेक के बजाय, आपके पास एक चिकना, अनंत तरल (smooth, infinite liquid) है।

  • आप जितना चाहें उतना ज़ूम कर सकते हैं, और इमेज चिकनी और स्पष्ट बनी रहेगी।
  • इसे फर्क नहीं पड़ता कि फोटो 100 पिक्सेल चौड़ी है या 10,000 पिक्सेल। यह गणितीय रूप से इमेज के आकार को "जानता" है। यह ड्रोन को एक फोटो लेने और बाद में ज़ूम करने की अनुमति देता है बिना कभी धुंधला हुए।

4. "स्मार्ट टेस्ट टेस्टर" (एडेप्टिव वेटिंग)

कभी-कभी, नाइट विज़न कैमरा थोड़ा अधिक चमकीला हो सकता है, या कलर कैमरा बहुत गहरा हो सकता है।
FD-INR के पास एक स्मार्ट टेस्ट टेस्टर (अनसर्टेनिटी-बेस्ड लॉस फंक्शन) है। यह लगातार सूप को चखता है और पूछता है: "क्या रंग बहुत तेज़ है? क्या बनावट बहुत कम है?"
यह अपने आप रेसिपी को बदल देता है, शेफ A को अधिक रंग जोड़ने या शेफ B को किनारों को तेज़ करने के लिए कहता है, यह सुनिश्चित करता है कि अंतिम व्यंजन पूरी तरह से संतुलित हो।

यह एक बड़ी बात क्यों है?

  • कोई "घोस्ट" रंग नहीं: क्योंकि दोनों शेफ अलग-अलग काम करते हैं, नाइट विज़न कैमरा गलती से लाल कार को ग्रे धब्बे में नहीं बदलता। रंग मूल दृश्य के प्रति सच्चे रहते हैं।
  • सुपर शार्प डिटेल्स: नाइट विज़न कैमरे से प्राप्त बनावट को रंग के ऊपर पूरी तरह से चिपकाया जाता है, जिससे आप पूर्ण अंधेरे में भी व्यक्तिगत पत्तियों को देख सकते हैं।
  • हमेशा ज़ूम करें: क्योंकि यह "अनंत तरल" गणित (INR) का उपयोग करता है, आप एक छोटी फोटो ले सकते हैं और उसे बहुत बड़े आकार में बढ़ा सकते हैं, और यह फिर भी स्पष्ट दिखेगी। यह उन ड्रोन्स के लिए बहुत बड़ा है जिन्हें बाद में किसी विशिष्ट वस्तु पर ज़ूम करने की आवश्यकता हो सकती है।

निष्कर्ष (The Bottom Line)

यह पेपर एक कंप्यूटर को यह सिखाने जैसा है कि दो अलग-अलग भाषाओं को एक साथ बोलने के लिए मजबूर करना बंद करे। इसके बजाय, यह कंप्यूटर को एक कैमरे से "आकार" (Shape) की भाषा और दूसरे कैमरे से "रंग" (Color) की भाषा को अनुवाद (translate) करना और फिर उन्हें एक एकल, क्रिस्टल-क्लियर, हाई-डेफिनिशन इमेज में पूरी तरह से मिलाना सिखाता है, जो बिल्कुल वैसी ही दिखती है जैसे कि वह दिन के उजाले में ली गई हो, भले ही बाहर घना अंधेरा हो।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →