← नवीनतम पेपर
💻 computer science

CLIP-Guided Data Augmentation for Night-Time Image Dehazing

यह शोध पत्र NTIRE 2026 नाइट टाइम इमेज डिहेज़िंग चैलेंज के लिए एक एकीकृत ढांचा प्रस्तुत करता है जो डोमेन-अलाइन्ड प्रशिक्षण सेटों के निर्माण के लिए CLIP-गाइडेड डेटा ऑग्मेंटेशन का लाभ उठाता है, दो-चरणीय NAFNet प्रशिक्षण रणनीति का उपयोग करता है, और सीमित पर्यवेक्षण के तहत रात के धुंध के जटिल क्षरण पैटर्न को प्रभावी ढंग से संबोधित करने के लिए इन्फरेंस-टाइम संवर्द्धन को जोड़ता है।

मूल लेखक: Xining Ge, Weijun Yuan, Gengjia Chang, Xuyang Li, Shuhong Liu

प्रकाशित 2026-04-08
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xining Ge, Weijun Yuan, Gengjia Chang, Xuyang Li, Shuhong Liu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप रात में शहर की एक सुंदर सड़क की फोटो खींचने की कोशिश कर रहे हैं, लेकिन तभी एक घना, चमकता हुआ कोहरा छा जाता है। स्ट्रीटलाइट्स आंखों को चुंधिया रही हैं, परछाइयां एकदम काली हैं, और पूरा दृश्य धुंधला और गंदा सा लग रहा है। यह नाइटटाइम इमेज डीहेज़िंग (Nighttime Image Dehazing) की समस्या है।

आपने जो पेपर साझा किया है, वह एक कंप्यूटर प्रोग्राम के लिए एक "रेसिपी" है जो इन बिखरे हुए और खराब दिखने वाले फोटो को साफ करता है। लेखकों ने महसूस किया कि कंप्यूटर को ये विशिष्ट रात के फोटो ठीक करना सिखाना बहुत कठिन है क्योंकि सीखने के लिए बहुत कम "पहले और बाद के" (before and after) उदाहरण उपलब्ध हैं।

यहाँ उन्होंने इसे सरल उपमाओं (analogies) के साथ समझाया है:

1. समस्या: "विदेशी छात्र" की दुविधा (The "Foreign Student" Dilemma)

आमतौर पर, कंप्यूटर को कोहरे वाले रात के फोटो साफ करना सिखाने के लिए, आप उसे हजारों उदाहरण दिखाते हैं। लेकिन रात के कोहरे के लिए, ऐसे उदाहरण बहुत दुर्लभ हैं।

  • जाल (The Trap): लेखकों ने कंप्यूटर को सिखाने के लिए दिन के कोहरे वाले फोटो का उपयोग करने पर विचार किया। लेकिन यह एक छात्र को समुद्र में तैरना सिखाने के लिए केवल पूल में तैरते हुए लोगों के वीडियो दिखाने जैसा है। पानी अलग है, लहरें अलग हैं, और छात्र भ्रमित हो जाएगा। यदि आप "दिन के" उदाहरणों को कुछ "रात के" उदाहरणों के साथ बहुत अधिक मिला देते हैं, तो कंप्यूटर भटक जाता है और रात के विशिष्ट नियमों को सीखना बंद कर देता है।

2. समाधान: "स्मार्ट लाइब्रेरियन" (CLIP)

उपलब्ध सभी कोहरे वाले फोटो को ट्रेनिंग में डालने के बजाय, टीम ने CLIP नामक टूल का उपयोग करके एक स्मार्ट लाइब्रेरियन बनाया।

  • यह कैसे काम करता है: कल्पना कीजिए कि आपके पास दुनिया भर के कोहरे वाले फोटो का एक विशाल पुस्तकालय है। आप लाइब्रेरियन से कहते हैं, "मुझे केवल वे किताबें चाहिए जो एक रात के कोहरे वाली सड़क जैसी महसूस होती हों।"
  • फ़िल्टर (The Filter): लाइब्रेरियन (CLIP) हर फोटो को देखता है और पूछता है, "क्या यह लक्षित रात के दृश्य जैसा दिखता है?" यदि कोई फोटो दिन के उजाले वाला कोहरा है, तो लाइब्रेरियन कहता है, "नहीं, यह बहुत अलग है," और उसे वापस शेल्फ पर रख देता है। यदि किसी फोटो में अंधेरे और कृत्रिम रोशनी का सही मिश्रण है, तो लाइब्रेरियन कहता है, "हाँ, यह फिट बैठता है!"
  • परिणाम: अंत में उनके पास 59 फोटो का एक छोटा, सावधानीपूर्वक चुना गया "ट्रेनिंग सेट" था जो उस समस्या के बहुत समान हैं जिसे वे हल करने की कोशिश कर रहे हैं। यह कंप्यूटर को "विदेशी" डेटा से भ्रमित होने से रोकता है।

3. ट्रेनिंग: "दो-चरणीय नृत्य" (The "Two-Step Dance")

एक बार जब उनके पास सही फोटो आ गए, तो उन्होंने उन्हें एक साथ कंप्यूटर में नहीं डाला। उन्होंने टू-स्टेज ट्रेनिंग (Two-Stage Training) विधि का उपयोग किया।

  • चरण 1: बुनियादी बातें सीखना। पहले, उन्होंने कंप्यूटर को केवल वास्तविक रात के फोटो पर सिखाया। इसे एक संगीतकार को एक विशिष्ट गाना पूरी तरह से बजाना सिखाने जैसा समझें, इससे पहले कि वे सुधार (improvise) करने की कोशिश करें। कंप्यूटर रात के कोहरे के विशिष्ट "वाइब" को सीखता है।
  • चरण 2: क्षितिज का विस्तार करना। एक बार जब कंप्यूटर ने रात के फोटो में महारत हासिल कर ली, तो उन्होंने फ़िल्टर किए गए "विदेशी" फोटो (वे जिन्हें लाइब्रेरियन ने मंजूरी दी थी) पेश किए। अब, कंप्यूटर कह सकता है, "ठीक है, मैं जानता हूँ कि रात का कोहरा कैसे काम करता है, और अब मैं देख सकता हूँ कि यह दिन का कोहरा वास्तव में कुछ मायनों में काफी समान है।" यह कंप्यूटर को बुनियादी बातों को भूले बिना अधिक स्मार्ट और मजबूत बनाता है।

4. अंतिम स्पर्श: "जजों का पैनल" (Inference)

जब कंप्यूटर अंततः एक नया फोटो साफ करने के लिए तैयार हो जाता है, तो वह केवल एक अनुमान नहीं लगाता। वह पैनल ऑफ जजेज (Panel of Judges) रणनीति का उपयोग करता है।

  • दर्पण का कमाल (Self-Ensemble): कल्पना कीजिए कि आप एक पेंटिंग को दर्पण में देखते हैं, फिर उसे उल्टा करते हैं, फिर तिरछा करते हैं। कंप्यूटर फोटो को 8 अलग-अलग तरीकों से देखता है (उल्टा, घुमाया हुआ, आदि) और प्रत्येक के लिए एक अनुमान लगाता है। फिर, वह उन 8 अनुमानों का औसत निकालता है। यह उन अजीब गलतियों को रद्द कर देता है जो कंप्यूटर किसी एक विशेष कोण में कर सकता है।
  • समय-यात्री (Snapshot Fusion): कंप्यूटर को उसकी ट्रेनिंग के दौरान तीन अलग-अलग समय पर सेव किया गया था (जैसे कि एक छात्र की फोटो पहले महीने, तीसरे महीने और ग्रेजुएशन के समय लेना)। अंतिम परिणाम इन तीन संस्करणों का एक भारित मिश्रण (weighted mix) है। "ग्रेजुएशन" वाले संस्करण को सबसे अधिक भार दिया जाता है क्योंकि वह सबसे अच्छा है, लेकिन शुरुआती संस्करण किसी भी खुरदरेपन को सुचारू बनाने में मदद करते हैं।

मुख्य निष्कर्ष (The Bottom Line)

लेखकों ने कंप्यूटर के लिए कोई बिल्कुल नया, अत्यधिक जटिल दिमाग नहीं बनाया। इसके बजाय, उन्होंने एक स्मार्ट पाइपलाइन बनाई:

  1. डेटा को फ़िल्टर करें ताकि कंप्यूटर केवल प्रासंगिक उदाहरणों से सीख सके।
  2. चरणों में ट्रेन करें ताकि वह उन्नत होने से पहले बुनियादी बातें सीख ले।
  3. परिणाम को स्थिर और स्पष्ट बनाने के लिए अंत में कई अनुमानों को संयोजित (Combine) करें।

यह इस बात की याद दिलाता है कि कभी-कभी, एक कठिन समस्या को हल करने का सबसे अच्छा तरीका एक बड़ा, अधिक जटिल मशीन बनाना नहीं है, बल्कि इस बारे में स्मार्ट होना है कि आप मशीन को क्या खिला रहे हैं और आप उसका मार्गदर्शन कैसे कर रहे हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →