← नवीनतम पेपर
💻 computer science

LD-RPS: Zero-Shot Unified Image Restoration via Latent Diffusion Recurrent Posterior Sampling

LD-RPS एक नवीन, डेटासेट-मुक्त और एकीकृत इमेज रेस्टोरेशन फ्रेमवर्क का प्रस्ताव करता है जो विभिन्न प्रकार के डिग्रेडेशन के लिए कार्य-विशिष्ट प्रशिक्षण के बिना उत्कृष्ट प्रदर्शन प्राप्त करने के लिए मल्टीमॉडल सिमेंटिक प्रायर्स और एक लाइटवेट अलाइनमेंट मॉड्यूल द्वारा संवर्धित, एक प्री-ट्रेन्ड लेटेंट डिफ्यूजन मॉडल पर रिकरेंट पोस्टीरियर सैंपलिंग का लाभ उठाता है।

मूल लेखक: Huaqiu Li, Yong Wang, Tongwen Huang, Hailang Huang, Haoqian Wang, Xiangxiang Chu

प्रकाशित 2026-03-10
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Huaqiu Li, Yong Wang, Tongwen Huang, Hailang Huang, Haoqian Wang, Xiangxiang Chu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास पुरानी, क्षतिग्रस्त तस्वीरों का एक संग्रह है। कुछ धुंधली और गहरी हैं, कुछ कोहरे से ढकी हुई हैं, कुछ स्टैटिक (static) के साथ दानेदार हैं, और कुछ ब्लैक एंड व्हाइट हैं जबकि उन्हें रंगीन होना चाहिए था।

पारंपरिक रूप से, इन तस्वीरों को ठीक करना एक अलग विशेषज्ञ को काम पर रखने जैसा था। आपको कम रोशनी वाली तस्वीरों के लिए एक "डार्कनेस एक्सपर्ट", धुंधली तस्वीरों के लिए एक "फॉग रिमूवर", और ब्लैक एंड व्हाइट शॉट्स के लिए एक "कलरिस्ट" की आवश्यकता होती थी। यदि आपके पास ऐसी फोटो होती जो अंधेरे और कोहरे दोनों से प्रभावित होती, तो आप फंस जाते क्योंकि कोई भी अकेला विशेषज्ञ उस मिश्रण को संभालने का ज्ञान नहीं रखता था। इसके अलावा, इन विशेषज्ञों को यह सीखने के लिए कि नुकसान को कैसे ठीक किया जाए, उस विशिष्ट प्रकार के नुकसान के हजारों आदर्श उदाहरणों का अध्ययन करने की आवश्यकता होती थी।

LD-RPS एक जादुई, सर्वज्ञ कला संरक्षक (art restorer) की तरह है जिसे पहले से हजारों उदाहरणों का अध्ययन करने की आवश्यकता नहीं है। यह किसी भी क्षतिग्रस्त फोटो को देख सकता है, समझ सकता है कि वह कैसी दिखनी चाहिए, और एक ही बार में उसे ठीक कर सकता है, भले ही उसने उस विशिष्ट प्रकार के नुकसान को पहले कभी न देखा हो।

यह इस प्रकार काम करता है, जिसे सरल चरणों में विभाजित किया गया है:

1. "कल्पना" चरण (द प्रॉम्प्ट)

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान कलाकार को भालू की एक धुंधली, अंधेरी फोटो देते हैं। कलाकार अपनी आँखें सिकोड़ता है और कहता है, "हम्म, यह हरे कपड़ों में बैठे एक आलीशान भालू जैसा लग रहा है।"

  • पेपर क्या करता है: यह एक सुपर-स्मार्ट AI (जिसे मल्टीमॉडल लार्ज लैंग्वेज मॉडल कहा जाता है) का उपयोग करता है जो आपकी खराब फोटो को देखता है और एक संक्षिप्त, स्पष्ट विवरण लिखता है कि दृश्य वास्तव में कैसा दिखना चाहिए। यह शोर और अंधेरे को नजरअंदाज करता है और कहानी पर ध्यान केंद्रित करता है: "एक भालू, हरे कपड़े, मेज।" यह विवरण सुधार के लिए एक "ब्लूप्रिंट" बन जाता है।

2. "सपनों" का चरण (लेटेंट डिफ्यूजन)

अब, कल्पना कीजिए कि कलाकार शुद्ध स्टैटिक शोर के एक खाली कैनवास से पेंटिंग करना शुरू करता है। वे केवल बेतरतीब ढंग से पेंट नहीं करते; वे अपने ब्रश के स्ट्रोक को निर्देशित करने के लिए "ब्लूप्रिंट" (विवरण) का उपयोग करते हैं।

  • पेपर क्या करता है: यह एक शक्तिशाली "ड्रीम मशीन" (लेटेंट डिफ्यूजन मॉडल) का उपयोग करता है जो रैंडम शोर से शुरू होता है और धीरे-धीरे विवरण के आधार पर एक स्पष्ट छवि में बदल जाता है। इसे संगमरमर के ब्लॉक से मूर्ति तराशने जैसा समझें; कलाकार भालू को प्रकट करने के लिए शोर को छीलकर निकालता है।

3. "वास्तविकता की जांच" (फीचर और पिक्सेल अलाइनमेंट)

यही पेचीदा हिस्सा है। ड्रीम मशीन सुंदर भालू बनाने में बहुत अच्छी है, लेकिन यह ऐसा भालू बना सकती है जो आपके विशिष्ट फोटो से बिल्कुल अलग हो। यह एक ऐसा भालू बना सकती है जो बहुत बड़ा हो, या मेज का आकार गलत हो।

  • पेपर क्या करता है: यह एक विशेष "रियलिटी चेक" टूल (जिसे F-PAM कहा जाता है) का उपयोग करता है। जैसे-जैसे मशीन पेंट करती है, यह टूल लगातार आपकी मूल क्षतिग्रस्त फोटो के साथ तुलना करता रहता है। यह कहता है, "रुको, मूल फोटो में यहाँ एक नीली बोतल है, लेकिन तुम्हारी पेंटिंग में नहीं है।" फिर यह पेंटिंग को आपकी फोटो के वास्तविक विवरणों से मेल खाने के लिए धीरे से प्रेरित करता है, यह सुनिश्चित करता है कि बहाल की गई छवि केवल एक सामान्य भालू नहीं है, बल्कि आपका भालू है।

4. "दूसरी नज़र" (रिकरेंट रिफाइनमेंट)

कभी-कभी, पहला प्रयास सटीक नहीं होता है। रंग थोड़े गलत हो सकते हैं, या कोई छोटा सा धब्बा हो सकता है।

  • पेपर क्या करता है: हार मानने के बजाय, सिस्टम "लगभग अच्छे" परिणाम को लेता है और उसे एक नए शुरुआती बिंदु के रूप में मशीन में वापस फीड करता है। यह एक कलाकार के पीछे हटने, आँखें सिकोड़ने और कहने जैसा है, "मैं इससे बेहतर कर सकता हूँ," और फिर पिछले संस्करण का उपयोग गाइड के रूप में करके कैनवास को फिर से पेंट करना। यह प्रक्रिया इसे तब तक कई बार दोहराता है जब, जब तक कि छवि चमक न उठे।

यह एक बड़ी बात क्यों है?

  • कोई ट्रेनिंग की आवश्यकता नहीं: अधिकांश AI टूल्स को लाखों "खराब फोटो + अच्छी फोटो" के जोड़ों पर प्रशिक्षित होने की आवश्यकता होती है। LD-RPS Zero-Shot है, जिसका अर्थ है कि यह बिना किसी पूर्व प्रशिक्षण के, उस विशिष्ट प्रकार के नुकसान पर तुरंत काम करता है जिसे इसने पहले कभी नहीं देखा है।
  • सभी के लिए एक टूल: चाहे आपकी फोटो अंधेरी हो, धुंधली हो, शोर वाली हो, या ब्लैक-एंड-व्हाइट हो, यह एकल टूल सब कुछ संभाल लेता है।
  • मिश्रित समस्याएं: यह एक ऐसी फोटो को ठीक कर सकता है जो एक साथ अंधेरी और शोर वाली दोनों हो, जो पारंपरिक टूल्स के लिए एक दुस्वप्न है।

संक्षेप में: LD-RPS एक स्मार्ट, स्वयं-सुधार करने वाला कला संरक्षक है। यह आपकी क्षतिग्रस्त फोटो को पढ़ता है, कल्पना करता है कि वह कैसी दिखनी चाहिए, एक नया संस्करण पेंट करता है, मूल के विरुद्ध अपने काम की जांच करता है, और तब तक बार-बार पॉलिश करता है जब तक कि नुकसान खत्म न हो जाए और मूल सुंदरता बहाल न हो जाए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →