RealRestorer: Towards Generalizable Real-World Image Restoration with Large-Scale Image Editing Models
यह शोध पत्र RealRestorer प्रस्तुत करता है, जो वास्तविक दुनिया के नौ प्रकार के क्षरण (degradation) वाले एक बड़े पैमाने के डेटासेट पर प्रशिक्षित एक अत्याधुनिक ओपन-सोर्स इमेज रेस्टोरेशन मॉडल है और जिसे नए RealIR-Bench के माध्यम से मूल्यांकित किया गया है, जो क्लोज्ड-सोर्स बड़े एडिटिंग मॉडल्स के तुलनीय प्रदर्शन प्राप्त करते हुए गणनात्मक लागत को काफी कम कर देता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास पुरानी, खराब हुई तस्वीरों का एक डिब्बा है। कुछ तस्वीरें धुंधली हैं क्योंकि किसी ने कैमरा हिला दिया था, कुछ बारिश से भीग गई हैं, कुछ धुंधली (foggy) हैं, और कुछ में अजीब से रंगीन पैटर्न (moiré) हैं जो स्क्रीन की फोटो खींचने से आए हैं।
लंबे समय तक, कंप्यूटर वैज्ञानिकों ने इन तस्वीरों को ठीक करने के लिए विशेष उपकरणों का उपयोग करने की कोशिश की: बारिश के लिए एक टूल, धुंधलेपन के लिए दूसरा, और कोहरे के लिए तीसरा। लेकिन असल जिंदगी बहुत उलझी हुई होती है। एक फोटो धुंधली भी हो सकती है और साथ ही बारिश वाली और अंधेरे वाली भी हो सकती है। पुराने टूल्स भ्रमित हो जाते थे, या वे बारिश को तो ठीक कर देते लेकिन गलती से इंसान का चेहरा ही मिटा देते।
हाल ही में, एक नए प्रकार के "सुपर-इंटेलिजेंट" कंप्यूटर मॉडल (एक विशाल, सर्वज्ञ कलाकार की तरह) का उदय हुआ। ये मॉडल फोटो ठीक करने में अद्भुत हैं, लेकिन ये "क्लोज्ड-सोर्स लग्जरी कारों" की तरह हैं: केवल कुछ बड़ी कंपनियों के पास ही इनका स्वामित्व है, इन्हें चलाने में बहुत भारी खर्च आता है, और कोई नहीं जानता कि इनके अंदर असल में क्या चल रहा है।
RealRestorer वह प्रोजेक्ट है जो कहता है: "आइए हम अपना खुद का ओपन-सोर्स सुपर-कार बनाएं जो उन लग्जरी कारों की तरह ही अच्छी तरह चले, लेकिन इसे कोई भी चला सके।"
यहाँ उन्होंने इसे कैसे किया है, रोज़मर्रा के उदाहरणों के साथ समझाया गया है:
1. समस्या: "सिंथेटिक" बनाम "असली" का अंतर
कल्पना कीजिए कि आप गाड़ी चलाना सीख रहे हैं।
- पुरानी विधि: आपने एक वीडियो गेम सिम्युलेटर में अभ्यास किया। गेम ने बारिश को नीली रेखाओं के रूप में दिखाया और कोहरे को ग्रे कोहरे के रूप में दिखाया। आप "गेम वाली बारिश" को ठीक करने में बहुत कुशल हो गए, लेकिन जब आप वास्तविक सड़क पर गए जहाँ असली गीली, फिसलन भरी डामर और असली कोहरा था, तो आपका एक्सीडेंट हो गया।
- मुद्दा: अधिकांश AI फोटो फिक्सर्स "सिम्युलेटेड" (बनावटी) नुकसान पर प्रशिक्षित थे। उन्हें यह नहीं पता था कि वास्तविक दुनिया की गंदगी, अजीब रोशनी, या जटिल खरोंचें वास्तव में कैसी दिखती हैं।
2. समाधान: एक नया ट्रेनिंग पाइपलाइन
लेखकों ने एक विशाल, वास्तविक प्रशिक्षण मैदान बनाया। केवल एक वीडियो गेम सिम्युलेटर का उपयोग करने के बजाय, उन्होंने एक "डिजिटल फोटो लैब" बनाया जो वास्तविक दुनिया की सटीक नकल करता है।
- "सिंथेटिक" हिस्सा: उन्होंने लाखों नकली क्षतिग्रस्त फोटो बनाने के लिए उन्नत AI का उपयोग किया। लेकिन उन्होंने केवल साधारण धुंधलापन नहीं बनाया; उन्होंने जटिल नियमों का उपयोग किया ताकि बारिश असली बारिश जैसी दिखे और धुंधलापन हाथ के हिलने जैसा लगे।
- "असली" हिस्सा: उन्होंने इंटरनेट से वास्तविक क्षतिग्रस्त फोटो भी खोज निकालीं जो असली लोगों द्वारा ली गई थीं। उन्होंने एक स्मार्ट AI सहायक (एक "क्वालिटी कंट्रोल इंस्पेक्टर") का उपयोग किया जिसने इन फोटो की जांच की और उन्हें उसी फोटो के एक "परफेक्ट" वर्जन के साथ जोड़ा।
- परिणाम: उन्होंने 9 प्रकार के नुकसान (धुंधलापन, बारिश, शोर, कम रोशनी, आदि) को कवर करने वाले 1.6 मिलियन से अधिक फोटो जोड़ों का एक डेटासेट तैयार किया।
3. प्रशिक्षण रणनीति: "दो-चरणों वाला आहार" (Two-Stage Diet)
एक विशाल AI मॉडल को प्रशिक्षित करना एक एथलीट को प्रशिक्षित करने जैसा है। आप उन्हें सीधे ओलंपिक में नहीं झोंक सकते। लेखकों ने एक चतुर दो-चरणीय आहार का उपयोग किया:
चरण 1: "सामान्य ज्ञान" का चरण (ट्रांसफर ट्रेनिंग)
उन्होंने एक ऐसे मॉडल से शुरुआत की जो पहले से ही इमेज एडिटिंग (जैसे आसमान बदलना या बिल्ली जोड़ना) में अच्छा था। उन्होंने पहले इस मॉडल को "सिम्युलेटेड" नुकसान को ठीक करना सिखाया। इसने मॉडल को एक व्यापक समझ दी कि "खराब" क्या दिखता है।- उपमा: यह सिम्युलेटर में ड्राइविंग के नियम सीखने जैसा है। आप सीखते हैं कि कार कैसे प्रतिक्रिया करती है, लेकिन आपने अभी तक असली हवा या बारिश को महसूस नहीं किया है।
चरण 2: "वास्तविक दुनिया" का चरण (सुपरवाइज्ड फाइन-ट्यूनिंग)
फिर, वे असली, बिखरी हुई इंटरनेट फोटो पर आ गए। उन्होंने मॉडल को वास्तविक नुकसान को ठीक करना सिखाया। महत्वपूर्ण बात यह है कि उन्होंने सिम्युलेटेड डेटा को पूरी तरह से फेंका नहीं। उन्होंने सिम्युलेटर के डेटा को वास्तविक दुनिया के डेटा के साथ थोड़ा मिला दिया।- उपमा: यह वास्तविक सड़क पर ड्राइविंग लेसन लेने जैसा है, लेकिन एक सुरक्षा जाल (सिम्युलेटर डेटा) को बनाए रखते हुए ताकि आप बुनियादी नियम न भूल जाएं। यदि आप केवल वास्तविक सड़कों पर चलते, तो शायद आप विशिष्ट गड्ढों के इतने आदी हो जाते कि एक चिकनी हाईवे को संभालना भूल जाते।
4. नया टेस्ट: RealIR-Bench
आपको कैसे पता चलेगा कि फोटो फिक्सर वास्तव में अच्छा है?
- पुराने टेस्ट: वे गणितीय सूत्रों का उपयोग करते थे जो ठीक की गई फोटो की तुलना "परफेक्ट" मूल से करते थे। लेकिन वास्तविक दुनिया में, आपके पास अक्सर "परफेक्ट" मूल नहीं होता है। यह किसी छात्र के निबंध को उत्तर कुंजी (answer key) के बिना ग्रेड करने की कोशिश करने जैसा है।
- नया टेस्ट (RealIR-Bench): लेखकों ने 46able वास्तविक, क्षतिग्रस्त फोटो का उपयोग करके एक टेस्ट बनाया जहाँ किसी के पास भी परफेक्ट उत्तर कुंजी नहीं है।
- ग्रेडर: गणितीय सूत्र के बजाय, उन्होंने एक सुपर-स्मार्ट AI (एक विजन-लैंग्वेज मॉडल) का उपयोग किया जो एक मानव जज के रूप में कार्य करता है। यह AI "पहले" और "बाद" को देखता है और पूछता है: "क्या बारिश चली गई? क्या चेहरा अजीब लग रहा है? क्या यह प्राकृतिक लग रहा है?"
- उपमा: छात्र के उत्तर को कुंजी से मिलाने के बजाय, आप एक मानव शिक्षक को निबंध पढ़ने के लिए नियुक्त करते हैं और वे कहते हैं, "हाँ, यह बहुत बेहतर है, और उन्होंने मुख्य पात्र का नाम नहीं बदला है।"
5. परिणाम: अंडरडॉग की जीत
जब उन्होंने RealRestorer का परीक्षण बड़े, क्लोज्ड-सोर्स "लग्जरी कारों" (जैसे Nano Banana Pro और GPT-Image-1.5) के खिलाफ किया:
- इसने महंगे, क्लोज्ड मॉडल्स के समान प्रदर्शन किया।
- यह उपलब्ध सर्वश्रेष्ठ ओपन-सोर्स मॉडल था।
- यह 9 प्रकार के नुकसान को ठीक कर सकता था और यहाँ तक कि उन चीजों को भी संभाल सकता था जिनके लिए इसे स्पष्ट रूप से प्रशिक्षित नहीं किया गया था (जैसे बर्फ या पुरानी फोटो), क्योंकि इसने केवल विशिष्ट नियमों को नहीं, बल्कि "ठीक करने" के कॉन्सेप्ट को सीखा था।
सारांश
RealRestorer एक बड़ी उपलब्धि है क्योंकि यह साबित करता है कि वास्तविक दुनिया की फोटो ठीक करने के लिए आपको अरबों डॉलर के बजट की आवश्यकता नहीं है। एक स्मार्ट प्रशिक्षण मैदान (नकली और असली डेटा को मिलाकर) और परिणामों को परखने का एक बेहतर तरीका (गणितीय सूत्रों के बजाय AI जजों का उपयोग करके) बनाकर, उन्होंने एक ओपन-सोर्स टूल बनाया है जो वास्तविक दुनिया की बिखरी हुई फोटो को साफ करने के लिए तैयार है।
यह एक मास्टर शेफ की गुप्त रेसिपी को समझने, यह जानने के की इसे उन सामग्रियों के साथ कैसे पकाया जाए जिन्हें कोई भी खरीद सकता है, और यह साबित करने जैसा है कि बनने वाला व्यंजन उस शानदार रेस्टोरेंट के व्यंजन जितना ही स्वादिष्ट है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।