← नवीनतम पेपर
💻 computer science

RealRestorer: Towards Generalizable Real-World Image Restoration with Large-Scale Image Editing Models

यह शोध पत्र RealRestorer प्रस्तुत करता है, जो वास्तविक दुनिया के नौ प्रकार के क्षरण (degradation) वाले एक बड़े पैमाने के डेटासेट पर प्रशिक्षित एक अत्याधुनिक ओपन-सोर्स इमेज रेस्टोरेशन मॉडल है और जिसे नए RealIR-Bench के माध्यम से मूल्यांकित किया गया है, जो क्लोज्ड-सोर्स बड़े एडिटिंग मॉडल्स के तुलनीय प्रदर्शन प्राप्त करते हुए गणनात्मक लागत को काफी कम कर देता है।

मूल लेखक: Yufeng Yang, Xianfang Zeng, Zhangqi Jiang, Fukun Yin, Jianzhuang Liu, Wei Cheng, jinghong lan, Shiyu Liu, Yuqi Peng, Gang YU, Shifeng Chen

प्रकाशित 2026-03-27
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yufeng Yang, Xianfang Zeng, Zhangqi Jiang, Fukun Yin, Jianzhuang Liu, Wei Cheng, jinghong lan, Shiyu Liu, Yuqi Peng, Gang YU, Shifeng Chen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास पुरानी, खराब हुई तस्वीरों का एक डिब्बा है। कुछ तस्वीरें धुंधली हैं क्योंकि किसी ने कैमरा हिला दिया था, कुछ बारिश से भीग गई हैं, कुछ धुंधली (foggy) हैं, और कुछ में अजीब से रंगीन पैटर्न (moiré) हैं जो स्क्रीन की फोटो खींचने से आए हैं।

लंबे समय तक, कंप्यूटर वैज्ञानिकों ने इन तस्वीरों को ठीक करने के लिए विशेष उपकरणों का उपयोग करने की कोशिश की: बारिश के लिए एक टूल, धुंधलेपन के लिए दूसरा, और कोहरे के लिए तीसरा। लेकिन असल जिंदगी बहुत उलझी हुई होती है। एक फोटो धुंधली भी हो सकती है और साथ ही बारिश वाली और अंधेरे वाली भी हो सकती है। पुराने टूल्स भ्रमित हो जाते थे, या वे बारिश को तो ठीक कर देते लेकिन गलती से इंसान का चेहरा ही मिटा देते।

हाल ही में, एक नए प्रकार के "सुपर-इंटेलिजेंट" कंप्यूटर मॉडल (एक विशाल, सर्वज्ञ कलाकार की तरह) का उदय हुआ। ये मॉडल फोटो ठीक करने में अद्भुत हैं, लेकिन ये "क्लोज्ड-सोर्स लग्जरी कारों" की तरह हैं: केवल कुछ बड़ी कंपनियों के पास ही इनका स्वामित्व है, इन्हें चलाने में बहुत भारी खर्च आता है, और कोई नहीं जानता कि इनके अंदर असल में क्या चल रहा है।

RealRestorer वह प्रोजेक्ट है जो कहता है: "आइए हम अपना खुद का ओपन-सोर्स सुपर-कार बनाएं जो उन लग्जरी कारों की तरह ही अच्छी तरह चले, लेकिन इसे कोई भी चला सके।"

यहाँ उन्होंने इसे कैसे किया है, रोज़मर्रा के उदाहरणों के साथ समझाया गया है:

1. समस्या: "सिंथेटिक" बनाम "असली" का अंतर

कल्पना कीजिए कि आप गाड़ी चलाना सीख रहे हैं।

  • पुरानी विधि: आपने एक वीडियो गेम सिम्युलेटर में अभ्यास किया। गेम ने बारिश को नीली रेखाओं के रूप में दिखाया और कोहरे को ग्रे कोहरे के रूप में दिखाया। आप "गेम वाली बारिश" को ठीक करने में बहुत कुशल हो गए, लेकिन जब आप वास्तविक सड़क पर गए जहाँ असली गीली, फिसलन भरी डामर और असली कोहरा था, तो आपका एक्सीडेंट हो गया।
  • मुद्दा: अधिकांश AI फोटो फिक्सर्स "सिम्युलेटेड" (बनावटी) नुकसान पर प्रशिक्षित थे। उन्हें यह नहीं पता था कि वास्तविक दुनिया की गंदगी, अजीब रोशनी, या जटिल खरोंचें वास्तव में कैसी दिखती हैं।

2. समाधान: एक नया ट्रेनिंग पाइपलाइन

लेखकों ने एक विशाल, वास्तविक प्रशिक्षण मैदान बनाया। केवल एक वीडियो गेम सिम्युलेटर का उपयोग करने के बजाय, उन्होंने एक "डिजिटल फोटो लैब" बनाया जो वास्तविक दुनिया की सटीक नकल करता है।

  • "सिंथेटिक" हिस्सा: उन्होंने लाखों नकली क्षतिग्रस्त फोटो बनाने के लिए उन्नत AI का उपयोग किया। लेकिन उन्होंने केवल साधारण धुंधलापन नहीं बनाया; उन्होंने जटिल नियमों का उपयोग किया ताकि बारिश असली बारिश जैसी दिखे और धुंधलापन हाथ के हिलने जैसा लगे।
  • "असली" हिस्सा: उन्होंने इंटरनेट से वास्तविक क्षतिग्रस्त फोटो भी खोज निकालीं जो असली लोगों द्वारा ली गई थीं। उन्होंने एक स्मार्ट AI सहायक (एक "क्वालिटी कंट्रोल इंस्पेक्टर") का उपयोग किया जिसने इन फोटो की जांच की और उन्हें उसी फोटो के एक "परफेक्ट" वर्जन के साथ जोड़ा।
  • परिणाम: उन्होंने 9 प्रकार के नुकसान (धुंधलापन, बारिश, शोर, कम रोशनी, आदि) को कवर करने वाले 1.6 मिलियन से अधिक फोटो जोड़ों का एक डेटासेट तैयार किया।

3. प्रशिक्षण रणनीति: "दो-चरणों वाला आहार" (Two-Stage Diet)

एक विशाल AI मॉडल को प्रशिक्षित करना एक एथलीट को प्रशिक्षित करने जैसा है। आप उन्हें सीधे ओलंपिक में नहीं झोंक सकते। लेखकों ने एक चतुर दो-चरणीय आहार का उपयोग किया:

  • चरण 1: "सामान्य ज्ञान" का चरण (ट्रांसफर ट्रेनिंग)
    उन्होंने एक ऐसे मॉडल से शुरुआत की जो पहले से ही इमेज एडिटिंग (जैसे आसमान बदलना या बिल्ली जोड़ना) में अच्छा था। उन्होंने पहले इस मॉडल को "सिम्युलेटेड" नुकसान को ठीक करना सिखाया। इसने मॉडल को एक व्यापक समझ दी कि "खराब" क्या दिखता है।

    • उपमा: यह सिम्युलेटर में ड्राइविंग के नियम सीखने जैसा है। आप सीखते हैं कि कार कैसे प्रतिक्रिया करती है, लेकिन आपने अभी तक असली हवा या बारिश को महसूस नहीं किया है।
  • चरण 2: "वास्तविक दुनिया" का चरण (सुपरवाइज्ड फाइन-ट्यूनिंग)
    फिर, वे असली, बिखरी हुई इंटरनेट फोटो पर आ गए। उन्होंने मॉडल को वास्तविक नुकसान को ठीक करना सिखाया। महत्वपूर्ण बात यह है कि उन्होंने सिम्युलेटेड डेटा को पूरी तरह से फेंका नहीं। उन्होंने सिम्युलेटर के डेटा को वास्तविक दुनिया के डेटा के साथ थोड़ा मिला दिया।

    • उपमा: यह वास्तविक सड़क पर ड्राइविंग लेसन लेने जैसा है, लेकिन एक सुरक्षा जाल (सिम्युलेटर डेटा) को बनाए रखते हुए ताकि आप बुनियादी नियम न भूल जाएं। यदि आप केवल वास्तविक सड़कों पर चलते, तो शायद आप विशिष्ट गड्ढों के इतने आदी हो जाते कि एक चिकनी हाईवे को संभालना भूल जाते।

4. नया टेस्ट: RealIR-Bench

आपको कैसे पता चलेगा कि फोटो फिक्सर वास्तव में अच्छा है?

  • पुराने टेस्ट: वे गणितीय सूत्रों का उपयोग करते थे जो ठीक की गई फोटो की तुलना "परफेक्ट" मूल से करते थे। लेकिन वास्तविक दुनिया में, आपके पास अक्सर "परफेक्ट" मूल नहीं होता है। यह किसी छात्र के निबंध को उत्तर कुंजी (answer key) के बिना ग्रेड करने की कोशिश करने जैसा है।
  • नया टेस्ट (RealIR-Bench): लेखकों ने 46able वास्तविक, क्षतिग्रस्त फोटो का उपयोग करके एक टेस्ट बनाया जहाँ किसी के पास भी परफेक्ट उत्तर कुंजी नहीं है।
  • ग्रेडर: गणितीय सूत्र के बजाय, उन्होंने एक सुपर-स्मार्ट AI (एक विजन-लैंग्वेज मॉडल) का उपयोग किया जो एक मानव जज के रूप में कार्य करता है। यह AI "पहले" और "बाद" को देखता है और पूछता है: "क्या बारिश चली गई? क्या चेहरा अजीब लग रहा है? क्या यह प्राकृतिक लग रहा है?"
    • उपमा: छात्र के उत्तर को कुंजी से मिलाने के बजाय, आप एक मानव शिक्षक को निबंध पढ़ने के लिए नियुक्त करते हैं और वे कहते हैं, "हाँ, यह बहुत बेहतर है, और उन्होंने मुख्य पात्र का नाम नहीं बदला है।"

5. परिणाम: अंडरडॉग की जीत

जब उन्होंने RealRestorer का परीक्षण बड़े, क्लोज्ड-सोर्स "लग्जरी कारों" (जैसे Nano Banana Pro और GPT-Image-1.5) के खिलाफ किया:

  • इसने महंगे, क्लोज्ड मॉडल्स के समान प्रदर्शन किया।
  • यह उपलब्ध सर्वश्रेष्ठ ओपन-सोर्स मॉडल था।
  • यह 9 प्रकार के नुकसान को ठीक कर सकता था और यहाँ तक कि उन चीजों को भी संभाल सकता था जिनके लिए इसे स्पष्ट रूप से प्रशिक्षित नहीं किया गया था (जैसे बर्फ या पुरानी फोटो), क्योंकि इसने केवल विशिष्ट नियमों को नहीं, बल्कि "ठीक करने" के कॉन्सेप्ट को सीखा था।

सारांश

RealRestorer एक बड़ी उपलब्धि है क्योंकि यह साबित करता है कि वास्तविक दुनिया की फोटो ठीक करने के लिए आपको अरबों डॉलर के बजट की आवश्यकता नहीं है। एक स्मार्ट प्रशिक्षण मैदान (नकली और असली डेटा को मिलाकर) और परिणामों को परखने का एक बेहतर तरीका (गणितीय सूत्रों के बजाय AI जजों का उपयोग करके) बनाकर, उन्होंने एक ओपन-सोर्स टूल बनाया है जो वास्तविक दुनिया की बिखरी हुई फोटो को साफ करने के लिए तैयार है।

यह एक मास्टर शेफ की गुप्त रेसिपी को समझने, यह जानने के की इसे उन सामग्रियों के साथ कैसे पकाया जाए जिन्हें कोई भी खरीद सकता है, और यह साबित करने जैसा है कि बनने वाला व्यंजन उस शानदार रेस्टोरेंट के व्यंजन जितना ही स्वादिष्ट है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →