← नवीनतम पेपर
💻 computer science

NTIRE 2026 Challenge on Single Image Reflection Removal in the Wild: Datasets, Results, and Methods

यह शोध पत्र वास्तविक दुनिया में सिंगल-इमेज रिफ्लेक्शन रिमूवल पर NTIRE 2026 चुनौती की समीक्षा करता है, जिसमें वास्तविक-दुनिया के OpenRR-5k डेटासेट की प्रस्तुति, 100 से अधिक टीमों की भागीदारी और शीर्ष-रैंक वाले तरीकों द्वारा प्राप्त अत्याधुनिक प्रदर्शन पर प्रकाश डाला गया है।

मूल लेखक: Jie Cai, Kangning Yang, Zhiyuan Li, Florin-Alexandru Vasluianu, Radu Timofte, Jinlong Li, Jinglin Shen, Zibo Meng, Junyan Cao, Lu Zhao, Pengwei Liu, Yuyi Zhang, Fengjun Guo, Jiagao Hu, Zepeng Wang, Fe
प्रकाशित 2026-04-15
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jie Cai, Kangning Yang, Zhiyuan Li, Florin-Alexandru Vasluianu, Radu Timofte, Jinlong Li, Jinglin Shen, Zibo Meng, Junyan Cao, Lu Zhao, Pengwei Liu, Yuyi Zhang, Fengjun Guo, Jiagao Hu, Zepeng Wang, Fei Wang, Daiguo Zhou, Yi'ang Chen, Honghui Zhu, Mengru Yang, Yan Luo, Kui Jiang, Jin Guo, Jonghyuk Park, Jae-Young Sim, Wei Zhou, Hongyu Huang, Linfeng Li, Lindong Kong, Saiprasad Meesiyawar, Misbha Falak Khanpagadi, Nikhil Akalwadi, Ramesh Ashok Tabib, Uma Mudenagudi, Bilel Benjdira, Anas M. Ali, Wadii Boulila, Kosuke Shigematsu, Hiroto Shirono, Asuka Shin, Guoyi Xu, Yaoxin Jiang, Jiajia Liu, Yaokun Shi, Jiachen Tu, Shreeniketh Joshi, Jin-Hui Jiang, Yu-Fan Lin, Yu-Jou Hsiao, Chia-Ming Lee, Fu-En Yang, Yu-Chiang Frank Wang, Chih-Chung Hsu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक संग्रहालय के भीतर एक पेंटिंग की एक सुंदर फोटो खींचने की कोशिश कर रहे हैं। लेकिन एक समस्या है: आपको एक मोटे कांच के केस के माध्यम से फोटो खींचनी है। कांच कमरे की रोशनी और आपके अपने चेहरे को परावर्तित (reflect) करता है, जिससे पेंटिंग के ऊपर एक अस्त-व्यस्त "भूतिया" छवि (ghost image) बन जाती है। आपका लक्ष्य उन प्रतिबिंबों (reflections) को जादुई रूप से मिटाना और पेंटिंग को फिर से स्पष्ट रूप से देखना है।

यह बिल्कुल वही है जो NTIRE 2026 चैलेंज के बारे में था। यह एक उच्च-स्तरीय प्रतियोगिता थी जहाँ दुनिया के सबसे स्मार्ट कंप्यूटर वैज्ञानिकों और इंजीनियरों ने कंप्यूटर को एक ही फोटो पर यह "जादुई इरेज़र" वाला करतब दिखाने के लिए प्रशिक्षित करने की कोशिश की।

यहाँ इस पेपर का सरल शब्दों में विवरण दिया गया है:

1. समस्या: मशीन में "भूत" (The "Ghost" in the Machine)

वर्षों से, कंप्यूटर प्रतिबिंब हटाने में बेहतर होते जा रहे हैं, लेकिन वे ज्यादातर नकली, कंप्यूटर-जनित छवियों पर अभ्यास करते आए हैं। यह एक पायलट की तरह है जो केवल एक फ्लाइट सिम्युलेटर में प्रशिक्षण लेता है; वे नियंत्रणों में बहुत अच्छे हो सकते हैं, लेकिन वे वास्तविक उथल-पुथल (turbulence) में टकराकर दुर्घटनाग्रस्त हो सकते हैं।

आयोजकों ने महसूस किया कि वास्तविक दुनिया की तस्वीरें बहुत जटिल होती हैं। प्रतिबिंब केवल साधारण रेखाएँ नहीं हैं; वे जटिल, एक-दूसरे के ऊपर चढ़े हुए और चमक में भिन्न होते हैं। उन्हें एक तरीका चाहिए था जिससे यह परीक्षण किया जा सके कि क्या ये AI मॉडल वास्तव में वास्तविक दुनिया में काम कर सकते हैं, न कि केवल एक लैब में।

2. नया खेल का मैदान: OpenRR-5k

इसे ठीक करने के लिए, आयोजकों ने (OPPO और विश्वविद्यालयों के विशेषज्ञों के नेतृत्व में) OpenRR-5k नामक एक नया, विशाल प्रशिक्षण मैदान बनाया।

  • उन्होंने डेटा कैसे प्राप्त किया: लोगों से पेंटिंग्स की फोटो लेने और फिर मैन्युअल रूप से कांच हटाने के लिए कहने के बजाय (जो पूरी तरह से करना असंभव है), उन्होंने एक चतुर तकनीक का उपयोग किया। उन्होंने प्रतिबिंबों वाली वास्तविक दृश्यों की तस्वीरें लीं, फिर एक बहुत ही स्मार्ट AI टूल (जो OPPO फोन में बना हुआ है) का उपयोग किया ताकि यह "अनुमान" लगाया जा सके कि साफ छवि कैसी दिखती होगी। फिर मानव विशेषज्ञों ने डिजिटल आर्ट रिस्टोरर की तरह, गलतियों को ठीक करने और "साफ" संस्करण को पूर्ण बनाने के लिए फोटोशॉप जैसे उपकरणों का उपयोग करके इसे सुधारा।
  • परिणाम: 5,000 फोटो जोड़ों की एक लाइब्रेरी: एक जिसमें अस्त-व्यस्त प्रतिबिंब है, और एक पूर्ण "साफ" संस्करण। यह प्रतियोगिता के लिए स्वर्ण मानक (gold standard) बन गया।

3. प्रतियोगिता: महान प्रतिबिंब दौड़ (The Great Reflection Race)

100 से अधिक टीमों ने साइन अप किया, लेकिन केवल 11 ही अंतिम दौर तक पहुँच पाईं। उन्हें अस्त-व्यस्त तस्वीरें दी गईं और उन्हें अपने AI मॉडल का उपयोग करके उनके साफ संस्करण तैयार करने थे।

इसे एक कुकिंग कॉम्पिटिशन की तरह समझें। सभी को एक ही "गंदे" सामग्रियां (प्रतिबिंब वाली फोटो) दी गईं और उन्हें सबसे अच्छा "साफ" व्यंजन (पुनर्स्थापित छवि) बनाना था। जजों ने केवल भोजन को मापने के लिए स्केल का उपयोग नहीं किया; उन्होंने वास्तव में इसे चखा (विषयगत मूल्यांकन/subjective evaluation) ताकि यह देखा जा सके कि यह कैसा दिखता है और स्वाभाविक लगता है या नहीं।

4. विजेता और उनके गुप्त नुस्खे (The Winners and Their Secret Recipes)

शीर्ष टीमों ने केवल अनुमान नहीं लगाया; उन्होंने परिष्कृत "नुस्खों" (एल्गोरिदम) का उपयोग किया। यहाँ विजेता और उनकी खासियतें दी गई हैं:

  • प्रथम स्थान: RRay (दो-चरणीय शेफ)

    • रणनीति: उन्होंने महसूस किया कि प्रतिबिंब को हटाने और विवरणों को ठीक करने की कोशिश एक साथ करना बहुत कठिन है। इसलिए, उन्होंने एक दो-चरणीय मशीन बनाई। पहले, एक "रफ ड्राफ्ट" AI बड़े और स्पष्ट प्रतिबिंबों को हटाता है। फिर, एक दूसरा, बारीक-ट्यून किया गया AI विवरणों को पॉलिश करने और धुंधलेपन को ठीक करने के लिए आता है।
    • उपमा: यह लकड़ी को सैंडपेपर (रेगमाल) से घिसने जैसा है। आप बड़े उभारों को हटाने के लिए मोटे रेगमाल से शुरू करते हैं, फिर उसे चिकना बनाने के लिए महीन रेगमाल पर स्विच करते हैं।
  • द्वितीय स्थान: X reflect Master (विशाल मस्तिष्क)

    • रणनीति: उन्होंने एक शक्तिशाली मौजूदा मॉडल लिया और उसे "बड़ा" बनाया (एक बड़े न्यूरल नेटवर्क बैकबोन का उपयोग करके)। उन्होंने "डिफ्यूजन डिस्टिलेशन" नामक तकनीक का भी उपयोग किया।
    • उपमा: कल्पना कीजिए कि एक छात्र (AI) एक जीनियस प्रोफेसर (एक विशाल डिफ्यूजन मॉडल) से सीख रहा है। छात्र केवल उत्तरों की नकल नहीं करता है; वह कठिन और अजीब प्रतिबिंबों को संभालने के लिए प्रोफेसर की अंतर्दृष्टि (intuition) को सीखता है, जिन्हें छात्र ने पहले कभी नहीं देखा है।
  • तृतीय स्थान: AIIALab (बहु-चरणीय रिफाइनर)

    • रणनीति: उन्होंने तीन-चरणीय प्रक्रिया का उपयोग किया। पहले, उन्होंने बुनियादी बातें सीखीं। दूसरे, उन्होंने "एडवर्सरियल" ट्रेनिंग का उपयोग किया (जहाँ AI एक आलोचक के खिलाफ खेल खेलता है ताकि छवि अधिक वास्तविक दिखे)। तीसरे, उन्होंने यह जांचने के लिए "डेप्थ स्कोर" का उपयोग किया कि क्या छवि भौतिक रूप से सही है।
    • उपमा: यह एक लेखक की तरह है जो एक ड्राफ्ट लिखता है, फिर व्याकरण को ठीक करने के लिए एक संपादक को काम पर रखता है, और अंत में यह सुनिश्चित करने के लिए एक तथ्य-जांचकर्ता (fact-checker) को काम पर रखता है कि कहानी तर्कसंगत है।

5. परिणाम: हमने क्या सीखा?

प्रतियोगिता ने दिखाया कि:

  1. AI डरावना रूप से कुशल होता जा रहा है: शीर्ष टीमों ने ऐसी छवियां तैयार कीं जो वास्तविक चीज़ के लगभग समान थीं।
  2. संख्याएं सब कुछ नहीं हैं: कभी-कभी, एक कंप्यूटर स्कोर (जैसे PSNR) कहता था कि एक छवि "अच्छी" है, लेकिन मानव जजों को लगा कि यह अजीब या धुंधली दिख रही है। यह साबित करता है कि वास्तविक दुनिया के उपयोग के लिए, हमें AI को केवल गणितीय समीकरणों के लिए नहीं, बल्कि मानव आंखों को खुश करने के लिए प्रशिक्षित करने की आवश्यकता है।
  3. अंतर कम हो रहा है: विजेताओं द्वारा उपयोग की जाने वाली विधियों का अब वास्तविक फोन और ऐप्स में उपयोग किया जा रहा है ताकि लोगों को खिड़कियों के माध्यम से बेहतर फोटो लेने में मदद मिल सके।

निष्कर्ष

यह पेपर केवल गणित के सूत्रों की सूची नहीं है; यह इस बात की कहानी है कि कैसे AI समुदाय "सैद्धांतिक पूर्णता" से "वास्तविक दुनिया के जादू" की ओर बढ़ रहा है। एक कठिन, वास्तविक परीक्षण (OpenRR-5k) बनाकर और सर्वश्रेष्ठ दिमागों को एक साथ लाकर, उन्होंने तकनीक को आगे बढ़ाया है। अब, जब आप किसी दुकान की खिड़की या संग्रहालय की प्रदर्शनी की फोटो लेते हैं, तो आपके फोन में शायद तुरंत प्रतिबिंब को मिटाने और कांच के पीछे की वास्तविक सुंदरता दिखाने की क्षमता होगी।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →