← नवीनतम पेपर
💻 computer science

NTIRE 2026 The 3rd Restore Any Image Model (RAIM) Challenge: Multi-Exposure Image Fusion in Dynamic Scenes (Track 2)

यह शोध पत्र NTIRE 2026 3rd रिस्टोर एनी इमेज मॉडल (RAIM) चुनौती का परिचय देता है, जिसने गतिशील दृश्यों में घोस्टिंग और मिसअलाइनमेंट जैसे आर्टिफैक्ट्स को संबोधित करने के लिए मल्टी-एक्सपोज़र इमेज फ्यूजन हेतु एक बेंचमार्क स्थापित किया है, जिसने HDR इमेजिंग क्षमताओं को आगे बढ़ाने के लिए 114 टीमों और 987 सबमिशन को आकर्षित किया है।

मूल लेखक: Lishen Qu, Yao Liu, Jie Liang, Hui Zeng, Wen Dai, Guanyi Qin, Ya-nan Guan, Shihao Zhou, Jufeng Yang, Lei Zhang, Radu Timofte, Xiyuan Yuan, Wanjie Sun, Shihang Li, Bo Zhang, Bin Chen, Jiannan Lin, Yuxu
प्रकाशित 2026-04-13
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Lishen Qu, Yao Liu, Jie Liang, Hui Zeng, Wen Dai, Guanyi Qin, Ya-nan Guan, Shihao Zhou, Jufeng Yang, Lei Zhang, Radu Timofte, Xiyuan Yuan, Wanjie Sun, Shihang Li, Bo Zhang, Bin Chen, Jiannan Lin, Yuxu Chen, Qinquan Gao, Tong Tong, Song Gao, Jiacong Tang, Tao Hu, Xiaowen Ma, Qingsen Yan, Sunhan Xu, Juan Wang, Xinyu Sun, Lei Qi, He Xu, Jiachen Tu, Guoyi Xu, Yaoxin Jiang, Jiajia Liu, Yaokun Shi

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप सूर्यास्त के समय एक व्यस्त सड़क के दृश्य की एक आदर्श फोटो खींचने की कोशिश कर रहे हैं। आपके पास एक ऐसा कैमरा है जो एक बार में सब कुछ कैप्चर नहीं कर सकता: चमकता हुआ आसमान बहुत सफेद है (ब्लोन आउट/blown out), और अंधेरी गलियां बहुत काली हैं (क्रश्ड/crushed)।

इसे हल करने के लिए, आप तेजी से तीन या पांच फोटो लेते हैं:

  1. एक फोटो बहुत उज्ज्वल है (छाया/शैडो देखने के लिए)।
  2. एक फोटो बहुत गहरी/डार्क है (आसमान देखने के लिए)।
  3. एक बीच की स्थिति वाली है।

समस्या: दुनिया कोई पेंटिंग नहीं है; यह जीवित है। जब आप ये फोटो ले रहे थे, तभी एक कार वहां से गुजरी, एक व्यक्ति पास से गुजरा, या आपका हाथ थोड़ा हिल गया। यदि आप इन फोटो को बस एक के ऊपर एक रख देते हैं, तो आपको एक गड़बड़ "घोस्ट" (ghost) इमेज मिलेगी जहाँ व्यक्ति के तीन हाथ दिखाई देंगे, या कार सड़क पर फैली हुई सी लगेगी।

चुनौती (NTIRE 2026 RAIM ट्रैक 2): यह पेपर बताता है कि कैसे 114 टीमों के AI शोधकर्ताओं ने एक परम "डिजिटल फोटो एडिटर" बनाने की कोशिश की। उनका लक्ष्य था: उन अव्यवस्थित, गलत संरेखित (misaligned), मल्टी-एक्सपोज़र फोटो को लेकर उन्हें एक ही "परफेक्ट, क्रिस्टल-क्लियर" इमेज में बदलना, जो बिल्कुल वैसी दिखे जैसे किसी सुपर-कैमरे से ली गई हो, भले ही दृश्य हिल रहा हो या बदल रहा हो।

यहाँ इस प्रतियोगिता का विवरण सरल उपमाओं (analogies) के माध्यम से दिया गया है:

1. प्रशिक्षण का मैदान (द डेटासेट)

आयोजकों ने टीमों को केवल कुछ आसान तस्वीरें नहीं दीं। उन्होंने AI के लिए एक जिम बनाया।

  • वर्कआउट: उन्होंने 100 "प्रशिक्षण अनुक्रम" (अभ्यास ड्रिल की तरह) प्रदान किए जहाँ AI को चलती कारों, टिमटिमाती रोशनी और हिलते हाथों को संभालने के लिए सीखना था।
  • परीक्षा: फिर, उन्होंने उन्हें 100 "परीक्षण अनुक्रम" दिए जिनमें काम करने के लिए कम फोटो (7 के बजाय 5) थे, जिससे काम और कठिन हो गया। यह एक शेफ से एक शानदार भोजन बनाने के लिए कहने जैसा है, जबकि उन्होंने अभ्यास के दौरान कम सामग्री के साथ काम किया था।

2. खेल के नियम (मूल्यांकन)

आप कैसे तय करेंगे कि AI ने अच्छा काम किया या नहीं?

  • स्कोरकार्ड: उन्होंने गणित और मानवीय भावना का मिश्रण उपयोग किया।
    • PSNR/SSIM: ये "पिक्सेल-परफेक्ट" पैमाने की तरह हैं। वे जांचते हैं कि क्या AI की इमेज सटीक रूप से "परफेक्ट" उत्तर से मेल खाती है।
    • LPIPS: यह "मानवीय आंख" का परीक्षण है। यह जांचता है कि क्या इमेज प्राकृतिक दिखती है या वह अजीब और प्लास्टिक जैसी लगती है।
  • अंतिम निर्णय: विजेता केवल वह नहीं था जिसका गणितीय स्कोर सबसे अधिक था; उन्हें यह भी साबित करना था कि उनका कोड वास्तव में काम करता है और वह धोखाधड़ी नहीं कर रहा है।

3. जीतने वाली रणनीतियाँ (टीमें)

टीमों को एक ही रेसिपी समस्या को हल करने की कोशिश कर रहे विभिन्न प्रकार के शेफ के रूप में सोचें। यहाँ कुछ शीर्ष दावेदार और उनके "गुप्त नुस्खे" दिए गए हैं:

  • WHU-VIP (स्मार्ट एडिटर):

    • उपमा: कल्पना कीजिए कि एक फोटो एडिटर यह तय करता है, "मुझे सभी 7 फोटो की आवश्यकता नहीं है; बीच वाली फोटो और दो सबसे चमकीली/सबसे डार्क फोटो पर्याप्त हैं।"
    • ट्रिक: उन्होंने एक ऐसा सिस्टम बनाया जो फोटो के "शोर वाले" (noisy) हिस्सों को अनदेखा कर देता है। यदि एक कार ने चलते हुए एक 'घोस्ट' बना दिया, तो उनके AI के पास एक "विश्वसनीयता गेट" (reliability gate) है जो कहता है, "इस पिक्सेल को अनदेखा करो, यह एक घोस्ट है," और इसे दूसरे फोटो से सही विवरण के साथ भर देता है। उन्होंने "करिकुलम लर्निंग" रणनीति का भी उपयोग किया, यानी AI को पहले आसान दृश्य सिखाना, फिर कठिन, ठीक वैसे ही जैसे एक शिक्षक करता है।
  • SHL (बड़ी तस्वीर का मार्गदर्शक):

    • उपमा: कल्पना कीजिए कि आप आंखों पर पट्टी बांधकर एक नक्शे पर सूक्ष्म विवरण बनाने की कोशिश कर रहे हैं। SHL ने AI को पूरे दृश्य का एक "बर्ड्स-आई व्यू" (एक छोटा वर्जन) दिया ताकि वह संदर्भ (context) को समझ सके।
    • ट्रिक: उन्होंने एक "नेबरिंग पिक्सेल रिलेशनशिप" लॉस जोड़ा। इसे एक सख्त नियम के रूप में सोचें: "यदि किसी इमारत का किनारा सीधा है, तो उसे आउटपुट में भी सीधा ही रहना चाहिए।" इसने AI को किनारों को धुंधला होने से बचाया।
  • nunucccb (ट्रांसफॉर्मर डिटेक्टिव):

    • उपमा: इस टीम ने एक "विज़न ट्रांसफॉर्मर" का उपयोग किया, जो एक जासूस की तरह है जो एक छोटे से वर्ग को देखने के बजाय, पूरे चित्र को एक साथ देखता है ताकि संबंधों को समझ सके।
    • ट्रिक: उन्होंने एक "स्पेशियल अटेंशन" (Spatial Attention) तंत्र का उपयोग किया। यह एक स्पॉटलाइट की तरह है जो केवल उन हिस्सों पर चमकता है जो हिल रहे हैं, और AI को बताता है, "यहाँ विशेष ध्यान दें ताकि मिसअलाइनमेंट को ठीक किया जा सके।"
  • I2 Group & Transsion (वेवलेट वीवर):

    • उपमा: कल्पना कीजिए कि आप एक फोटो ले रहे हैं और उसे "स्ट्रक्चर" (चीजों का आकार) और "टेक्सचर" (बाल या ईंट जैसे बारीक विवरण) में अलग कर रहे हैं।
    • ट्रिक: उन्होंने फोटो को विभाजित करने के लिए "वेवलेट ट्रांसफॉर्म" नामक एक गणितीय उपकरण का उपयोग किया। उन्होंने एक शाखा में "स्ट्रक्चर" को ठीक किया और दूसरी में "टेक्सचर" को, और फिर उन्हें वापस जोड़ दिया। इसने उस "घोस्टिंग" को रोका जो आमतौर पर दोनों को एक साथ ठीक करने की कोशिश में होती है।

4. परिणाम

विजेता, WHU-VIP, न केवल उच्चतम गणितीय स्कोर प्राप्त करने में सफल रहा; उन्होंने पूर्ण संतुलन खोजा। उन्होंने अन्य सभी की तुलना में "घोस्ट्स" (चलते हुए लोगों की धुंधली दोहरी छवियां) को बेहतर तरीके से हटाया और बारीक विवरणों को भी स्पष्ट रखा।

यह क्यों मायने रखता है?
यह केवल एक प्रतियोगिता जीतने के बारे में नहीं है। यह तकनीक वह है जो आपके स्मार्टफोन कैमरे को काम करने में मदद करती है। जब आप कम रोशनी में या किसी चलते हुए पालतू जानवर की फोटो लेते हैं, तो आपका फोन गुप्त रूप से इसी "मल्टी-एक्सपोज़र फ्यूजन" जादू का उपयोग करके आपको एक स्पष्ट, उज्ज्वल और शार्प तस्वीर देता है। यह चुनौती इंजीनियरों को भविष्य के बेहतर कैमरे बनाने में मदद करती है।

संक्षेप में: 114 टीमों ने AI को एक मास्टर फोटो एडिटर बनने के लिए प्रशिक्षित किया, जिससे उन्होंने हिलती हुई, चलती हुई और खराब रोशनी वाली फोटो को एक परफेक्ट शॉट में बदलना सीखा। विजेता ने साबित कर दिया कि सबसे अच्छा AI केवल नंबरों को प्रोसेस नहीं करता; वह इमेज की "कहानी" को समझता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →