← नवीनतम पेपर
🤖 AI

SIRR-LMM: Single-image Reflection Removal via Large Multimodal Model

यह शोध पत्र SIRR-LMM प्रस्तुत करता है, जो एक अत्याधुनिक सिंगल-इमेज रिफ्लेक्शन रिमूवल और सेपरेशन प्रदर्शन प्राप्त करने के लिए एक भौतिक रूप से सटीक सिंथेटिक डेटासेट जनरेशन फ्रेमवर्क को एक फाइन-ट्यून्ड लार्ज मल्टीमॉडल मॉडल के साथ जोड़ता है।

मूल लेखक: Yu Guo, Zhiqiang Lao, Xiyun Song, Yubin Zhou, Heather Yu

प्रकाशित 2026-02-06
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yu Guo, Zhiqiang Lao, Xiyun Song, Yubin Zhou, Heather Yu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "SIRR-LMM" पेपर का सरल भाषा और रचनात्मक उपमाओं (analogies) का उपयोग करके किया गया स्पष्टीकरण है।

समस्या: खिड़की में दिखने वाला "भूत" (Ghost)

कल्पना कीजिए कि आप संग्रहालय के अंदर टंगी एक सुंदर पेंटिंग की फोटो खींचने की कोशिश कर रहे हैं, लेकिन उसके सामने लगे कांच के केस में आपके पीछे के लोगों और रोशनी का प्रतिबिंब (reflection) दिख रहा है। कैमरा एक अस्त-व्यस्त मिश्रण देखता है: पेंटिंग (जो आप चाहते हैं) और प्रतिबिंब (जो आप नहीं चाहते)।

कंप्यूटर विज़न की दुनिया में, इसे सिंगल-इमेज रिफ्लेक्शन रिमूवल (SIRR) कहा जाता है। यह एक कठिन पहेली है क्योंकि कैमरे के पास केवल एक ही तस्वीर होती है। यह बिल्कुल वैसा ही है जैसे दो अलग-अलग गानों को एक ही समय में एक ही माइक्रोफ़ोन द्वारा रिकॉर्ड किए गए होने पर उन्हें अलग करने की कोशिश करना।

लंबे समय तक, कंप्यूटर इसमें संघर्ष करते रहे क्योंकि:

  1. असली डेटा मिलना कठिन है: कंप्यूटर को इसे ठीक करना सिखाने के लिए, आपको "उत्तर कुंजियों" (answer keys) की आवश्यकता होती है (ऐसी तस्वीरें जो प्रतिबिंब के बिना पेंटिंग दिखाती हों और पेंटिंग के बिना प्रतिबिंब दिखाती हों)। वास्तविक दुनिया में कांच या पेंटिंग को हिलाए बिना ऐसी तस्वीरें लेना लगभग असंभव है।
  2. नकली डेटा बहुत ही नकली है: पिछले प्रयासों ने दो तस्वीरों को एक के ऊपर एक रखकर "नकली" प्रशिक्षण डेटा बनाया। लेकिन असली कांच केवल एक छवि के ऊपर नहीं बैठता; यह प्रकाश को मोड़ता है, धुंधले "घोस्ट" चित्र बनाता है, और कोण के आधार पर रंगों को बदल देता है। साधारण लेयरिंग इस भौतिकी (physics) को नहीं समझ पाती।

समाधान: एक "फिजिक्स-परफेक्ट" सिम्युलेटर

लेखकों ने प्रशिक्षण डेटा बनाने का एक नया तरीका बनाया है जो एक अति-सटीक वीडियो गेम सिम्युलेटर की तरह काम करता है।

केवल तस्वीरों को एक के ऊपर एक रखने के बजाय, उन्होंने पाथ ट्रेसिंग (path tracing) नामक तकनीक का उपयोग किया। कल्पना कीजिए कि प्रकाश की किरण एक छोटी बिलियर्ड बॉल की तरह है। सिम्युलेटर इन लाखों "प्रकाश गेंदों" को एक कांच की खिड़की के 3D मॉडल पर मारता है।

  • कुछ गेंदें कांच से टकराकर वापस आती हैं (जो प्रतिबिंब बनाती हैं)।
  • कुछ गेंदें कांच के पार निकल जाती हैं (जो पेंटिंग का दृश्य बनाती हैं)।
  • कुछ गेंदें कांच के अंदर ही टकराती रहती हैं और फिर बाहर निकलती हैं (जो उन धुंधले, दोहरे "घोस्ट" चित्रों को बनाती हैं)।

उन्होंने इन भौतिक सिमुलेशन को दुनिया की वास्तविक तस्वीरों के साथ जोड़ा। परिणाम स्वरूप, एक ऐसा डेटासेट मिला जहाँ कंप्यूटर सीखता है कि वास्तविक जीवन में प्रकाश वास्तव में कैसे व्यवहार करता है, जिसमें कठिन ओवरएक्सपोज़्ड ब्राइट स्पॉट्स या धुंधले प्रतिबिंब भी शामिल हैं।

मस्तिष्क: एक "बहुभाषी" कलाकार को सिखाना

उनकी खोज का दूसरा हिस्सा यह है कि वे कंप्यूटर को इस पहेली को हल करना कैसे सिखाते हैं। उन्होंने शून्य से एक नया कंप्यूटर नहीं बनाया; इसके बजाय, उन्होंने एक लार्ज मल्टीमॉडल मॉडल (LMM) का उपयोग किया।

एक LMM को एक ऐसे सुपर-आर्टिस्ट की तरह समझें जिसने अरबों तस्वीरें देखी हैं और उन्हें शब्दों में वर्णित कर सकता है। वह कलाकार पहले से ही जानता है कि कांच कैसा दिखता है क्योंकि उसने खिड़कियों की कई तस्वीरें देखी हैं।

लेखकों ने इस कलाकार को एक विशिष्ट कार्य सिखाने के लिए एक चतुर तकनीक का उपयोग किया:

  1. "सैंडविच" विधि: कलाकार को केवल एक अस्त-व्यस्त फोटो दिखाने के बजाय, उन्होंने मॉडल को एक "सैंडविच" इमेज खिलाई। उन्होंने एक ही विशाल छवि में अस्त-व्यस्त फोटो, साफ पेंटिंग और प्रतिबिंब को अगल-बगल चिपका दिया।
  2. गुप्त नुस्खा (LoRA): उन्होंने पूरे विशाल कलाकार को फिर से प्रशिक्षित नहीं किया (जिसमें अनंत समय लगता और बहुत खर्च होता)। इसके बजाय, उन्होंने कलाकार के मस्तिष्क में एक छोटा, हल्का "अडैप्टर" (जिसे LoRA कहा जाता है) जोड़ा। इस अडैप्टर ने मॉडल को सिखाया: "जब तुम छवियों के इस विशिष्ट सैंडविच को देखो, तो उन्हें अलग करने के पैटर्न को सीखो।"

उन्होंने मॉडल को एक विशिष्ट "रेसिपी कार्ड" (टेक्स्ट प्रॉम्प्ट) भी दिया जिसने कार्य को समझाया: "यहाँ कांच वाली एक फोटो है, यहाँ इसके पार का दृश्य है, और यहाँ प्रतिबिंब है।" इस विशिष्ट रेसिपी पर प्रशिक्षण देकर, मॉडल ने बिना हर बार बताए, प्रतिबिंब हटाने के तर्क को सीख लिया।

परिणाम: साफ खिड़कियाँ, स्पष्ट प्रतिबिंब

जब उन्होंने इस नई विधि का मौजूदा सर्वोत्तम उपकरणों के विरुद्ध परीक्षण किया:

  • यह बेहतर देखता है: उन तस्वीरों में जहाँ प्रतिबिंब इतना चमकीला था कि उसने छवि को धुंधला कर दिया था (ओवरएक्सपोज़्ड), उनकी विधि ने गायब विवरणों को सही ढंग से "इनपेंट" (भरना) करने में सफलता पाई। उदाहरण के लिए, यदि प्रतिबिंब में एक लाल स्टैंड दिख रहा था, तो मॉडल ने प्रतिबिंब की परत में लाल रंग को बनाए रखने का निर्णय लिया, भले ही मुख्य छवि धुंधली हो गई हो।
  • यह बेहतर तरीके से अलग करता है: जहाँ अन्य विधियाँ अक्सर पीछे "घोस्ट" या धुंधले धब्बे छोड़ देती थीं, यह विधि कांच के पीछे की वस्तु का बहुत साफ दृश्य प्रदान करती है।
  • यह प्रतिबिंब को पुनः प्राप्त करता है: अधिकांश उपकरण केवल प्रतिबिंब को हटाने की कोशिश करते हैं। यह टूल प्रतिबिंब को एक अलग, स्पष्ट छवि के रूप में पुनर्गठित करता है। यह अनुमान लगा सकता है कि प्रतिबिंब कैसा दिखता है, यहाँ तक कि उन अंधेरे क्षेत्रों में भी जहाँ प्रतिबिंब मुश्किल से दिखाई दे रहा हो, अपनी प्रकाश संबंधी समझ का उपयोग करके।

सारांश

संक्षेप में, लेखकों ने "गंदी खिड़की" की समस्या को निम्न प्रकार से हल किया:

  1. एक भौतिकी-आधारित सिम्युलेटर बनाया ताकि सटीक प्रशिक्षण डेटा तैयार किया जा सके (ताकि कंप्यूटर केवल पैटर्न नहीं, बल्कि प्रकाश के नियमों को सीखे)।
  2. एक पूर्व-प्रशिक्षित "सुपर-आर्टिस्ट" AI का उपयोग किया और उसे एक छोटा, विशिष्ट अपग्रेड (LoRA) दिया ताकि वह "भूत" को "वास्तविक चीज़" से अलग करना सीख सके।

परिणामस्वरूप, एक ऐसा सिस्टम तैयार हुआ जो खिड़की की एक अकेली फोटो को देखकर उसे दो पूर्ण छवियों में जादू की तरह विभाजित कर सकता है: एक जो कांच के पीछे का दृश्य दिखाती है, और दूसरी जो उस पर क्या प्रतिबिंबित हो रहा है उसे स्पष्ट रूप से दिखाती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →