← नवीनतम पेपर
💻 computer science

SQCAFusion: Multi-Scale Scene-Query Cross-Attention for Illumination-Adaptive Infrared and Visible Image Fusion

यह शोध पत्र SQCAFusion का प्रस्ताव करता है, जो एक प्रकाश-अनुकूलित इन्फ्रारेड और दृश्य छवि संलयन ढांचा (framework) है जो प्रारंभिक एन्कोडिंग के दौरान विशेषताओं को गतिशील रूप से नियंत्रित करने के लिए सीखने योग्य दृश्य टोकन के साथ मल्टी-स्केल सीन-क्वेरी क्रॉस-अटेंशन का उपयोग करता है, जिससे दृश्य-अंधता (scene-blindness) की समस्याओं का समाधान होता है और विभिन्न प्रकाश स्थितियों में संलयन की गुणवत्ता में वृद्धि होती है।

मूल लेखक: Yunfei Chen, Juan Zhang, Yongbin Gao, Bo Huang

प्रकाशित 2026-09-22
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yunfei Chen, Juan Zhang, Yongbin Gao, Bo Huang

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

मशीन विजन की दुनिया में, कैमरे अक्सर प्रकाश के भौतिकी (फिजिक्स) द्वारा सीमित होते हैं। एक मानक कैमरा दुनिया को मानवीय आंख की तरह देखता है, जो समृद्ध रंगों और सूक्ष्म बनावटों को कैप्चर करता है, लेकिन जब सूरज ढल जाता है या हवा में धुआं भर जाता है, तो यह संघर्ष करने लगता है। इसके विपरीत, थर्मल कैमरे प्रकाश के बजाय गर्मी का पता लगाते हैं, जिससे वे पूर्ण अंधेरे में भी जीवित चीजों को स्पष्ट रूप से देख पाते हैं, फिर भी वे अक्सर धुंधली, ग्रे छवियों का उत्पादन करते हैं जिनमें एक सामान्य फोटोग्राफ की तरह बारीक विवरणों की कमी होती है। दशकों से, इंजीनियरों ने इन दोनों प्रकार की छवियों को एक एकल, पूर्ण चित्र में मिलाने का प्रयास किया है, जिसमें दिन की फोटो जैसी स्पष्टता और नाइट-विज़न डिवाइस की ताप-संवेदी शक्ति हो। इमेज फ्यूजन (छवि संलयन) के रूप में जानी जाने वाली यह प्रक्रिया, कोहरे से भरी सड़कों पर चलने वाले स्वायत्त वाहनों (ऑटोनॉमस व्हीकल्स) से लेकर शत्रुतापूर्ण वातावरण में सैन्य निगरानी तक, हर चीज़ के लिए महत्वपूर्ण है। हालाँकि, एक निरंतर समस्या ने इन प्रयासों को बाधित किया है: अधिकांश कंप्यूटर प्रोग्राम जो इन छवियों को मिलाते हैं, "सीन-ब्लाइंड" (दृश्य-अंध) होते हैं। वे एक उज्ज्वल, धूप वाले दिन और एक घने अंधेरे वाली रात के साथ बिल्कुल एक जैसा व्यवहार करते हैं, यह समझने में विफल रहते हैं कि छवियों को मिलाने के नियम प्रकाश व्यवस्था के आधार पर बदलने चाहिए। यह अंधापन अक्सर ऐसे परिणाम देता है जहाँ रात के आकाश का अंधेरा शोर (स्टैटिक) और नॉइज़ को बढ़ा देता है, या जहाँ धूप वाले दिन के चमकीले रंग फीके पड़ जाते हैं, जिससे अंतिम छवि मटमैली और भ्रमित करने वाली हो जाती है।

शंघाई यूनिवर्सिटी ऑफ इंजीनियरिंग साइंस के शोधकर्ताओं की एक टीम ने इस विशिष्ट समस्या को हल करने के लिए एक नया दृष्टिकोण विकसित किया है, उन्होंने एक प्रणाली बनाई है जिसे वे SQCAFusion कहते हैं। प्रक्रिया के अंत में प्रकाश की स्थितियों के लिए समायोजन करने का इंतज़ार करने के बजाय, उनका तरीका कंप्यूटर को प्रक्रिया के बिल्कुल शुरुआत में ही वातावरण को समझने के लिए कहता है। कल्पना कीजिए कि एक अनुवादक, किताब पढ़ने से पहले, दिन का समय जाँचता है ताकि यह तय कर सके कि औपचारिक भाषा का उपयोग करना है या अनौपचारिक का; इसी तरह, यह नई प्रणाली पहले दृश्य का विश्लेषण करती है ताकि यह निर्धारित किया जा सके कि यह दिन है या रात। फिर यह इस ज्ञान का उपयोग प्रक्रिया की शुरुआत से ही सक्रिय रूप से मार्गदर्शन करने के लिए करती है, न कि केवल अंत में एक सुधार लागू करने के लिए। शोधकर्ताओं ने पाया कि इस "सीन अवेयरनेस" (दृश्य जागरूकता) को फीचर एक्सट्रैक्शन के शुरुआती चरणों में सीधे इंजेक्ट करके, कंप्यूटर गतिशील रूप से यह तय कर सकता है कि दृश्य छवि को कितनी प्राथमिकता देनी है बनाम थर्मल छवि को। यदि दृश्य छवि अंधेरी और शोर युक्त है, तो सिस्टम थर्मल डेटा पर अधिक भरोसा करना सीख जाता है, जबकि दृश्य दुनिया के तीखे किनारों को सुरक्षित रखता है। यदि दृश्य उज्ज्वल है, तो यह मानक कैमरे के समृद्ध बनावट और रंगों को प्राथमिकता देता है।

इस नवाचार का मूल एक तंत्र है जो एक डायनेमिक फिल्टर के रूप में कार्य करता है। सिस्टम डिजिटल टोकन का एक सेट उत्पन्न करता है जो दृश्य की प्रकाश स्थितियों का प्रतिनिधित्व करते हैं। ये टोकन फिर एक 'क्वेरी' (पूछताछ) के रूप में कार्य करते हैं, जो कंप्यूटर से पूछते हैं कि छवि की विशेषताओं को देखना है और यह तय करना है कि कौन से हिस्से महत्वपूर्ण हैं और कौन से केवल शोर (नॉइज़) हैं। यह कई स्तरों (स्केल्स) पर होता है, जिसका अर्थ है कि सिस्टम वस्तुओं के व्यापक आकार और बनावट के सूक्ष्म विवरणों, दोनों की एक साथ जांच करता है। ऐसा करके, कंप्यूटर उस दानेदार शोर को दबा सकता है जो अक्सर कम रोशनी वाली तस्वीरों में होता है, बिना महत्वपूर्ण लक्ष्यों, जैसे कि पैदल यात्री या वाहन को धुंधला किए। शोधकर्ताओं ने खराब डेटा से सीखने की कठिनाई को संभालने के लिए एक चतुर प्रशिक्षण रणनीति भी पेश की है। जब कंप्यूटर को बहुत अंधेरी छवियों पर प्रशिक्षित किया जाता है, तो शोर कभी-कभी सीखने की प्रक्रिया को यह सोचने के लिए trick कर सकता है कि दानेदार स्टैटिक वास्तव में एक वास्तविक किनारा या वस्तु है। इसे रोकने के लिए, सिस्टम को यह सिखाया गया था कि जब वह एक अंधेरा दृश्य पहचानता है, तो दृश्य छवि की गुणवत्ता के लिए अपनी अपेक्षाओं को स्वचालित रूप से कम कर दे। यह मॉडल को शोर को अनदेखा करने की अनुमति देता है जबकि दृश्य की वास्तविक संरचना को पूरी तरह से कैप्चर करता है।

इस नए फ्रेमवर्क के परिणामों का परीक्षण शहरी सड़क दृश्यों, सैन्य छलावरण (कैमफ्लाज) परिदृश्यों और जटिल सड़क वातावरण सहित कई विभिन्न डेटासेट्स का उपयोग करके मौजूदा पद्धतियों के एक विस्तृत दायरे के विरुद्ध किया गया था। एक हजार से अधिक इमेज पेयर्स के डेटासेट पर मानक परीक्षणों में, इस नई पद्धति ने सूचना प्रतिधारण (रिटेंशन) और दृश्य स्पष्टता के प्रमुख मापदंडों में सभी पिछले अत्याधुनिक एल्गोरिदम को पछाड़ दिया। इसने अपने प्रतिस्पर्धियों की तुलना में अधिक विवरण सुरक्षित किए और उच्च कंट्रास्ट वाली छवियां बनाईं। शायद इससे भी अधिक प्रभावशाली बात यह है कि सिस्टम ने एक उल्लेखनीय क्षमता प्रदर्शित की। जब शोधकर्ताओं ने इसे उन पूरी तरह से नए डेटासेट्स पर परखा जिन्हें उसने पहले कभी नहीं देखा था—उच्च-परिभाषा वाले सड़क यातायात दृश्यों से लेकर सिंगल-चैनल सैन्य थर्मल छवियों तक—तो मॉडल को पुन: प्रशिक्षित या समायोजित करने की आवश्यकता नहीं पड़ी। इसने अपना उच्च प्रदर्शन बनाए रखा, स्पष्ट और तीखी छवियां बनाईं जिन्होंने थर्मल लक्ष्यों को पृष्ठभूमि के प्राकृतिक स्वरूप को बनाए रखते हुए अलग रखा। कम रोशनी की स्थिति में जहाँ अन्य पद्धतियां धुंधले हेलो या विवरण खो देती थीं, इस नए दृष्टिकोण ने वस्तुओं के किनारों को स्पष्ट और बैकग्राउंड को साफ रखा।

यह अध्ययन पुष्टि करता है कि बेहतर इमेज फ्यूजन की कुंजी न केवल शक्तिशाली हार्डवेयर होने में है, बल्कि सॉफ्टवेयर को उस संदर्भ को समझने की क्षमता देने में है जिसमें वह काम कर रहा है। एक कठोर, 'वन-साइज़-फिट्स-ऑल' दृष्टिकोण से हटकर एक डायनेमिक सिस्टम की ओर बढ़ते हुए, जो वास्तविक समय में प्रकाश की स्थितियों के अनुकूल होता है, शोधकर्ताओं ने एक ऐसा उपकरण बनाया है जो वास्तविक दुनिया के अनुप्रयोगों के लिए बहुत अधिक मजबूत है। यह कार्य सुझाव देता है कि भविष्य के विजन सिस्टम को भौतिक दुनिया की अप्रत्याशित प्रकृति को संभालने के लिए 'कॉन्टेक्स्ट-अवेयर' (संदर्भ-जागरूक) होने की आवश्यकता होगी। जबकि वर्तमान मॉडल दृश्य की वैश्विक समझ पर निर्भर करता है, शोधकर्ता नोट करते हैं कि भविष्य के संस्करण और भी सूक्ष्म विवरणों पर ध्यान केंद्रित कर सकते हैं, जिससे संभावित रूप से और भी जटिल वातावरण में वास्तविक समय में अनुकूलन संभव होगा। फिलहाल, यह विधि मशीन विजन को अंधेरे में विश्वसनीय बनाने की दिशा में एक महत्वपूर्ण कदम है, यह सुनिश्चित करते हुए कि महत्वपूर्ण विवरण छाया में खो न जाएं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →