← नवीनतम पेपर
💻 computer science

P2Fusion: Prompt-based Progressive Infrared-Visible Image Fusion via Dual-Prior Distillation

यह शोध पत्र P2Fusion को पेश करता है, जो एक नवीन प्रॉम्प्ट-आधारित फ्रेमवर्क है जो अत्याधुनिक इन्फ्रारेड-विज़िबल इमेज फ्यूजन प्रदर्शन प्राप्त करने और डाउनस्ट्रीम ऑब्जेक्ट डिटेक्शन मजबूती को महत्वपूर्ण रूप से बढ़ाने के लिए दोहरे अंतर्निहित प्रायों (dual intrinsic priors) और गेटेड डायनेमिक एक्सपर्ट रीकैलिब्रेशन के साथ 'टीच-टू-फ्यूज' तंत्र का लाभ उठाता है।

मूल लेखक: Yi Shi, Huichao Xie, Yuqing Wang, Mingyu Wang, Kaihui Yang, Yu Liu, Ruitao Lu, Lizhe Li, Junwei Han, Dingwen Zhang

प्रकाशित 2026-08-14
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yi Shi, Huichao Xie, Yuqing Wang, Mingyu Wang, Kaihui Yang, Yu Liu, Ruitao Lu, Lizhe Li, Junwei Han, Dingwen Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक डरावनी, धुंधली रात की एक बेहतरीन फोटो लेने की कोशिश कर रहे हैं। आपके पास दो कैमरे हैं: एक जो चमगादड़ की तरह अंधेरे में देख सकता है (इन्फ्रारेड), जो गर्म चीजों जैसे लोगों या कारों को पहचानने में बहुत अच्छा है, लेकिन यह धुंधला दिखता है और इसमें विवरणों की कमी होती है। दूसरा एक सामान्य कैमरा (दृश्य प्रकाश) है, जो पेड़ की टहनियों या सड़क के संकेतों जैसे स्पष्ट बनावट (टेक्सचर) को देखता है, लेकिन अंधेरे या धुएं से पूरी तरह अंधा हो जाता है। इमेज फ्यूजन (Image fusion) इन दोनों तस्वीरों को एक 'सुपर-इमेज' में जादुई रूप से मिलाने की कला है, जिसमें दोनों दुनियाओं की सबसे अच्छी खूबियां शामिल हों। वर्षों से, वैज्ञानिक ऐसे कंप्यूटर बनाने की कोशिश कर रहे हैं जो इसे स्वचालित रूप से कर सकें। लक्ष्य यह है कि रोबोट, स्वायत्त वाहन (self-driving cars) और ड्रोन खराब मौसम, रात या धुएं में स्पष्ट रूप से "देख" सकें, ताकि वे टकराने या महत्वपूर्ण लक्ष्यों को चूकने से बच सकें। हालांकि, कंप्यूटर को इन दो बहुत अलग प्रकार के विज़न को बिना विवरणों को बिगाड़े मिलाने के तरीके को सिखाना एक कठिन पहेली रही है।

इस शोध के पीछे के शोधकर्ताओं ने, जिसे P²Fusion कहा जाता है, कंप्यूटर को कठोर, पूर्व-लिखित नियमों का पालन करने के लिए मजबूर करना बंद करने का निर्णय लिया। इसके बजाय, उन्होंने "डायनेमिक प्रॉम्प्ट्स" (dynamic prompts) का उपयोग करके AI को इन छवियों को मिलाने का तरीका सिखाने के लिए एक नया तरीका निकाला, जो सख्त आदेशों के बजाय मददगार, बदलते हुए संकेतों की तरह हैं। वे अपने इस तरीके को "टीच-टू-फ्यूज" (Teach-to-Fuse) कहते हैं।

यहाँ वह समस्या है जिसे वे हल कर रहे हैं: अतीत में, वैज्ञानिकों ने कंप्यूटर को "स्थिर पूर्व ज्ञान" (static prior knowledge) देकर मार्गदर्शन करने की कोशिश की—जैसे कि वस्तुओं के होने की जगह का एक निश्चित मानचित्र या एक कठोर नियम कि "हमेशा किनारों को तीक्ष्ण रखें।" लेखक तर्क देते हैं कि यह एक ऐसी कार चलाने की कोशिश करने जैसा है जिसके पास एक ऐसा नक्शा है जो कभी अपडेट नहीं होता; यदि सड़क बदलती है, तो ड्राइवर भ्रमित हो जाता है। अन्य तरीकों ने संकेतों के लिए विशाल, पूर्व-प्रशिक्षित AI मॉडल (जैसे कि बिल्ली या कुत्ते को पहचानने वाले मॉडल) का उपयोग करने की कोशिश की, लेकिन लेखकों ने पाया कि ये संकेत अक्सर बहुत अस्पष्ट और उच्च-स्तरीय होते थे, जिनमें एक आदर्श फोटो के लिए आवश्यक सूक्ष्म, पिक्सेल-स्तरीय विवरणों की कमी होती थी।

इसे ठीक करने के लिए, P²Fusion एक चतुर दो-चरणीय रणनीति का उपयोग करता है। पहले, यह एक स्मार्ट शिक्षक की तरह कार्य करता है जो केवल उत्तर नहीं देता, बल्कि AI को छवियों से खुद सीखना सिखाता है। यह दो "शिक्षकों" का उपयोग करता है:

  1. थर्मल टीचर (The Thermal Teacher): यह शिक्षक इन्फ्रारेड छवि को देखता है और उन "गर्म" स्थानों (जैसे व्यक्ति या कार) को उजागर करता है जिन्हें सुरक्षित रखना आवश्यक है।
  2. क्वालिटी टीचर (The Quality Teacher): यह दृश्य छवि को देखता है और यह बताता है कि कौन से हिस्से स्पष्ट और तीक्ष्ण हैं, और कौन से धुंधले या अंधेरे हैं।

इन संकेतों को हार्ड-कोड करने के बजाय, सिस्टम उन्हें "प्रॉम्प्ट्स" में बदल देता है—जो लचीले, सीखने योग्य संकेत हैं जो AI को उसके काम के दौरान मार्गदर्शन करते हैं। इसे एक ऑर्केस्ट्रा का नेतृत्व करने वाले कंडक्टर की तरह समझें। हर संगीतकार को हर सेकंड में सटीक नोट बजाने के लिए कहने के बजाय (जो कठोर और त्रुटिपूर्ण हो सकता है), कंडक्टर वास्तविक समय में संगीत के आधार पर गतिशील संकेत देता है, जिससे संगीतकार खुद को समायोजित कर पाते हैं।

उनके आविष्कार का दूसरा भाग एक विशेष मॉड्यूल है जिसे GDER (Gated Dynamic Expert Recalibration) कहा जाता है। कल्पना कीजिए कि एक पहेली पर काम करने वाले दो विशेषज्ञों की एक टीम है। एक विशेषज्ञ "गर्म" लक्ष्यों को खोजने में माहिर है (मोडैलिटी एक्सपर्ट), और दूसरा समग्र संरचना और बनावट को देखने में माहिर है (अटेंशन एक्सपर्ट)। कई पुराने सिस्टमों में, ये दोनों अपने विचारों को बस आपस में मिला देते थे, जिससे अक्सर भ्रम पैदा होता था। P²Fusion एक "गेटिंग" तंत्र (gating mechanism) का उपयोग करता है—एक स्मार्ट रेफरी—जो हर एक क्षण में यह तय करता है कि प्रत्येक विशेषज्ञ की राय को कितना महत्व दिया जाए। यदि दृश्य धुंधला है, तो रेफरी थर्मल विशेषज्ञ की बात अधिक सुन सकता है। यदि दृश्य उज्ज्वल लेकिन भीड़भाड़ वाला है, तो वह टेक्सचर विशेषज्ञ की बात अधिक सुन सकता है। यह सिस्टम को अपनी गलतियों को ठीक करने और दोनों प्रकार के विज़न को पूरी तरह से संतुलित करने की अनुमति देता है।

लेखकों ने भारी धुएं, अत्यधिक चमक और रात के ड्राइविंग जैसे पांच अलग-अलग डेटासेट्स पर अपने नए सिस्टम का परीक्षण किया। उन्होंने पाया कि P²Fusion ने इन परीक्षणों में वर्तमान सर्वोत्तम तरीकों की तुलना में लगातार बेहतर परिणाम दिए। वास्तव में, इसने इन परीक्षणों के 20 में से 14 प्रमुख माप श्रेणियों में शीर्ष स्थान प्राप्त किया। यह न केवल दिखने में बेहतर था; इसने वास्तव में कंप्यूटरों को वस्तुओं का पता लगाने में अधिक सटीक बनाया। उदाहरण के लिए, जब इसे ड्रोन द्वारा वाहनों का पता लगाने में मदद करने के लिए उपयोग किया गया, तो इसने एक डेटासेट पर पहचान सटीकता में 3.2% और दूसरे पर 0.9% का सुधार किया। यहाँ तक कि जब पूरी तरह से नए, अनदेखे वातावरण (जैसे कि ड्रोन फुटेज जिसे उसने पहले कभी नहीं देखा था) में परीक्षण किया गया, तब भी सिस्टम मजबूत रहा और विफल नहीं हुआ।

संक्षेप में, यह शोध पत्र सुझाव देता है कि कठोर, स्थिर नियमों से दूर हटकर, इसके बजाय लचीले, छवि-आधारित "प्रॉम्प्ट्स" का उपयोग करके जो एक स्मार्ट, स्व-सुधारने वाली विशेषज्ञों की टीम द्वारा निर्देशित होते हैं, हम अंधेरे और धुंध में देखने के लिए बहुत बेहतर उपकरण बना सकते हैं। लेखक मानते हैं कि यह दृष्टिकोण तीक्ष्णता बनाए रखने और महत्वपूर्ण लक्ष्यों को दृश्यमान रखने के बीच के संघर्ष को हल करता है, जो स्वायत्त मशीनों के भविष्य के लिए एक अधिक अनुकूलनीय समाधान प्रदान करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →