← नवीनतम पेपर
💻 computer science

Bringing Multimodal Large Language Models to Infrared-Visible Image Fusion Quality Assessment

यह शोध पत्र FuScore प्रस्तुत करता है, जो इन्फ्रारेड-विज़िबल इमेज फ्यूजन के लिए एक नवीन गुणवत्ता मूल्यांकन ढांचा है, जो निरंतर गुणवत्ता स्कोर उत्पन्न करने के लिए मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स का लाभ उठाता है और सॉफ्ट लेबल्स के साथ एक त्रिपक्षीय उद्देश्य को नियोजित करता है, जिससे मौजूदा असतत और स्केलर मूल्यांकन विधियों की सीमाओं को पार करते हुए मानवीय दृश्य प्राथमिकताओं के साथ अत्याधुनिक सहसंबंध प्राप्त किया जाता है।

मूल लेखक: Yuchen Guo, Junli Gong, Yao Lu, Xintong Xu, Yiuming Cheung, Weifeng Su

प्रकाशित 2026-05-12
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yuchen Guo, Junli Gong, Yao Lu, Xintong Xu, Yiuming Cheung, Weifeng Su

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

मुख्य विचार: दो कैमरों को एक में मिलाना

कल्पना कीजिए कि आपके पास रात के समय एक ही दृश्य की तस्वीरें लेने वाले दो कैमरे हैं।

  1. कैमरा A (इन्फ्रारेड): यह गर्मी देखता है। यह अंधेरे में छिपे व्यक्ति का पता लगा सकता है क्योंकि वह गर्म है, लेकिन तस्वीर धुंधली दिखती है और उसमें विवरण (details) की कमी होती है।
  2. कैमरा B (विज़िबल/दृश्यमान): यह प्रकाश देखता है। यह पेड़ की टहनियों या सड़क के संकेतों जैसे स्पष्ट विवरण दिखाता है, लेकिन यदि बहुत अंधेरा हो, तो तस्वीर पूरी तरह काली हो जाती है।

इमेज फ्यूजन (Image Fusion) इन दोनों तस्वीरों को एक "सुपर फोटो" में मिलाने की प्रक्रिया है जिसमें गर्मी का पता लगाने की क्षमता और स्पष्ट विवरण दोनों शामिल हों। यह सेल्फ-ड्राइविंग कारों या सुरक्षा प्रणालियों जैसी चीजों के लिए बहुत महत्वपूर्ण है।

समस्या: हमें कैसे पता चलेगा कि "सुपर फोटो" अच्छी है?

यह शोध पत्र तर्क देता है कि इन "सुपर फोटोज" को परखने के वर्तमान तरीके दोषपूर्ण हैं।

  • पुराना तरीका (गणितीय सूत्र): वैज्ञानिक पहले कठोर गणितीय सूत्रों (जैसे कि छवि में कितनी "सूचना" है, इसकी गिनती करना) का उपयोग करते थे। शोध पत्र कहता है कि यह केवल गाजर और आलू की संख्या गिनकर सूप की रेसिपी को आंकने जैसा है। हो सकता है कि आपके पास बहुत सारे सामग्रियां हों, लेकिन सूप का स्वाद फिर भी खराब हो सकता है। ये सूत्र अक्सर बदसूरत, धुंधली छवियों को भी उच्च अंक दे देते हैं।
  • "वन-हॉट" AI तरीका: हाल ही में, लोगों ने तस्वीरों को परखने के लिए AI (लार्ज लैंग्वेज मॉडल्स) का उपयोग करने की कोशिश की। लेकिन उन्होंने AI को एक स्कूल रिपोर्ट कार्ड की तरह ग्रेड चुनने के लिए मजबूर किया: "1, 2, 3, 4, या 5।"
    • दोष: कल्पना कीजिए कि दो छात्रों को 94.5 और 94.8 अंक मिले। यदि आप उन्हें "A" या "B" श्रेणियों में जबरदस्ती फिट करते हैं, तो आप सूक्ष्म अंतर खो देते हैं। शोध पत्र कहता है कि AI को एक एकल पूर्णांक स्तर (जैसे "स्तर 4") चुनने के लिए मजबूर करना दो बहुत समान छवियों के बीच के छोटे लेकिन महत्वपूर्ण अंतरों को अनदेखा कर देता है। यह वैसा ही है जैसे यह कहना कि दो लगभग एक जैसी पेंटिंग्स पूरी तरह से अलग आर्ट गैलरी में हैं, सिर्फ इसलिए क्योंकि एक को "4" मिला और दूसरी को "3"।

समाधान: FuScore

लेखकों ने FuScore बनाया है, जो एक नया AI जज है जो एक मानव विशेषज्ञ की तरह काम करता है।

1. "निरंतर स्कोर" (Continuous Score) की उपमा

AI से यह पूछने के बजाय कि, "क्या यह 4 है या 5?", FuScore पूछता है, "1 से 5 के पैमाने पर, यह ठीक कहाँ ठहरता है?"

  • पुराना AI: "यह 4 है।" (डिस्क्रीट/विच्छिन्न)
  • FuScore: "यह 4.75 है।" (कंटीन्यूअस/निरंतर)
    यह AI को उन दो छवियों के बीच अंतर बताने की अनुमति देता जो लगभग एक जैसी हैं, जो फ्यूजन तकनीक को बेहतर बनाने के लिए अत्यंत महत्वपूर्ण है।

2. "समूह सहमति" (Group Consensus) की उपमा

FuScore को कैसे पता चलता है कि उसका स्कोर कितना सटीक होना चाहिए? यह इन छवियों को परखने के लिए उपयोग किए जाने वाले चार विशिष्ट मानदंडों को देखता है:

  1. हीट रिटेंशन (गर्मी का संरक्षण): क्या इसने गर्म स्थानों को बनाए रखा?
  2. टेक्सचर (बनावट): क्या विवरण स्पष्ट हैं?
  3. आर्टिफैक्ट्स (दोष/ग्लिच): क्या इसमें कोई अजीब गड़बड़ी या शोर (noise) है?
  4. शार्पनेस (तीक्ष्णता): क्या छवि स्पष्ट है?
  • परिदृश्य A (सहमति): यदि चारों मानदंड कहते हैं, "यह एक शानदार छवि है," तो FuScore एक बहुत ही सटीक, आत्मविश्वासी स्कोर देता है (जैसे 4.8)।
  • परिदृश्य B (असहमति): यदि एक छवि में गर्मी अच्छी है लेकिन ग्लिच बहुत खराब हैं, तो चारों मानदंड एक-दूसरे से बहस कर रहे होते हैं। FuScore समझ जाता है, "हम्म, इंसान इस पर असहमत हो सकते हैं।" इसलिए, यह अनिश्चितता को दर्शाने के लिए एक व्यापक, धुंधला स्कोर रेंज देता है। यह एक शिक्षक की तरह है जो कहता है, "यह निबंध अच्छा है, लेकिन चूंकि व्याकरण और कहानी एक-दूसरे का विरोध कर रहे हैं, इसलिए मैं 100% निश्चित नहीं हूँ कि इसे कहाँ ग्रेड दिया जाए।"

3. "तीन-भागों वाली ट्रेनिंग"

इस AI को सिखाने के लिए, लेखकों ने इसे केवल एक बार में एक फोटो नहीं दिखाई। उन्होंने तीन-भागों वाली प्रशिक्षण रणनीति का उपयोग किया:

  • भाग 1 (व्यक्तिगत): AI को चार मानदंडों के "सहमति" के आधार पर एक एकल फोटो के लिए सही स्कोर देना सिखाएं।
  • भाग 2 (एक ही दृश्य): AI को अलग-अलग विधियों द्वारा बनाया गया एक ही दृश्य का दो फोटो दिखाएं। पूछें, "कौन सा बेहतर है?" यह इसे विधियों को निष्पक्ष रूप से रैंक करना सिखाता है।
  • भाग 3 (अलग-अलग दृश्य): AI को अलग-अलग दृश्यों (जैसे जंगल बनाम शहर) के फोटो दिखाएं। यह इसे सिखाता है कि कुछ दृश्य फ्यूज करना कठिन होता है, ताकि वह बैकग्राउंड की कठिनाई से भ्रमित न हो।

परिणाम

शोध पत्र ने FuScore का परीक्षण इनके विरुद्ध किया:

  • पुराने गणितीय सूत्र।
  • अन्य AI जज।
  • मानव विशेषज्ञ।

परिणाम: FuScore ने अन्य सभी तरीकों की तुलना में मानवीय प्राथमिकताओं को बेहतर ढंग से समझा। यह उच्च-गुणवत्ता वाली छवियों के बीच के सूक्ष्म अंतरों को पकड़ने में विशेष रूप से सक्षम था जिन्हें अन्य तरीके मिस कर देते थे। इसने यह भी साबित किया कि जब चार मानदंड (गर्मी, टेक्सचर आदि) असहमत थे, तो मानव विशेषज्ञ भी अधिक असहमत थे, जिससे सिद्ध होता है कि FuScore की "अनिश्चितता" (uncertainty) विशेषता वास्तविक और उपयोगी है।

सारांश

FuScore फ्यूज्ड छवियों के लिए एक नया AI जज है जो गुणवत्ता को बहुविकल्पीय परीक्षा की तरह नहीं देखता। इसके बजाय, यह एक सूक्ष्म मानव आलोचक की तरह कार्य करता है, जो सटीक दशमलव स्कोर देता है और यह स्वीकार करता है कि जब छवि के विभिन्न हिस्से विरोधाभासी होते हैं तो उसे परखना कठिन होता है। यह विभिन्न गुणवत्ता कारकों के बीच की सहमति को देखकर और छवियों की आपस में तुलना करके सीखता है, जिसके परिणामस्वरूप एक ऐसा सिस्टम बनता है जो पुराने गणितीय सूत्रों या कठोर AI ग्रेडर्स की तुलना में मानवीय पसंद को बहुत बेहतर समझता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →