← नवीनतम पेपर
💻 computer science

Grad-ECLIP: Gradient-based Visual and Textual Explanations for CLIP

यह शोध पत्र Grad-ECLIP का प्रस्ताव करता है, जो एक ग्रेडिएंट-आधारित विधि है जो स्पार्स सेल्फ-अटेंशन मैप्स के बजाय टोकन फीचर्स पर चैनल और स्थानिक भार (spatial weights) का लाभ उठाकर CLIP के लिए उच्च-गुणवत्ता वाले दृश्य और पाठ्य स्पष्टीकरण उत्पन्न करती है, जिससे मॉडल के मिलान तंत्र (matching mechanisms) को उजागर किया जा सके और फाइन-ट्यूनिंग के दौरान बेहतर सूक्ष्म-स्तरीय संरेखण (fine-grained alignment) को सक्षम बनाया जा सके।

मूल लेखक: Chenyang Zhao, Kun Wang, Janet H. Hsiao, Antoni B. Chan

प्रकाशित 2026-08-19
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Chenyang Zhao, Kun Wang, Janet H. Hsiao, Antoni B. Chan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

आधुनिक आर्टिफिशियल इंटेलिजेंस की दुनिया में, विजन-लैंग्वेज मॉडल्स (दृष्टि-भाषा मॉडल) नामक प्रणालियों का एक वर्ग मौजूद है। ये डिजिटल मस्तिष्क छवियों के विशाल संग्रह और उनके वर्णन करने वाले टेक्स्ट पर प्रशिक्षित होते हैं, जिससे वे यह सीख पाते हैं कि कुत्ते की एक तस्वीर का "कुत्ता" शब्द से क्या संबंध है। वे शक्तिशाली उपकरण बन गए हैं, जो विशाल डेटाबेस में विशिष्ट छवियों को खोजने या जो वे देखते हैं उसके बारे में उत्तर देने में सक्षम हैं। हालाँकि, इन प्रणालियों के इर्द-गिर्द एक महत्वपूर्ण रहस्य बना हुआ है: जबकि वे सही उत्तर देते हैं, कोई वास्तव में यह नहीं जानता कि छवि के किन हिस्सों या वाक्य के किन विशिष्ट शब्दों ने उन निर्णयों को प्रेरित किया है। यह एक मेधावी छात्र को एक जटिल गणितीय समस्या को पूरी तरह से हल करते हुए देखने जैसा है, फिर भी आप यह देखने में असमर्थ हैं कि उसने वहां तक पहुँचने के लिए कौन से कदम उठाए थे। इस अंतर्दृष्टि के बिना, यह जानना कठिन है कि क्या प्रणाली वास्तव में दुनिया को समझ रही है या केवल छिपे हुए पैटर्न के आधार पर अनुमान लगा रही है।

शोधकर्ताओं ने लंबे समय से इन मॉडल्स के भीतर झाँकने की कोशिश की है ताकि यह देखा जा सके कि वे किस चीज़ पर ध्यान केंद्रित कर रहे हैं। कुछ विधियाँ उनके आंतरिक "अटेंशन" (ध्यान) तंत्रों को देखती हैं, जिन्हें महत्वपूर्ण जानकारी को उजागर करने के लिए डिज़ाइन किया गया है, लेकिन इन विशिष्ट मॉडल्स में, वे हाइलाइट्स अक्सर विरल और भ्रमित करने वाले होते हैं, जो वास्तविक विषय के बजाय यादृच्छिक स्थानों की ओर संकेत करते हैं। अन्य दृष्टिकोण यह मापने का प्रयास करते हैं कि छवि के कुछ हिस्सों को हटाने से उत्तर में कितना परिवर्तन आता है, लेकिन ये विधियाँ धीमी हो सकती हैं या शोर युक्त, अस्पष्ट परिणाम दे सकती हैं। मुख्य चुनौती किसी दिए गए चित्र और वाक्य के लिए यह स्पष्ट रूप से दिखाने का तरीका खोजने की रही है कि कौन से पिक्सेल और कौन से शब्द मॉडल के अंतिम निर्णय के लिए सबसे अधिक मायने रखते हैं।

शोधकर्ताओं के एक दल ने इस समस्या को हल करने के लिए 'ग्रैड-एक्लिप' (Grad-ECLIP) नामक एक नई विधि पेश की है। आंतरिक अटेंशन मैप्स पर निर्भर रहने के बजाय, जो पूरी तस्वीर दिखाने में विफल रहते हैं, उनका दृष्टिकोण यह गणना करता है कि प्रत्येक भाग की महत्ता कितनी है, यह मापकर कि अंतिम परिणाम छोटे परिवर्तनों के प्रति कितना संवेदनशील है। कल्पना कीजिए कि मॉडल का निर्णय एक नाजुक संतुलन है; यह विधि इनपुट के विभिन्न हिस्सों को धीरे से हिलाकर देखती है कि कौन से हिस्से परिणाम में सबसे बड़ा बदलाव लाते हैं। यदि पिक्सेल के एक विशिष्ट पैच या एक एकल शब्द को हटाने से मॉडल का आत्मविश्वास काफी कम हो जाता है, तो उस भाग को अत्यधिक महत्वपूर्ण माना जाता है। ऐसा करके, शोधकर्ता स्पष्ट हीट मैप (तापमान मानचित्र) बना सकते हैं जो एक छवि के सबसे प्रासंगिक क्षेत्रों पर चमकते हैं और वाक्य के सबसे महत्वपूर्ण शब्दों को उजागर करते हैं।

मौजूदा तकनीकों के विरुद्ध परीक्षण किए जाने पर, यह नई विधि कहीं अधिक सटीक सिद्ध हुई। दृश्य परीक्षणों में, जहाँ पुराने तरीके अक्सर बैकग्राउंड के शोर या असंबंधित वस्तुओं को हाइलाइट करते थे, ग्रैड-एक्लिप लगातार सही विषयों पर ध्यान केंद्रित करता है। उदाहरण के लिए, एक कुत्ते द्वारा फ्रिसबी के साथ खेलने की छवि को "एक कुत्ता फ्रिसबी के साथ खेल रहा है" वाक्य के साथ मिलाते समय, यह विधि कुत्ते और फ्रिसबी को सही ढंग से हाइलाइट करती है, जबकि बैकग्राउंड को अनदेखा कर देती है। इसने सफलतापूर्वक पहचाना कि "खेलने" (playing) शब्द कुत्ते के पैरों की क्रिया से मेल खाता है, और "फ्रिसबी" (frisbee) हवा में मौजूद वस्तु से मेल खाता है। मात्रात्मक परीक्षणों में, जहाँ शोधकर्ताओं ने उत्पन्न मानचित्रों के आधार पर पिक्सेल को व्यवस्थित रूप से हटाया या जोड़ा, इस नई विधि ने अन्य सभी तकनीकों की तुलना में मॉडल के प्रदर्शन को अधिक नाटकीय रूप से बदल दिया, जिससे सिद्ध हुआ कि यह वास्तव में सबसे महत्वपूर्ण जानकारी की पहचान कर रही थी।

केवल यह दिखाने के अलावा कि मॉडल कैसे काम करता है, शोधकर्ताओं ने इस उपकरण का उपयोग यह खोजने के लिए किया कि मॉडल वास्तव में कैसे सोचता है। उन्होंने पाया कि सिस्टम में जटिल वाक्यांशों को व्यक्तिगत अवधारणाओं में तोड़ने और फिर उन्हें संयोजित करने की एक उल्लेखनीय क्षमता है। यदि उसे घोड़े की तस्वीर दिखाई जाए और "युवा घोड़े" के बारे में पूछा जाए, तो मॉडल घोड़े पर ध्यान केंद्रित करेगा लेकिन युवा वाले पर अपना ध्यान मजबूत करेगा। हालाँकि, यदि "सफेद घोड़े" के बारे में पूछा जाए जबकि तस्वीर में घोड़ा भूरा है, तो मॉडल रंग को काफी हद तक अनदेखा कर देगा और स्वयं घोड़े पर ध्यान केंद्रित करेगा, जिससे पता चलता है कि वह बेमेल विशेषण को एक निर्णायक विवरण के बजाय एक माध्यमिक विवरण के रूप में मानता है। इससे पता चला कि मॉडल "बाएँ" या "दाएँ" जैसे अमूर्त तुलनाओं के बजाय रंगों और आकारों जैसी ठोस, दृश्य अवधारणाओं को प्राथमिकता देता है, जिन्हें खोजने में वह अक्सर संघर्ष करता है।

अध्ययन में यह भी पाया गया कि मॉडल मूर्त (concrete) शब्दों—जो उन चीजों का वर्णन करते हैं जिन्हें आप देख और छू सकते हैं—पर अमूर्त शब्दों की तुलना में बहुत अधिक महत्व देता है। यह प्राथमिकता केवल इसलिए नहीं है क्योंकि मूर्त शब्द उनके प्रशिक्षण डेटा में अधिक बार आते हैं; शोधकर्ताओं ने शब्दों की आवृत्ति की जाँच की और पाया कि इसमें कोई सीधा संबंध नहीं है। इसके बजाय, ऐसा लगता है कि मॉडल ने यह सीख लिया है कि छवियों को टेक्स्ट से मिलाने के लिए ठोस दृश्य विवरण अधिक विश्वसनीय होते हैं। यह अंतर्दष्टि यह समझाने में मदद करती है कि ये सिस्टम 'जीरो-शॉट लर्निंग' में इतने अच्छे क्यों हैं, जहाँ वे उन नई चीजों को पहचान सकते हैं जिन्हें उन्होंने पहले कभी नहीं देखा है, उन ठोस, दृश्य निर्माण खंडों पर भरोसा करके जिन्हें उन्होंने महारत हासिल की है।

अंततः, यह कार्य एक जटिल आर्टिफिशियल इंटेलिजेंस के तर्क में एक स्पष्ट खिड़की प्रदान करता है। यह दिखाकर कि मॉडल कहाँ देखता है और वह किसे महत्व देता है, शोधकर्ता इन प्रणालियों को एक 'ब्लैक बॉक्स' के रूप में मानने से आगे बढ़ गए हैं। यह नई विधि वैज्ञानिकों और डेवलपरों को उनके निर्णयों पर अधिक विश्वास के साथ भरोसा करने की अनुमति देती है, यह जानते हुए कि कौन सी विशेषताओं ने निष्कर्ष तक पहुँचाया। यह मॉडल की वर्तमान सीमाओं को भी उजागर करता है, जैसे कि स्थानिक संबंधों (spatial relationships) के साथ इसकी कठिनाई, जो भविष्य के सुधारों के लिए एक रोडमैप प्रदान करता है। इस उपकरण के साथ, अधिक विश्वसनीय और समझने योग्य आर्टिफिशियल इंटेलिजेंस बनाने का मार्ग बहुत स्पष्ट हो जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →