← नवीनतम पेपर
🤖 AI

DEX-AR: A Dynamic Explainability Method for Autoregressive Vision-Language Models

यह शोध पत्र DEX-AR को प्रस्तुत करता है, जो एक नवीन गतिशील व्याख्यात्मकता (dynamic explainability) विधि है जो लेयर-वार ग्रेडिएंट्स की गणना करके और विजुअली-ग्राउंडेड (visually-grounded) टोकन को भाषाई टोकन से अलग करने के लिए डायनेमिक फ़िल्टरिंग का उपयोग करके ऑटो-रिग्रेसिव विजन-लैंग्वेज मॉडल्स के लिए प्रति-टोकन और अनुक्रम-स्तरीय हीटमैप्स उत्पन्न करता है, जिससे कई बेंचमार्क में व्याख्यात्मकता और प्रदर्शन में सुधार होता है।

मूल लेखक: Walid Bousselham, Angie Boggust, Hendrik Strobelt, Hilde Kuehne

प्रकाशित 2026-03-09
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Walid Bousselham, Angie Boggust, Hendrik Strobelt, Hilde Kuehne

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपका एक शानदार, सुपर-स्मार्ट रोबोट दोस्त है जो किसी फोटो को देख सकता है और आपको बेहतरीन वाक्यों में उसका वर्णन कर सकता है। आप पूछते हैं, "इस तस्वीर में क्या है?" और वह कहता है, "मैं एक पार्क में लाल गेंद के साथ खेलते हुए एक कुत्ते को देख रहा हूँ।"

लेकिन समस्या यह है: रोबोट को यह कैसे पता चला?
क्या उसने वास्तव में कुत्ते को देखा? या उसने पार्क देखकर "कुत्ता" शब्द का अंदाज़ा लगा लिया? क्या उसने लाल गेंद को देखा, या उसने बस यह मान लिया कि गेंदें लाल होती हैं?

लंबे समय तक, हमारे पास रोबोट के दिमाग के अंदर झांकने का कोई अच्छा तरीका नहीं था जिससे हम देख सकें कि किस शब्द ने फोटो के किस हिस्से को ट्रिगर किया। पुराने तरीके एक फिल्म को समझने के लिए एक स्थिर फ्रेम (frozen frame) को देखने जैसे थे। वे सरल कार्यों के लिए ठीक काम करते थे, लेकिन जब रोबोट एक पूरी कहानी, शब्द दर शब्द लिख रहा होता, तो वे बुरी तरह विफल हो जाते थे।

यहाँ आता है DEX-AR। DEX-AR को एक हाई-टेक "थॉट ट्रांसलेटर" (विचार अनुवादक) के रूप में समझें जो हमें वास्तविक समय में रोबोट के लिखने के दौरान उसके दिमाग को देखने की अनुमति देता है।

समस्या: "शब्द-दर-शब्द" की पहेली

आधुनिक AI मॉडल (जिन्हें विज़न-लैंग्वेज मॉडल्स कहा जाता है) केवल एक पूरा वाक्य एक साथ नहीं उगलते। वे इसे जेन्गा (Jenga) के खेल की तरह बनाते हैं:

  1. वे तस्वीर को देखते हैं।
  2. वे पहला ब्लॉक (शब्द "The") रखते हैं।
  3. वे अगला ब्लॉक तय करने के लिए तस्वीर को फिर से देखते हैं ("image")।
  4. वे तब तक ब्लॉक जमा करते रहते हैं जब तक कि टावर (वाक्य) पूरा न हो जाए।

पेचीदा बात यह है कि कुछ ब्लॉक विजुअल (दृश्य) होते हैं (जैसे "dog" या "ball"), और कुछ केवल भाषाई गोंद (linguistic glue) होते हैं (जैसे "the," "is," या "and")।

  • पुराने तरीके हर ब्लॉक के साथ एक जैसा व्यवहार करते थे। वे पूरे चित्र को हाइलाइट कर देते थे जब रोबोट "the" कहता था, भले ही "the" का चित्र से कोई लेना-देना न हो। यह कमरे में किसी के "हेलो" कहने पर पूरे कमरे पर टॉर्च जलाने जैसा था।
  • DEX-AR इतना स्मार्ट है कि वह अंतर जानता है। वह पूछता है: "क्या रोबोट को यह शब्द कहने के लिए तस्वीर देखने की ज़रूरत थी, या उसने इसे सिर्फ इसलिए कहा क्योंकि यह एक सामान्य वाक्य की शुरुआत है?"

DEX-AR कैसे काम करता है: "स्पॉटलाइट" की उपमा

कल्पना कीजिए कि रोबोट का दिमाग एक अंधेरा कमरा है जिसमें स्विचों (जिन्हें अटेंशन हेड्स कहा जाता है) से भरा एक विशाल, जटिल कंट्रोल पैनल है।

  1. डायनेमिक स्पॉटलाइट (हेड फ़िल्टरिंग):
    कुछ स्विच कैमरे (इमेज) से जुड़े होते हैं, और कुछ डिक्शनरी (टेक्स्ट) से जुड़े होते हैं।
  • पुराने तरीके सभी स्विच चालू कर देते थे, जिससे रोशनी का एक उलझा हुआ, भ्रमित करने वाला ढेर बन जाता था।
  • DEX-AR एक स्मार्ट स्पॉटलाइट ऑपरेटर की तरह काम करता है। वह कमरे को स्कैन करता है और कहता है, "हे, यह स्विच केवल व्याकरण के बारे में बात कर रहा है; चलिए इसे बंद कर देते हैं। लेकिन यह दूसरा स्विच सीधे फोटो में कुत्ते को देख रहा है? इसे चालू रखें!"
  • यह "शोर" (व्याकरण वाले स्विच) को फ़िल्टर करता है और केवल "सिग्नल" (इमेज वाले स्विच) को हाइलाइट करता है।
  1. सेंटेंस फ़िल्टर (टोकन फ़िल्टरिंग):
    जैसे-जैसे रोबोट अपना वाक्य बनाता है, DEX-AR एक स्कोरकार्ड रखता है।
  • जब रोबोट "Dog" कहता है, तो DEX-AR जाँचता है: "क्या इसने यह कहने के लिए फोटो को देखा?" हाँ! -> कुत्ते को हाइलाइट करें।
  • जब वह "and" कहता है, तो DEX-AR जाँचता है: "क्या इसने फोटो को देखा?" नहीं, यह बस जानता है कि 'dog' के बाद 'and' आता है। -> फोटो को अनदेखा करें।
  • यह एक साफ, स्पष्ट मानचित्र बनाता है जो दिखाता है कि अंतिम उत्तर के लिए चित्र के कौन से हिस्से महत्वपूर्ण थे।

यह क्यों मायने रखता है: "भरोसे" का कारक

हमें इसकी आवश्यकता क्यों है? कल्पना कीजिए कि एक सेल्फ-ड्राइविंग कार एक AI का उपयोग करती है जो सड़क को "देख" सकता है।

  • यदि AI स्टॉप साइन देखकर "रुकिए!" कहता है, तो यह अच्छा है।
  • लेकिन क्या होगा यदि वह एक पैदल यात्री की लाल शर्ट या पेड़ को देखकर "रुकिए!" कहता है और अंदाज़ा लगा लेता है कि वह स्टॉप साइन है? यह खतरनाक है।

DEX-AR इन गलतियों को पकड़ने में हमारी मदद करता है। यह हमें दिखाता है:

  • अच्छा AI: "मैं एक स्टॉप साइन देख रहा हूँ।" (हीट मैप साइन पर चमक रहा है)।
  • बुरा AI: "मैं एक स्टॉप साइन देख रहा हूँ।" (हीट मैप लाल शर्ट या पेड़ पर चमक रहा है, जो यह दर्शाता है कि AI भ्रमित है या केवल अंदाज़ा लगा रहा है)।

परिणाम: स्पष्ट दृष्टि

पेपर ने कई अलग-अलग AI मॉडल्स पर DEX-AR का परीक्षण किया और पाया कि यह पिछले तरीकों की तुलना में इमेज के "सही" हिस्सों को खोजने में बहुत बेहतर था।

  • यह तेज़ है (अतिरिक्त सिमुलेशन चलाने की आवश्यकता नहीं है)।
  • यह अधिक सटीक है (यह "the" या "is" जैसे शब्दों से भ्रमित नहीं होता है)।
  • यह लगभग किसी भी प्रकार के आधुनिक AI मॉडल पर काम करता है।

संक्षेप में

DEX-AR AI को एक्स-रे चश्मे देने जैसा है। केवल अंतिम वाक्य देखने के बजाय, हम हर एक शब्द के पीछे की सोचने की प्रक्रिया (thought process) देख सकते हैं। यह "विजुअल तथ्यों" को "ग्रामर के फालतू शब्दों" से अलग करता है, जिससे हमें AI पर अधिक भरोसा करने और गलत होने पर उसे सुधारने में मदद मिलती है। यह एक ब्लैक बॉक्स को एक स्पष्ट खिड़की में बदल देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →