Where MLLMs Attend and What They Rely On: Explaining Autoregressive Token Generation
यह शोध पत्र EAGLE को प्रस्तुत करता है, जो एक हल्का ब्लैक-बॉक्स फ्रेमवर्क है जो मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स में ऑटोरेग्रेसिव टोकन जनरेशन की व्याख्या विशिष्ट विजुअल क्षेत्रों को निर्णयों के लिए उत्तरदायी मानकर और विजुअल एविडेंस एवं लैंग्वेज प्रायर्स के बीच संतुलन को मात्रात्मक रूप से मापकर करता है, जिससे कम कम्प्यूटेशनल लागत के साथ बेहतर फेथफुलनेस, लोकलाइजेशन और हेलुसिनेशन डायग्नोसिस प्राप्त होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपका एक बहुत ही बुद्धिमान, लेकिन थोड़ा रहस्यमय, रोबोट मित्र है जिसका नाम EAGLE है। यह रोबोट चित्रों को देखने और उन्हें वाक्यों में वर्णित करने में माहिर है (जैसे, "एक केले के पेड़ पर एक बिल्ली बैठी है")। लेकिन कभी-कभी, यह अपनी ओर से बातें बना लेता है (hallucinations), या यह बताना मुश्किल हो जाता है कि इसने ऐसा क्यों कहा।
यह पेपर EAGLE को पेश करता है, जो इन AI रोबोटों के लिए एक "डिटेक्टिव" (जासूस) के रूप में डिज़ाइन किया गया एक नया टूल है। यह दो बड़े सवालों के जवाब देता है:
- रोबोट ने कहाँ देखा? (किस हिस्से की वजह से इसने "बिल्ली" कहा?)
- यह किस पर निर्भर था? (क्या इसने वास्तव में बिल्ली को देखा, या इसने सिर्फ इसलिए अंदाज़ा लगाया क्योंकि यह एक आम वाक्य है?)
यहाँ बताया गया है कि यह कैसे काम करता है, कुछ मज़ेदार उपमाओं (analogies) का उपयोग करते हुए।
1. समस्या: "ब्लैक बॉक्स" का रहस्य
कल्पना कीजिए कि आपने एक शेफ से कोई व्यंजन बनाने को कहा। वे आपको एक स्वादिष्ट भोजन परोसते हैं, लेकिन वे आपको यह नहीं बताते कि उन्होंने किन सामग्रियों का उपयोग किया या किस क्रम में किया। आपको संदेह हो सकता है कि उन्होंने नमक का उपयोग किया है, लेकिन शायद उन्होंने चीनी का उपयोग किया हो।
- MLLMs (मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स) उसी शेफ की तरह हैं। वे एक चित्र देखते हैं और एक कहानी लिखते हैं।
- समस्या: कभी-कभी वे झूठ बोलते हैं (hallucinate)। यदि वे कहते हैं, "तस्वीर में एक कुत्ता है," लेकिन वहाँ कोई कुत्ता नहीं है, तो हमें जानने की ज़रूरत है कि उन्हें ऐसा क्यों लगा। पुराने टूल्स शेफ के मस्तिष्क तरंगों (आंतरिक गणित) को देखकर अनुमान लगाने की कोशिश करते थे, लेकिन वह बहुत उलझा हुआ और अक्सर गलत होता है।
2. समाधान: "लेगो ब्लॉक" डिटेक्टिव
EAGLE को रोबोट के दिमाग के अंदर देखने की ज़रूरत नहीं है। यह रोबोट के साथ एक ब्लैक बॉक्स (आप इसके अंदर नहीं देख सकते, आप बस चीज़ें डालते हैं और परिणाम प्राप्त करते हैं) की तरह व्यवहार करता है।
यह कैसे काम करता है:
कल्पना कीजिए कि तस्वीर 100 छोटे लेगो ब्लॉक्स (छवि के छोटे टुकड़े) से बनी एक विशाल पहेली है।
- चरण 1: आँखों पर पट्टी वाला टेस्ट (The Blindfold Test)। EAGLE अधिकांश लेगो ब्लॉक्स को ढक देता है, जिससे केवल कुछ ही दिखाई देते हैं। यह रोबोट से पूछता है: "क्या तुम अभी भी तस्वीर का वर्णन कर सकते हो?"
- चरण 2: "इनसाइट" स्कोर (The "Enough" Test)। EAGLE उन लेगो ब्लॉक्स के सबसे छोटे समूह को खोजने की कोशिश करता है, जिन्हें दिखाने पर रोबोट बिल्कुल वही वाक्य बोलेगा जो पहले बोला था।
- उपमा: यदि आप रोबोट को केवल "बिल्ली का कान" और "पूंछ" दिखाते हैं, और वह फिर भी "बिल्ली" कहता है, तो वे Insight ब्लॉक्स हैं। वे काम करने के लिए पर्याप्त हैं।
- चरण 3: "नेसेसिटी" स्कोर (The "Need" Test)। इसके बाद EAGLE एक पूरी तस्वीर लेता है और एक-एक करके ब्लॉक्स को हटाना शुरू करता है। वह देखता है कि कौन सा ब्लॉक हटाने पर रोबotong कहना बंद कर देता है कि "बिल्ली"।
- उपमा: यदि आप "बिल्ली का शरीर" हटा देते हैं और रोबोट अचानक कहता है "मुझे कुछ दिखाई नहीं दे रहा," तो वह ब्लॉक Necessary (आवश्यक) था।
इन दोनों टेस्टों को मिलाकर, EAGLE एक हीट मैप (Heat Map) बनाता है। यह छवि के उन विशिष्ट हिस्सों को उजागर करता है जो वास्तव में मायने रखते थे।
3. ट्विस्ट: "अंदाज़ा लगाना" बनाम "देखना"
यह सबसे चतुर हिस्सा है। EAGLE यह भी पता लगाता है कि रोबोट चीज़ों को देख रहा है या केवल अपनी भाषा के ज्ञान के आधार पर अंदाज़ा लगा रहा है।
- परिदृश्य: रोबोट कहता है, "आदमी ने एक कॉफी कप पकड़ा हुआ है।"
- टेस्ट: EAGLE धीरे-धीरे तस्वीर को रोबोट के सामने प्रकट करता है।
- यदि रोबोट एक "विजुअल लर्नर" (दृश्य शिक्षार्थी) है: जैसे ही कॉफी कप दिखाई देता है, रोबोट का आत्मविश्वास बहुत बढ़ जाता है। उसे शब्द बोलने के लिए कप को देखने की ज़रूरत होती है।
- यदि रोबोट एक "लैंग्वेज गेसर" (भाषा का अंदाज़ा लगाने वाला) है: रोबोट तब भी "कॉफी कप" कहता है जब तस्वीर पूरी तरह से काली होती है! वह सिर्फ इसलिए अंदाज़ा लगा रहा है क्योंकि कहानियों में "आदमी" और "कॉफी कप" अक्सर साथ आते हैं।
- परिणाम: EAGLE आपको बता सकता है: "हे, यह शब्द जो उसने देखा (Visual Evidence) उस पर आधारित था, लेकिन वह दूसरा शब्द सिर्फ एक भाग्यशाली अंदाज़ा (Language Prior) था।"
4. यह एक बड़ी बात क्यों है?
इस पेपर ने कई लोकप्रिय AI मॉडल्स पर EAGLE का परीक्षण किया और पाया कि यह अब तक का सबसे अच्छा जासूस है।
- यह अधिक सटीक है: पुराने टूल्स अक्सर छवि के गलत हिस्सों की ओर इशारा करते थे (जैसे कार के बारे में बात करते समय आकाश को हाइलाइट करना)। EAGLE कार की ओर इशारा करता है।
- यह झूठ पकड़ता है: जब एक रोबोट भ्रमित होता है (एक ऐसा कुत्ता बना देता है जो वहाँ नहीं है), तो EAGLE ठीक से बता सकता है कि किस अजीब पिक्सेल पैच ने रोबोट को भ्रमित किया। यह उस "स्मोकिंग गन" (सबूत) को खोजने जैसा है जिसने झूठ का कारण बना।
- यह पैसे बचाता है: इसे चलाने के लिए बहुत महंगे कंप्यूटर की आवश्यकता नहीं है। यह हल्का और कुशल है।
सारांश
EAGLE को AI के लिए एक सत्य बताने वाले अनुवादक (truth-telling translator) के रूप में सोचें।
- पहले, हमें AI पर आँख मूँदकर भरोसा करना पड़ता था।
- अब, EAGLE हमें यह कहने की अनुमति देता है, "ठीक है, मैं समझ गया कि तुमने ऐसा क्यों कहा। तुमने केले के पेड़ को देखा, इसलिए तुमने केले का ज़िक्र किया। लेकिन तुमने बिल्ली को नहीं देखा, तो तुमने कहा कि वहाँ एक बिल्ली है, ऐसा क्यों? चलो इस धुंधले धब्बे को देखते हैं जिसने तुम्हें भ्रमित किया।"
यह AI को अधिक पारदर्शी, भरोसेमंद और गलतियाँ होने पर सुधारने में आसान बनाता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।