← नवीनतम पेपर
💻 computer science

Where MLLMs Attend and What They Rely On: Explaining Autoregressive Token Generation

यह शोध पत्र EAGLE को प्रस्तुत करता है, जो एक हल्का ब्लैक-बॉक्स फ्रेमवर्क है जो मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स में ऑटोरेग्रेसिव टोकन जनरेशन की व्याख्या विशिष्ट विजुअल क्षेत्रों को निर्णयों के लिए उत्तरदायी मानकर और विजुअल एविडेंस एवं लैंग्वेज प्रायर्स के बीच संतुलन को मात्रात्मक रूप से मापकर करता है, जिससे कम कम्प्यूटेशनल लागत के साथ बेहतर फेथफुलनेस, लोकलाइजेशन और हेलुसिनेशन डायग्नोसिस प्राप्त होता है।

मूल लेखक: Ruoyu Chen, Xiaoqing Guo, Kangwei Liu, Siyuan Liang, Shiming Liu, Qunli Zhang, Laiyuan Wang, Hua Zhang, Xiaochun Cao

प्रकाशित 2026-03-19
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ruoyu Chen, Xiaoqing Guo, Kangwei Liu, Siyuan Liang, Shiming Liu, Qunli Zhang, Laiyuan Wang, Hua Zhang, Xiaochun Cao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपका एक बहुत ही बुद्धिमान, लेकिन थोड़ा रहस्यमय, रोबोट मित्र है जिसका नाम EAGLE है। यह रोबोट चित्रों को देखने और उन्हें वाक्यों में वर्णित करने में माहिर है (जैसे, "एक केले के पेड़ पर एक बिल्ली बैठी है")। लेकिन कभी-कभी, यह अपनी ओर से बातें बना लेता है (hallucinations), या यह बताना मुश्किल हो जाता है कि इसने ऐसा क्यों कहा।

यह पेपर EAGLE को पेश करता है, जो इन AI रोबोटों के लिए एक "डिटेक्टिव" (जासूस) के रूप में डिज़ाइन किया गया एक नया टूल है। यह दो बड़े सवालों के जवाब देता है:

  1. रोबोट ने कहाँ देखा? (किस हिस्से की वजह से इसने "बिल्ली" कहा?)
  2. यह किस पर निर्भर था? (क्या इसने वास्तव में बिल्ली को देखा, या इसने सिर्फ इसलिए अंदाज़ा लगाया क्योंकि यह एक आम वाक्य है?)

यहाँ बताया गया है कि यह कैसे काम करता है, कुछ मज़ेदार उपमाओं (analogies) का उपयोग करते हुए।

1. समस्या: "ब्लैक बॉक्स" का रहस्य

कल्पना कीजिए कि आपने एक शेफ से कोई व्यंजन बनाने को कहा। वे आपको एक स्वादिष्ट भोजन परोसते हैं, लेकिन वे आपको यह नहीं बताते कि उन्होंने किन सामग्रियों का उपयोग किया या किस क्रम में किया। आपको संदेह हो सकता है कि उन्होंने नमक का उपयोग किया है, लेकिन शायद उन्होंने चीनी का उपयोग किया हो।

  • MLLMs (मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स) उसी शेफ की तरह हैं। वे एक चित्र देखते हैं और एक कहानी लिखते हैं।
  • समस्या: कभी-कभी वे झूठ बोलते हैं (hallucinate)। यदि वे कहते हैं, "तस्वीर में एक कुत्ता है," लेकिन वहाँ कोई कुत्ता नहीं है, तो हमें जानने की ज़रूरत है कि उन्हें ऐसा क्यों लगा। पुराने टूल्स शेफ के मस्तिष्क तरंगों (आंतरिक गणित) को देखकर अनुमान लगाने की कोशिश करते थे, लेकिन वह बहुत उलझा हुआ और अक्सर गलत होता है।

2. समाधान: "लेगो ब्लॉक" डिटेक्टिव

EAGLE को रोबोट के दिमाग के अंदर देखने की ज़रूरत नहीं है। यह रोबोट के साथ एक ब्लैक बॉक्स (आप इसके अंदर नहीं देख सकते, आप बस चीज़ें डालते हैं और परिणाम प्राप्त करते हैं) की तरह व्यवहार करता है।

यह कैसे काम करता है:
कल्पना कीजिए कि तस्वीर 100 छोटे लेगो ब्लॉक्स (छवि के छोटे टुकड़े) से बनी एक विशाल पहेली है।

  • चरण 1: आँखों पर पट्टी वाला टेस्ट (The Blindfold Test)। EAGLE अधिकांश लेगो ब्लॉक्स को ढक देता है, जिससे केवल कुछ ही दिखाई देते हैं। यह रोबोट से पूछता है: "क्या तुम अभी भी तस्वीर का वर्णन कर सकते हो?"
  • चरण 2: "इनसाइट" स्कोर (The "Enough" Test)। EAGLE उन लेगो ब्लॉक्स के सबसे छोटे समूह को खोजने की कोशिश करता है, जिन्हें दिखाने पर रोबोट बिल्कुल वही वाक्य बोलेगा जो पहले बोला था।
    • उपमा: यदि आप रोबोट को केवल "बिल्ली का कान" और "पूंछ" दिखाते हैं, और वह फिर भी "बिल्ली" कहता है, तो वे Insight ब्लॉक्स हैं। वे काम करने के लिए पर्याप्त हैं।
  • चरण 3: "नेसेसिटी" स्कोर (The "Need" Test)। इसके बाद EAGLE एक पूरी तस्वीर लेता है और एक-एक करके ब्लॉक्स को हटाना शुरू करता है। वह देखता है कि कौन सा ब्लॉक हटाने पर रोबotong कहना बंद कर देता है कि "बिल्ली"।
    • उपमा: यदि आप "बिल्ली का शरीर" हटा देते हैं और रोबोट अचानक कहता है "मुझे कुछ दिखाई नहीं दे रहा," तो वह ब्लॉक Necessary (आवश्यक) था।

इन दोनों टेस्टों को मिलाकर, EAGLE एक हीट मैप (Heat Map) बनाता है। यह छवि के उन विशिष्ट हिस्सों को उजागर करता है जो वास्तव में मायने रखते थे।

3. ट्विस्ट: "अंदाज़ा लगाना" बनाम "देखना"

यह सबसे चतुर हिस्सा है। EAGLE यह भी पता लगाता है कि रोबोट चीज़ों को देख रहा है या केवल अपनी भाषा के ज्ञान के आधार पर अंदाज़ा लगा रहा है।

  • परिदृश्य: रोबोट कहता है, "आदमी ने एक कॉफी कप पकड़ा हुआ है।"
  • टेस्ट: EAGLE धीरे-धीरे तस्वीर को रोबोट के सामने प्रकट करता है।
    • यदि रोबोट एक "विजुअल लर्नर" (दृश्य शिक्षार्थी) है: जैसे ही कॉफी कप दिखाई देता है, रोबोट का आत्मविश्वास बहुत बढ़ जाता है। उसे शब्द बोलने के लिए कप को देखने की ज़रूरत होती है।
    • यदि रोबोट एक "लैंग्वेज गेसर" (भाषा का अंदाज़ा लगाने वाला) है: रोबोट तब भी "कॉफी कप" कहता है जब तस्वीर पूरी तरह से काली होती है! वह सिर्फ इसलिए अंदाज़ा लगा रहा है क्योंकि कहानियों में "आदमी" और "कॉफी कप" अक्सर साथ आते हैं।
  • परिणाम: EAGLE आपको बता सकता है: "हे, यह शब्द जो उसने देखा (Visual Evidence) उस पर आधारित था, लेकिन वह दूसरा शब्द सिर्फ एक भाग्यशाली अंदाज़ा (Language Prior) था।"

4. यह एक बड़ी बात क्यों है?

इस पेपर ने कई लोकप्रिय AI मॉडल्स पर EAGLE का परीक्षण किया और पाया कि यह अब तक का सबसे अच्छा जासूस है।

  • यह अधिक सटीक है: पुराने टूल्स अक्सर छवि के गलत हिस्सों की ओर इशारा करते थे (जैसे कार के बारे में बात करते समय आकाश को हाइलाइट करना)। EAGLE कार की ओर इशारा करता है।
  • यह झूठ पकड़ता है: जब एक रोबोट भ्रमित होता है (एक ऐसा कुत्ता बना देता है जो वहाँ नहीं है), तो EAGLE ठीक से बता सकता है कि किस अजीब पिक्सेल पैच ने रोबोट को भ्रमित किया। यह उस "स्मोकिंग गन" (सबूत) को खोजने जैसा है जिसने झूठ का कारण बना।
  • यह पैसे बचाता है: इसे चलाने के लिए बहुत महंगे कंप्यूटर की आवश्यकता नहीं है। यह हल्का और कुशल है।

सारांश

EAGLE को AI के लिए एक सत्य बताने वाले अनुवादक (truth-telling translator) के रूप में सोचें।

  • पहले, हमें AI पर आँख मूँदकर भरोसा करना पड़ता था।
  • अब, EAGLE हमें यह कहने की अनुमति देता है, "ठीक है, मैं समझ गया कि तुमने ऐसा क्यों कहा। तुमने केले के पेड़ को देखा, इसलिए तुमने केले का ज़िक्र किया। लेकिन तुमने बिल्ली को नहीं देखा, तो तुमने कहा कि वहाँ एक बिल्ली है, ऐसा क्यों? चलो इस धुंधले धब्बे को देखते हैं जिसने तुम्हें भ्रमित किया।"

यह AI को अधिक पारदर्शी, भरोसेमंद और गलतियाँ होने पर सुधारने में आसान बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →