← नवीनतम पेपर
💬 NLP

Mechanistic Insights into Functional Sparsity in Multimodal LLMs via CoRe Heads

यह शोध पत्र प्रकट करता है कि मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स फंक्शनल स्पैरसिटी (functional sparsity) पर निर्भर करते हैं, जहाँ 'CoRe हेड्स' नामक अटेंशन हेड्स का एक विशिष्ट उपसमूह क्वेरी-प्रासंगिक विजुअल फीचर्स को निकालने के लिए महत्वपूर्ण है, जैसा कि उनके एब्लेशन (ablation) के दौरान प्रदर्शन पर पड़ने वाले महत्वपूर्ण प्रभाव और इन्फरेंस को तेज करने की उनकी क्षमता से प्रदर्शित होता है।

मूल लेखक: Ruoxi Sun, Quantong Qiu, Juntao Li, Zecheng Tang, Yihang Lou, Min Zhang

प्रकाशित 2026-06-05
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Ruoxi Sun, Quantong Qiu, Juntao Li, Zecheng Tang, Yihang Lou, Min Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

मुख्य विचार: भीड़ में "विशेष एजेंटों" की खोज

एक मल्टीमॉडल लार्ज लैंग्वेज मॉडल (MLLM) की कल्पना एक विशाल, हलचल भरे न्यूज़रूम के रूप में करें। इस न्यूज़रूम में हजारों रिपोर्टर (जिन्हें अटेंशन हेड्स कहा जाता है) एक साथ काम कर रहे हैं। उनका काम एक जटिल कहानी (टेक्स्ट प्रॉम्प्ट) को पढ़ना और एक अराजक दृश्य (एक इमेज या वीडियो) पर नज़र रखना है ताकि किसी विशिष्ट प्रश्न का उत्तर दिया जा सके।

आमतौर पर, हम सोचते हैं कि ये सभी रिपोर्टर समान रूप से मिलकर काम कर रहे हैं, और उत्तर खोजने के लिए पूरे कमरे को स्कैन कर रहे हैं। लेकिन इस पेपर ने एक आश्चर्यजनक बात खोजी: अधिकांश रिपोर्टर वास्तव में बिना किसी उद्देश्य के इधर-उधर देख रहे हैं या बैकग्राउंड के शोर (नॉइज़) को घूर रहे हैं।

इसके बजाय, लगभग 5% रिपोर्टरों का एक छोटा, विशिष्ट समूह है जो "स्पेशल एजेंट" के रूप में कार्य करता है। ये एजेंट ही एकमात्र ऐसे लोग हैं जिन्हें वास्तव में पता है कि विशिष्ट उत्तर खोजने के लिए कहाँ देखना है। लेखक इन्हें CoRe हेड्स (कॉन्टेक्स्ट-अवेयर रिट्रीवल हेड्स) कहते हैं।

जासूसी कार्य: उन्होंने एजेंटों को कैसे खोजा

इसे सिद्ध करने के लिए, शोधकर्ताओं ने अटेंशन मापने का एक नया तरीका विकसित किया जिसे RAM (रिट्रीवल अटेंशन मास) कहा जाता है।

  • उपमा: कल्पना करें कि आप एक व्यस्त पार्किंग स्थल में एक विशिष्ट लाल कार को खोज रहे हैं।
    • "बुरे" रिपोर्टर (बॉटम हेड्स): वे आकाश, फुटपाथ, चलते हुए लोगों और पेड़ों को देखते हैं। वे उस कार के अलावा हर चीज़ से विचलित हो जाते हैं।
    • "CoRe" रिपोर्टर: वे आकाश और लोगों को अनदेखा कर देते हैं। वे अपनी नज़रें सीधे लाल कार पर टिका देते हैं।

शोधकर्ताओं ने मापा कि प्रत्येक "रिपोर्टर" ने सही वस्तु (लाल कार) पर कितना ध्यान दिया बनाम गलत चीजों पर। उन्होंने पाया कि CoRe हेड्स लगातार सीधे उत्तर की ओर इशारा करते थे, जबकि अन्य केवल "शोर" थे।

"क्या होगा अगर" प्रयोग: एजेंटों को हटाना

यह देखने के लिए कि क्या ये स्पेशल एजेंट वास्तव में आवश्यक थे, शोधकर्ताओं ने एक खतरनाक प्रयोग किया: उन्होंने उन्हें बंद कर दिया।

  • परिणाम: जब उन्होंने केवल शीर्ष 5% सर्वश्रेष्ठ रिपोर्टरों (CoRe हेड्स) को चुप करा दिया, तो न्यूज़रूम ढह गया। मॉडल की सवाल पूछने की क्षमता नाटकीय रूप से गिर गई। यह बिल्कुल वैसा ही था जैसे भूलभुलैया से बाहर निकलने का रास्ता जानने वाले एकमात्र व्यक्ति को हटा देना और बाकी भीड़ से आपको रास्ता दिखाने के लिए कहना।
  • विपरीत स्थिति: जब उन्होंने "विचलित" होने वाले रिपोर्टरों (नीचे के 95%) को बंद कर दिया, तो मॉडल लगभग ठीक से काम करता रहा। इससे साबित हुआ कि "शोर" करने वाले रिपोर्टर अनावश्यक (रिडंडेंट) थे, लेकिन "स्पेशल एजेंट" अनिवार्य थे।

"बॉटलनेक" की खोज

पेपर ने यह भी गौर किया कि जैसे-जैसे मॉडल बड़े होते गए (छोटे से विशाल की ओर), एक पैटर्न दिखाई दिया।

  • छोटे मॉडल: स्पेशल एजेंट न्यूज़रूम में इधर-उधर बिखरे हुए थे, थोड़े अस्त-व्यस्त।
  • बड़े मॉडल: जैसे-जैसे मॉडल बढ़ा, स्पेशल एजेंट इमारत के मध्य-से-देर वाले हिस्सों में एक विशिष्ट, सघन क्लस्टर (समूह) में चले गए। उन्होंने एक बॉटलनेक बनाया। मॉडल ने महसूस किया, "हे, हमें हर किसी को देखने की ज़रूरत नहीं है; हमें बस इस विशिष्ट टीम की ज़रूरत है जो इस विशिष्ट कमरे में रहकर भारी काम संभाल सके।"

सुपरपावर: गति बढ़ाना

चूंकि शोधकर्ताओं ने सिद्ध कर दिया कि 95% रिपोर्टर केवल "जगह भरने" के लिए हैं और महत्वपूर्ण काम नहीं कर रहे हैं, इसलिए उन्होंने मॉडल को तेज़ बनाने के लिए एक नई रणनीति आजमाई।

  • रणनीति: उन्होंने 95% विचलित रिपोर्टरों से कहा, "अब आपको पूरे कमरे को देखने की ज़रूरत नहीं है। बस अपने ठीक सामने के क्षेत्र को देखें।" वहीं, उन्होंने 5% स्पेशल एजेंटों को पूरे कमरे को देखते रहने दिया।
  • परिणाम: इससे मॉडल की सटीकता खोए बिना इसकी गति काफी बढ़ गई (2 गुना तक)। यह ऐसा है जैसे भीड़ को कमरे के आर-पार चिल्लाने के बजाय केवल अपने पड़ोसियों से फुसफुसाकर बात करने के लिए कहना, जबकि केवल कुछ विशेषज्ञ ही महत्वपूर्ण समाचार चिल्लाकर सुनाते हैं। संदेश अभी भी पहुँच जाता है, लेकिन अराजकता (और इसमें लगने वाला समय) खत्म हो जाता है।

सारांश

यह पेपर बताता है कि मल्टीमॉडल AI मॉडल वास्तव में उत्तर खोजने के लिए अपनी पूरी दिमागी शक्ति का उपयोग नहीं कर रहे हैं। वे विजुअल सुराग खोजने के वास्तविक काम के लिए एक छोटी, विशिष्ट टीम (Co-Re हेड्स) पर निर्भर करते हैं, जबकि बाकी नेटवर्क केवल लाइट चालू रखने में मदद करता है। इस छोटी टीम की पहचान करने और उसे सुरक्षित रखने के साथ-साथ बाकी के काम को सरल बनाकर, हम इन AI मॉडल्स को काफी तेज़ और अधिक कुशल बना सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →