Mechanistic Insights into Functional Sparsity in Multimodal LLMs via CoRe Heads
यह शोध पत्र प्रकट करता है कि मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स फंक्शनल स्पैरसिटी (functional sparsity) पर निर्भर करते हैं, जहाँ 'CoRe हेड्स' नामक अटेंशन हेड्स का एक विशिष्ट उपसमूह क्वेरी-प्रासंगिक विजुअल फीचर्स को निकालने के लिए महत्वपूर्ण है, जैसा कि उनके एब्लेशन (ablation) के दौरान प्रदर्शन पर पड़ने वाले महत्वपूर्ण प्रभाव और इन्फरेंस को तेज करने की उनकी क्षमता से प्रदर्शित होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
मुख्य विचार: भीड़ में "विशेष एजेंटों" की खोज
एक मल्टीमॉडल लार्ज लैंग्वेज मॉडल (MLLM) की कल्पना एक विशाल, हलचल भरे न्यूज़रूम के रूप में करें। इस न्यूज़रूम में हजारों रिपोर्टर (जिन्हें अटेंशन हेड्स कहा जाता है) एक साथ काम कर रहे हैं। उनका काम एक जटिल कहानी (टेक्स्ट प्रॉम्प्ट) को पढ़ना और एक अराजक दृश्य (एक इमेज या वीडियो) पर नज़र रखना है ताकि किसी विशिष्ट प्रश्न का उत्तर दिया जा सके।
आमतौर पर, हम सोचते हैं कि ये सभी रिपोर्टर समान रूप से मिलकर काम कर रहे हैं, और उत्तर खोजने के लिए पूरे कमरे को स्कैन कर रहे हैं। लेकिन इस पेपर ने एक आश्चर्यजनक बात खोजी: अधिकांश रिपोर्टर वास्तव में बिना किसी उद्देश्य के इधर-उधर देख रहे हैं या बैकग्राउंड के शोर (नॉइज़) को घूर रहे हैं।
इसके बजाय, लगभग 5% रिपोर्टरों का एक छोटा, विशिष्ट समूह है जो "स्पेशल एजेंट" के रूप में कार्य करता है। ये एजेंट ही एकमात्र ऐसे लोग हैं जिन्हें वास्तव में पता है कि विशिष्ट उत्तर खोजने के लिए कहाँ देखना है। लेखक इन्हें CoRe हेड्स (कॉन्टेक्स्ट-अवेयर रिट्रीवल हेड्स) कहते हैं।
जासूसी कार्य: उन्होंने एजेंटों को कैसे खोजा
इसे सिद्ध करने के लिए, शोधकर्ताओं ने अटेंशन मापने का एक नया तरीका विकसित किया जिसे RAM (रिट्रीवल अटेंशन मास) कहा जाता है।
- उपमा: कल्पना करें कि आप एक व्यस्त पार्किंग स्थल में एक विशिष्ट लाल कार को खोज रहे हैं।
- "बुरे" रिपोर्टर (बॉटम हेड्स): वे आकाश, फुटपाथ, चलते हुए लोगों और पेड़ों को देखते हैं। वे उस कार के अलावा हर चीज़ से विचलित हो जाते हैं।
- "CoRe" रिपोर्टर: वे आकाश और लोगों को अनदेखा कर देते हैं। वे अपनी नज़रें सीधे लाल कार पर टिका देते हैं।
शोधकर्ताओं ने मापा कि प्रत्येक "रिपोर्टर" ने सही वस्तु (लाल कार) पर कितना ध्यान दिया बनाम गलत चीजों पर। उन्होंने पाया कि CoRe हेड्स लगातार सीधे उत्तर की ओर इशारा करते थे, जबकि अन्य केवल "शोर" थे।
"क्या होगा अगर" प्रयोग: एजेंटों को हटाना
यह देखने के लिए कि क्या ये स्पेशल एजेंट वास्तव में आवश्यक थे, शोधकर्ताओं ने एक खतरनाक प्रयोग किया: उन्होंने उन्हें बंद कर दिया।
- परिणाम: जब उन्होंने केवल शीर्ष 5% सर्वश्रेष्ठ रिपोर्टरों (CoRe हेड्स) को चुप करा दिया, तो न्यूज़रूम ढह गया। मॉडल की सवाल पूछने की क्षमता नाटकीय रूप से गिर गई। यह बिल्कुल वैसा ही था जैसे भूलभुलैया से बाहर निकलने का रास्ता जानने वाले एकमात्र व्यक्ति को हटा देना और बाकी भीड़ से आपको रास्ता दिखाने के लिए कहना।
- विपरीत स्थिति: जब उन्होंने "विचलित" होने वाले रिपोर्टरों (नीचे के 95%) को बंद कर दिया, तो मॉडल लगभग ठीक से काम करता रहा। इससे साबित हुआ कि "शोर" करने वाले रिपोर्टर अनावश्यक (रिडंडेंट) थे, लेकिन "स्पेशल एजेंट" अनिवार्य थे।
"बॉटलनेक" की खोज
पेपर ने यह भी गौर किया कि जैसे-जैसे मॉडल बड़े होते गए (छोटे से विशाल की ओर), एक पैटर्न दिखाई दिया।
- छोटे मॉडल: स्पेशल एजेंट न्यूज़रूम में इधर-उधर बिखरे हुए थे, थोड़े अस्त-व्यस्त।
- बड़े मॉडल: जैसे-जैसे मॉडल बढ़ा, स्पेशल एजेंट इमारत के मध्य-से-देर वाले हिस्सों में एक विशिष्ट, सघन क्लस्टर (समूह) में चले गए। उन्होंने एक बॉटलनेक बनाया। मॉडल ने महसूस किया, "हे, हमें हर किसी को देखने की ज़रूरत नहीं है; हमें बस इस विशिष्ट टीम की ज़रूरत है जो इस विशिष्ट कमरे में रहकर भारी काम संभाल सके।"
सुपरपावर: गति बढ़ाना
चूंकि शोधकर्ताओं ने सिद्ध कर दिया कि 95% रिपोर्टर केवल "जगह भरने" के लिए हैं और महत्वपूर्ण काम नहीं कर रहे हैं, इसलिए उन्होंने मॉडल को तेज़ बनाने के लिए एक नई रणनीति आजमाई।
- रणनीति: उन्होंने 95% विचलित रिपोर्टरों से कहा, "अब आपको पूरे कमरे को देखने की ज़रूरत नहीं है। बस अपने ठीक सामने के क्षेत्र को देखें।" वहीं, उन्होंने 5% स्पेशल एजेंटों को पूरे कमरे को देखते रहने दिया।
- परिणाम: इससे मॉडल की सटीकता खोए बिना इसकी गति काफी बढ़ गई (2 गुना तक)। यह ऐसा है जैसे भीड़ को कमरे के आर-पार चिल्लाने के बजाय केवल अपने पड़ोसियों से फुसफुसाकर बात करने के लिए कहना, जबकि केवल कुछ विशेषज्ञ ही महत्वपूर्ण समाचार चिल्लाकर सुनाते हैं। संदेश अभी भी पहुँच जाता है, लेकिन अराजकता (और इसमें लगने वाला समय) खत्म हो जाता है।
सारांश
यह पेपर बताता है कि मल्टीमॉडल AI मॉडल वास्तव में उत्तर खोजने के लिए अपनी पूरी दिमागी शक्ति का उपयोग नहीं कर रहे हैं। वे विजुअल सुराग खोजने के वास्तविक काम के लिए एक छोटी, विशिष्ट टीम (Co-Re हेड्स) पर निर्भर करते हैं, जबकि बाकी नेटवर्क केवल लाइट चालू रखने में मदद करता है। इस छोटी टीम की पहचान करने और उसे सुरक्षित रखने के साथ-साथ बाकी के काम को सरल बनाकर, हम इन AI मॉडल्स को काफी तेज़ और अधिक कुशल बना सकते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।