Capturing Token Tendencies for Training-Free Token Pruning in Multimodal Large Language Models
यह शोध पत्र ट्रेंड-अवेयर प्रूनिंग (Trend-aware Pruning) का प्रस्ताव करता है, जो मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स के लिए एक ट्रेनिंग-फ्री फ्रेमवर्क है जो महत्वपूर्ण विजुअल संकेतों के समयपूर्व नुकसान को रोकने के लिए परतों (layers) के माध्यम से टोकन महत्व के गतिशील विकास को मॉडल करके दक्षता में सुधार करता है, और प्रतिस्पर्धी प्रदर्शन बनाए रखते हुए 77.8% से अधिक टोकन कटौती प्राप्त करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक सुपर-स्मार्ट रोबोट को तस्वीरें दिखाकर और सवाल पूछकर दुनिया को समझना सिखाने की कोशिश कर रहे हैं। इस क्षेत्र को मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स (MLLMs) कहा जाता है। इन मॉडल्स को उन शानदार जासूसों के रूप में सोचें जो टेक्स्ट पढ़ सकते हैं और एक ही समय में छवियों को देख भी सकते हैं। किसी छवि को "देखने" के लिए, रोबोट उसे हजारों छोटे पहेली के टुकड़ों में तोड़ देता है जिन्हें "टोकन" कहा जाता है। प्रत्येक टोकन चित्र का एक छोटा सा हिस्सा होता है, जैसे नीले आसमान का एक टुकड़ा या कार का एक पहिया। समस्या यह है कि जब आप रोबोट को एक हाई-रेज़ोल्यूशन फोटो दिखाते हैं, तो वह बहुत सारे टुकड़ों से अभिभूत हो जाता है। वह हर एक टुकड़े पर ध्यान देने की कोशिश करता है, जिससे रोबोट धीमा, चलाने में महंगा और कभी-कभी शोर-शराबे के कारण भ्रमित भी हो जाता है।
इसे ठीक करने के लिए, वैज्ञानिकों ने एक सरल तरकीब आजमाई है: शुरुआत में ही उन टुकड़ों को फेंक देना जो महत्वहीन लगते हैं। यह एक क्लब के बाउंसर की तरह है जो भीड़ को देखता है और तुरंत उन लोगों को बाहर निकाल देता है जिन्होंने एक विशिष्ट रंग की शर्ट नहीं पहनी है। लेकिन यहाँ एक पेंच है: कभी-कभी कमरे में सबसे दिलचस्प व्यक्ति पहले साधारण शर्ट पहने होता है, लेकिन कुछ ही मिनटों बाद वह नाचने लगता है और पार्टी की जान बन जाता है। यदि बाउंसर उन्हें बहुत जल्दी बाहर निकाल देता है, तो पार्टी बर्बाद हो जाती है। यह पेपर एक बड़ा सवाल पूछता है: क्या केवल एक पल की झलक के आधार पर यह निर्णय लेना सुरक्षित है कि किसे रखना है, या हमें यह देखना चाहिए कि चीजें समय के साथ कैसे बदलती हैं?
इस पेपर के पीछे के शोधकर्ता, जीए मा (Jie Ma) और उनकी टीम का कहना है कि पुराना "बाउंसर" तरीका बहुत कठोर है। वे सोचने का एक नया तरीका प्रस्तावित करते हैं जिसे ट्रेंड-अवेयर प्रूनिंग (Trend-aware Pruning) कहा जाता है। केवल इस बात की स्नैपशॉट देखने के बजाय कि अभी कौन से टोकन महत्वपूर्ण हैं, उनका तरीका एक धैर्यवान पर्यवेक्षक की तरह काम करता है जो टोकनों को उनके "रुझानों" को देखने के लिए समय के साथ देखता है। उन्होंने महसूस किया कि कुछ टोकन देर से खिलने वाले फूलों की तरह होते; वे रोबोट के मस्तिष्क के शुरुआती परतों में शांत और महत्वहीन लग सकते हैं, लेकिन जैसे-जैसे रोबोट दृश्य को गहराई से प्रोसेस करता है, ये टोकन अचानक दृश्य को समझने के लिए महत्वपूर्ण हो जाते हैं।
टीम ने एक सिस्टम बनाया है जो इन टोकनों के "मोमेंटम" (गति) को ट्रैक करता है। एक नदी की कल्पना करें जहाँ कुछ चट्टानें बस वहीं पड़ी रहती हैं, लेकिन अन्य धीरे-धीरे धारा के केंद्र की ओर बह रही होती हैं। पुराने तरीके उन बहती हुई चट्टानों को अनदेखा कर देंगे क्योंकि वे अभी केंद्र में नहीं हैं। नया तरीका उस बहाव को नोटिस करता है। यह उन टोकनों पर नज़र रखता है जो "अपवर्ड ट्रेंड" (ऊपर की ओर बढ़ता रुझान) दिखा रहे हैं—यानी, उनकी महत्ता बढ़ रही है भले ही वे अभी शीर्ष प्राथमिकता न हों। यदि कोई टोकन गहराइयों में जाने पर अधिक दिलचस्प दिखने लगता है, तो सिस्टम उसे "बचा" लेता है, उसे बहुत देर होने से पहले बातचीत में वापस ले आता है। वे उन टोकनों पर भी नज़र रखते हैं जो "फ्लक्चुएट" (उतार-चढ़ाव) कर रहे हैं या "डाउनवर्ड-ट्रेंडिंग" (कम होते जा रहे) हैं, और प्रत्येक समूह के साथ अलग तरह से व्यवहार करते हैं, बजाय इसके कि उन सभी को सीधे बाहर फेंक दिया जाए।
जब उन्होंने इस विचार का परीक्षण लोकप्रिय रोबोटिक दिमाग जैसे LLaVA और Qwen पर किया, तो परिणाम प्रभावशाली थे। नया तरीका न केवल समय बचाता है; इसने वास्तव में रोबोट के प्रदर्शन को बेहतर बनाया। अपने प्रयोगों में, वे विजुअल टोकनों की संख्या को 77.8% से अधिक कम करने में सक्षम थे, जिससे अंतिम परत में प्रोसेस करने के लिए केवल लगभग 23 टोकन बचे। इतना सारा डेटा फेंकने के बावजूद, रोबोट ने टोकनों को आधा करने पर अपने मूल प्रदर्शन का 98.89% बनाए रखा, और टोकनों को लगभग 78% कम करने पर भी 96.03% का मजबूत प्रदर्शन बनाए रखा। यह एक बड़ी बात है क्योंकि अन्य तरीके जो शुरुआत में ही "टॉप" टोकनों को चुन लेते हैं, वे अक्सर महत्वपूर्ण विवरण खो देते हैं जब वे इतने आक्रामक होते हैं।
लेखकों का सुझाव है कि यह दृष्टिकोण इसलिए काम करता है क्योंकि यह इस तथ्य का सम्मान करता है कि किसी छवि को समझना एक यात्रा है, न कि एक एकल क्षण। रोबोट को अपना मन बदलने और उन टोकनों को "पुनः सक्रिय" करने की अनुमति देकर, जो शुरू में अनदेखे रह गए थे, वे महत्वपूर्ण सुरागों के नुकसान को रोकते हैं। उन्होंने पाया कि यह डायनेमिक दृष्टिकोण विशेष रूप से कठिन कार्यों जैसे कि छवियों में टेक्स्ट पढ़ना (OCR) या छोटी बारीकियों को पहचानना, जहाँ स्थिर (static) तरीके अक्सर विफल हो जाते हैं, के लिए बहुत अच्छा है। हालांकि वे स्वीकार करते हैं कि उनका सिस्टम अवलोकन की एक निश्चित विंडो (window) पर निर्भर करता है और इसे लंबे अनुक्रमों (sequences) को संभालने के लिए बेहतर बनाया जा सकता है, उनका काम यह दिखाता है कि अटेंशन के ट्रेंड को देखना स्मार्ट रोबोटों को बिना उन्हें शुरू से फिर से प्रशिक्षित किए, तेज़ और अधिक सटीक बनाने का एक शक्तिशाली तरीका है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।