TOPS: First-Principles Visual Token Pruning via Constructing Token Optimal Preservation Sets for Efficient MLLM Inference
यह शोध पत्र TOPS को प्रस्तुत करता है, जो एक प्रशिक्षण-मुक्त (training-free) और मॉडल-अज्ञेय (model-agnostic) विज़ुअल टोकन प्रूनिंग विधि है, जो कार्य प्रासंगिकता, सूचना कवरेज और अर्थ संबंधी विविधता के आधार पर इष्टतम संरक्षण सेटों का निर्माण करती है ताकि प्रदर्शन को बनाए रखते हुए या वास्तव में उसे बढ़ाते हुए MLLM अनुमान दक्षता में महत्वपूर्ण सुधार किया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास किताबों का एक विशाल पुस्तकालय है (विजुअल टोकन) जिसे एक सुपर-स्मार्ट रोबोट (मल्टीमॉडल लार्ज लैंग्वेज मॉडल) को किसी प्रश्न का उत्तर देने के लिए पढ़ना है। समस्या यह है कि पुस्तकालय इतना विशाल है कि रोबोट अभिभूत हो जाता है, उसे पढ़ने में बहुत समय लगता है, और पन्ने पलटने में ही उसकी सारी ऊर्जा खत्म हो जाती है।
लंबे समय तक, लोगों ने रोबोट की मदद करने की कोशिश की और उसे कहा, "बस उबाऊ पन्नों को छोड़ दो!" लेकिन पुराने तरीके थोड़े अनाड़ी थे:
- "अटेंशन" (Attention) विधि: यह एक ऐसे रोबोट की तरह थी जो केवल उन पन्नों को देखती थी जिनमें सबसे बड़े और गहरे फोंट थे। वह अक्सर महत्वपूर्ण विवरणों को छोड़ देती थी क्योंकि वे छोटे टेक्स्ट में लिखे होते थे, या वह एक ही पैराग्राफ को पाँच बार पढ़ती रहती थी क्योंकि वह दिखने में समान था।
- "डाइवर्सिटी" (Diversity) विधि: यह एक ऐसे रोबोट की तरह थी जो उन पन्नों को चुनने की कोशिश करती थी जो एक-दूसरे से अलग दिखते हों। वह बिल्ली के बारे में एक पन्ना और कार के बारे में एक पन्ना चुन सकती थी, लेकिन वह गलती से उस पन्ने को फेंक सकती थी जो वास्तव में उपयोगकर्ता के विशिष्ट प्रश्न का उत्तर देता था।
TOPS से मिलिए: स्मार्ट लाइब्रेरियन
यह पेपर TOPS (टोकन ऑप्टिमल प्रिजर्वेशन सेट्स) नामक एक नई विधि पेश करता है। केवल यह अनुमान लगाने के बजाय कि किन पन्नों को रखना है, TOPS एक अत्यधिक संगठित, प्रथम-सिद्धांतों (first-principles) वाले लाइब्रेरियन की तरह काम करता है जो यह तय करने से पहले कि कौन सा पन्ना शेल्फ पर रहेगा, तीन विशिष्ट प्रश्न पूछता है:
- "क्या यह पन्ना प्रश्न के लिए प्रासंगिक है?" (टास्क रेलेवेंस/कार्य प्रासंगिकता)
- उपमा: यदि उपयोगकर्ता पूछता है, "कार का रंग क्या है?", तो लाइब्रेरियन तुरंत समझ जाता है कि उसे कार वाला पन्ना रखना है और आसमान वाले पन्ने को फेंक देना है।
- "क्या यह पन्ना नई जानकारी देता है?" (इन्फॉर्मेशन कवरेज/सूचना कवरेज)
- उपमा: यदि हमारे पास पहले से ही कार के लाल पेंट का वर्णन करने वाला एक पन्ना है, तो हमें दूसरे पन्ने की आवश्यकता नहीं है जो बिल्कुल वही बात कहता हो। हमें एक ऐसे पन्ने की आवश्यकता है जो हमें कुछ नया बताए, जैसे कि कार का लाइसेंस प्लेट नंबर।
- "क्या यह पन्ना चुने गए अन्य पन्नों से अद्वितीय है?" (सिमेंटिक डाइवर्सिटी/अर्थगत विविधता)
- उपमा: हम पाँच पन्नों का ढेर नहीं चाहते जो सभी कहते हों "कार लाल है।" हमें एक पन्ना चाहिए जो कहता हो "लाल," एक जो कहता हो "तेज़," और एक जो कहता हो "पुरानी।" यह सुनिश्चित करता है कि हमें पूरी तस्वीर मिले बिना दोहराव के।
वास्तविक जीवन में यह कैसे काम करता है
पेपर दिखाता है कि TOPS को सिखाने की आवश्यकता नहीं होती है (यह "ट्रेनिंग-फ्री" है)। इसे विभिन्न रोबोट दिमागों (जैसे LLaVA, Qwen, या InternVL) में लगाया जा सकता है और यह तुरंत काम करता है।
- "दो-चरणीय" (Two-Stage) सफाई: कल्पना कीजिए कि रोबोट एक लंबी वीडियो पढ़ रहा है।
- चरण 1: TOPS एक त्वरित जांच करता है, स्पष्ट कचरे (जैसे खाली फ्रेम या धुंधले शॉट्स) को फेंक देता है, इससे पहले कि रोबोट गहराई से सोचना शुरू करे।
- चरण 2: जैसे-जैसे रोबोट पढ़ता है, TOPS बातचीत पर कड़ी नज़र रखता है। यदि रोबोट किसी विशिष्ट विवरण के बारे में बात करने लगता है, तो TOPS सुनिश्चित करता है कि सबसे प्रासंगिक विजुअल पन्ने अभी भी वहीं हों, जिससे चयन को उस विशिष्ट प्रश्न के लिए एकदम सटीक बनाने के लिए परिष्कृत किया जा सके।
परिणाम: कम ही अधिक है
पेपर दावा करता है कि इस स्मार्ट, तीन-प्रश्न दृष्टिकोण का उपयोग करके, TOPS 90% तक के विजुअल पन्नों (टोकन) को फेंक सकता है और रोबally अभी भी उतना ही अच्छा उत्तर देता है जितना कि उसने सब कुछ पढ़ने के बाद दिया होता।
- जादुई आंकड़ा: एक विशिष्ट मॉडल (LLaVA-NeXT) पर, TOPS ने 77.8% विजुअल डेटा हटा दिया लेकिन वास्तव में रोबोट के प्रदर्शन में थोड़ा सुधार (100.6%) किया।
- क्यों? पेपर सुझाव देता है कि रोबोट को "फालतू" और दोहराव वाले पन्नों को अनदेखा करने के लिए मजबूर करके, यह वास्तव में रोबोट को भ्रमित होने या मनगढ़ंत तथ्य (hallucinations) बनाने से रोकता है। यह एक बिखरी हुई मेज को साफ करने जैसा है; कभी-कभी, कम कागज होने से आपको सही चीज़ खोजने में मदद मिलती है और अधिक स्पष्ट रूप से सोचने में मदद मिलती है।
सारांश में
TOPS एक नए तरीके के रूप में है जो AI मॉडल्स को तेज़ और स्मार्ट बनाकर एक सख्त, स्मार्ट संपादक बनाता है। केवल "सबसे तेज़" या "सबसे अलग" दिखने वाले विजुअल संकेतों को चुनने के बजाय, यह संकेतों का एक आदर्श, संक्षिप्त सेट बनाता है जो प्रश्न के लिए प्रासंगिक हैं, आवश्यक जानकारी को कवर करते हैं, और एक-दूसरे को दोहराते नहीं हैं। परिणाम यह है कि एक रोबोट तेज़ी से सोचता है, कम मेमोरी का उपयोग करता है, और बेहतर उत्तर देता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।