AsymVLM: Asymmetric Token Pruning for Efficient Vision-Language Model Inference
AsymVLM एक कुशल विजन-लैंग्वेज मॉडल इन्फरेंस फ्रेमवर्क है जो स्थानिक रूप से अनावश्यक विजन टोकन पर आक्रामक, अनुकूली प्रूनिंग (pruning) और टेक्स्ट टोकन के लिए टेम्पोरल थ्रेशोल्ड-आधारित इविक्शन (eviction) को लागू करके विजुअल और टेक्स्ट मोडैलिटीज के विशिष्ट गुणों का लाभ उठाता है, जिससे दस्तावेज़ और चार्ट समझ के कार्यों पर अत्याधुनिक तरीकों से बेहतर प्रदर्शन करते हुए 54% तक FLOPs की बचत प्राप्त होती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
एक विजन-लैंग्वेज मॉडल (VLM) की कल्पना एक अत्यधिक बुद्धिमान लेकिन थोड़े परेशान असिस्टेंट के रूप में करें। आप उसे एक तस्वीर दिखाते हैं (जैसे कि कोई जटिल दस्तावेज़ या चार्ट) और उससे एक सवाल पूछते हैं। तस्वीर को समझने के लिए, वह असिस्टेंट उसे हज़ारों छोटे पहेली के टुकड़ों में तोड़ देता है जिन्हें "विज़न टोकन" (vision tokens) कहा जाता है। आपके सवाल को समझने और उत्तर तैयार करने के लिए, वह "टेक्स्ट टोकन्स" (text tokens) का एक छोटा सेट उपयोग करता है।
समस्या यह है कि असिस्टेंट की "वर्किंग मेमोरी" (उसका GPU मेमोरी) जाम हो जाती है। वह हर एक पहेली के टुकड़े और उसके द्वारा लिखे गए हर शब्द को थामे रखने की कोशिश करता है, जिससे यह चलाने में धीमा और महंगा हो जाता है।
मौजूदा तरीके इसे ठीक करने के लिए चित्र के टुकड़ों और शब्दों के साथ बिल्कुल एक जैसा व्यवहार करते हैं: वे बस सब कुछ का एक निश्चित प्रतिशत हटा देते हैं (जैसे, "50% पहेली के टुकड़े और 50% शब्द हटा दें")। इस पेपर के लेखक, AsymVLM, तर्क देते हैं कि यह एक लाइब्रेरी को व्यवस्थित करने के समान है जहाँ आप बिना सोचे-समझे आधी किताबें और आधे बुकमार्क फेंक देते हैं, बिना यह देखे कि वे वास्तव में क्या काम करते हैं।
AsymVLM कैसे काम करता है, इसके लिए सरल उपमाओं का उपयोग किया गया है:
1. दो अलग-अलग समस्याएँ
पेपर बताता है कि चित्र के टुकड़े और शब्द मौलिक रूप से भिन्न हैं:
- विज़न टोकन्स (पहेली के टुकड़े): ये सभी स्वतंत्र हैं। यदि आप एक फोटो से आकाश का एक हिस्सा हटा देते हैं, तो उसके बगल वाले पेड़ के टुकड़े को कोई फर्क नहीं पड़ता। ये "स्थानिक रूप से अनावश्यक" (spatially redundant) हैं, जिसका अर्थ है कि कई टुकड़े केवल बैकग्राउंड शोर (background noise) हैं।
- टेक्स्ट टोकन्स (कहानी): यह एक श्रृंखला की तरह है। शब्द 2, शब्द 1 पर निर्भर है, और शब्द 3, शब्द 2 पर निर्भर है। यदि आप एक वाक्य के बीच में से एक शब्द हटा देते हैं, तो बाकी कहानी का कोई अर्थ नहीं रह जाएगा।
2. समाधान: एक दो-आयामी रणनीति
एक ही नियम सबके लिए लागू करने के बजाय, AsymVLM प्रत्येक प्रकार के टोकन के लिए विशेष रूप से तैयार की गई दो अलग-अलग रणनीतियों का उपयोग करता है।
रणनीति A: चित्रों के लिए "स्मार्ट एडिटर" (विज़न टोकन प्रूनिंग)
इससे पहले कि असिस्टेंट सोचना शुरू करे, AsymVLM एक स्मार्ट एडिटर की तरह फोटो को देखता है।
- पुराना तरीका: "रैंडमली 50% पिक्सल हटा दें" या "उन हिस्सों को हटा दें जो सवाल के लिए कम महत्वपूर्ण दिखते हैं।"
- AsymVLM का तरीका: यह एक लर्नड स्कोरर (Learned Scorer) का उपयोग करता है। कल्पना कीजिए कि एक कोच है जिसने हज़ारों मैच देखे हैं और वह ठीक जानता है कि कौन से खिलाड़ी (टोकन) वास्तव में मैच जीतने में मदद करते हैं। यह स्कोरर केवल चित्र को नहीं देखता; यह यह भी देखता है कि चित्र आपके द्वारा पूछे गए विशिष्ट प्रश्न से कैसे जुड़ता है।
- "एडेप्टिव बजट" (Adaptive Budget): यह सबसे चतुर हिस्सा है। पेपर नोट करता है कि कुछ सवालों के लिए पूरी इमेज को स्कैन करने की आवश्यकता होती है (जैसे, "इस बाग में कितने सेब हैं?"), जबकि अन्य के लिए केवल एक छोटे से हिस्से की आवश्यकता होती है (जैसे, "लाल सेब की कीमत क्या है?")।
- यदि सवाल किसी एक छोटे क्षेत्र के लिए विशिष्ट है, तो महत्वपूर्ण और अनावश्यक टुकड़ों के बीच का "अंतर" बहुत बड़ा होता है। सिस्टम कहता है, "बहुत अच्छा, हम आक्रामक हो सकते हैं और 75% चित्र को हटा सकते हैं!"
- यदि सवाल के लिए पूरी इमेज की आवश्यकता है, तो "अंतर" छोटा होता है। सिस्टम कहता है, "ठीक है, सुरक्षित रहने के लिए 90% चित्र को रखें।"
- उपमा: यह एक सूटकेस पैक करने जैसा है। यदि आप एक दिन के लिए समुद्र तट पर जा रहे हैं, तो आप हल्का सामान पैक करते हैं। यदि आप एक महीने की यात्रा पर जा रहे हैं, तो आप अधिक सामान पैक करते हैं। AsymVLM हर किसी के लिए एक ही सूटकेस का आकार उपयोग करने के बजाय, विशिष्ट यात्रा के आधार पर "पैकिंग" को समायोजित करता है।
रणनीति B: टेक्स्ट के लिए "मेमोरी सफाईकर्मी" (टेक्स्ट टोकन इविक्शन)
एक बार जब असिस्टेंट उत्तर देना शुरू करता है, तो वह एक-एक करके शब्द लिखता है। यदि बातचीत लंबी हो जाती है, तो मेमोरी भर जाती है।
- पुराना तरीका: टेक्स्ट-ओनली AI (जैसे H2O या StreamingLLM) के मानक तरीके नए शब्दों के लिए जगह बनाने के लिए पुराने या कम "महत्वपूर्ण" शब्दों को हटाने की कोशिश करते हैं।
- AsymVLM का तरीका: लेखकों ने महसूस किया कि इन विजुअल असिस्टेंट्स में, बातचीत आमतौर पर छोटी होती है और चित्र सबसे महत्वपूर्ण संदर्भ होता है।
- वे एक फिक्स्ड बजट निर्धारित करते हैं। असिस्टेंट तब तक लिखता रहता है जब तक कि वह एक सीमा (जैसे, 500 शब्द) तक नहीं पहुँच जाता।
- एक बार जब यह सीमा तक पहुँच जाता है, तो यह सबसे पुराने जनरेट किए गए शब्दों को हटाना शुरू कर देता है (वे शब्द जिनकी अब तत्काल अगली पंक्ति के लिए आवश्यकता नहीं है), लेकिन यह मूल चित्र या मूल प्रश्न को कभी नहीं हटाता है।
- उपमा: कल्पना कीजिए कि आप अपने दोस्त को एक कहानी सुना रहे हैं। वर्तमान वाक्य को पूरा करने के लिए आपको यह याद रखने की आवश्यकता नहीं है कि आपने 10 मिनट पहले पहला वाक्य क्या कहा था। AsymVLM एक सफाईकर्मी की तरह कार्य करता है जो नई पंक्ति के लिए जगह बनाने के लिए व्हाइटबोर्ड से पुराने, अप्रासंगिक ड्राफ्ट को साफ कर देता है, लेकिन वह मूल प्रॉम्प्ट और फोटो को हमेशा के लिए दीवार पर पिन किए हुए छोड़ देता है।
3. परिणाम: तेज़ और स्मार्ट
पेपर दावा करता है कि इन दोनों प्रकार के डेटा के साथ अलग-अलग व्यवहार करके, AsymVLM निम्नलिखित प्राप्त करता है:
- भारी गति (Massive Speedups): यह मॉडल चलाने के लिए आवश्यक कंप्यूटिंग पावर (FLOPs) में 54% तक की बचत करता है। ऐसा इसलिए है क्योंकि यह भारी गणित शुरू होने से पहले ही अनावश्यक चित्र के टुकड़ों को भौतिक रूप से हटा देता है, न कि केवल गणित के दौरान उन्हें अनदेखा करता है।
- बेहतर सटीकता (Better Accuracy): दस्तावेज़ पढ़ने या चार्ट समझने जैसे कार्यों पर, यह पिछले तरीकों की तुलना में वास्तव में 2-3% बेहतर प्रदर्शन करता है। ऐसा इसलिए है क्योंकि यह उन विशिष्ट चित्र के टुकड़ों को रखता है जो सवाल का जवाब देते हैं और बाकी को हटा देता है, जबकि अन्य तरीके गलती से महत्वपूर्ण टुकड़े को हटा सकते हैं।
- मेमोरी दक्षता (Memory Efficiency): यह मॉडल चलाने के लिए आवश्यक मेमोरी को कम करता है, जिससे इसे उन छोटे, सस्ते कंप्यूटर चिप्स पर चलाना संभव हो जाता है जो पूर्ण, अन-प्रून्ड (unpruned) मॉडल को नहीं संभाल सकते थे।
सारांश
AsymVLM एक ऐसा सिस्टम है जो यह समझता है कि "एक ही आकार सबके लिए उपयुक्त नहीं होता।" यह विशिष्ट प्रश्न के आधार पर छवियों से अनावश्यक हिस्सों को छाँटने के लिए एक स्मार्ट, एडेप्टिव फ़िल्टर का उपयोग करता है, और मूल संदर्भ को खोए बिना टेक्स्ट मेमोरी को प्रबंधित करने के लिए एक सावधान सफाईकर्मी के रूप में कार्य करता है। परिणाम एक ऐसा विजन-लैंग्वेज मॉडल है जो तेज़ है, कम मेमोरी का उपयोग करता है, और दस्तावेज़ों या चार्टों को पढ़ने में आश्चर्यजनक रूप से अधिक सटीक है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।