← नवीनतम पेपर
💻 computer science

UniPrune: Unified Progressive Visual Token Pruning with Information-Aware Budget Allocation for Efficient LLaVA-Style Vision Language Models

UniPrune एक एकीकृत प्रगतिशील विज़ुअल टोकन प्रूनिंग फ्रेमवर्क है जो अत्यधिक संपीड़न अनुपातों पर भी LLaVA-शैली के विज़न लैंग्वेज मॉडल्स में बेहतर दक्षता और प्रदर्शन प्राप्त करने के लिए सूचना-जागरूक बजट आवंटन (Information-Aware Budget Allocation) और क्रॉस-स्टेज सूचना निरंतरता (Cross-Stage Information Continuity) तंत्रों द्वारा संवर्धित, एनकोडर-चरण के सिमेंटिक महत्व-विविधता प्रूनिंग (encoder-stage semantic importance-diversity pruning) को LLM-चरण के पिरामिड-आकार के ड्रॉपिंग (LLM-stage pyramid-shaped dropping) के साथ तालमेल बिठाकर जोड़ता है।

मूल लेखक: Jianhua Cui, Meizhou Ding, Ziru Niu, Wei Wang, Lifeng Han, Peng Zhao

प्रकाशित 2026-08-31
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jianhua Cui, Meizhou Ding, Ziru Niu, Wei Wang, Lifeng Han, Peng Zhao

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

आधुनिक कृत्रिम बुद्धिमत्ता (AI) प्रणालियाँ जो देख और बोल सकती हैं, वे उल्लेखनीय रूप से सक्षम होती जा रही हैं, फिर भी वे एक भारी कम्प्यूटेशनल बोझ वहन करती हैं। ये विजन-लैंग्वेज मॉडल एक छवि को डिजिटल टुकड़ों के एक लंबे अनुक्रम में बदलकर काम करते हैं, जिन्हें अक्सर 'टोकन' कहा जाता है, जो तस्वीर के विभिन्न हिस्सों का प्रतिनिधित्व करते हैं। एक मानक फोटोग्राफ को इन सैकड़ों टुकड़ों में विभाजित किया जा सकता है। सिस्टम फिर इस पूरे अनुक्रम को टेक्स्ट के साथ प्रोसेस करता है, ठीक वैसे ही जैसे कोई इंसान एक आरेख (डायग्राम) को देखते हुए वाक्य पढ़ रहा हो। समस्या यह है कि इन टुकड़ों को जोड़ने के लिए आवश्यक गणितीय संचालन उन टुकड़ों की संख्या बढ़ने के साथ तेजी से (exponentially) बढ़ते जाते हैं। यदि एक छवि 576 टोकन उत्पन्न करती है, तो कंप्यूटर को यह समझने के लिए भारी मात्रा में कार्य करना पड़ता है कि वे एक-दूसरे से कैसे संबंधित हैं, भले ही उनमें से कई टोकन अनावश्यक पृष्ठभूमि विवरणों जैसे कि एक खाली दीवार या आकाश के एक हिस्से का प्रतिनिधित्व करते हों। यह अक्षमता इन शक्तिशाली प्रणालियों को मानक हार्डवेयर पर चलाने या वीडियो विश्लेषण जैसे वास्तविक समय के कार्यों के लिए उपयोग करना कठिन बना देती है।

शोधकर्ताओं ने काम शुरू होने से पहले ही अनावश्यक टुकड़ों को हटाकर इसे हल करने की लंबे समय से कोशिश की है। कुछ विधियाँ बिल्कुल शुरुआत में एक फिल्टर की तरह कार्य करती हैं, जो केवल इस आधार पर टोकन को हटा देती हैं कि छवि कैसी दिखती है। अन्य विधियाँ तब तक प्रतीक्षा करती हैं जब तक कि सिस्टम टेक्स्ट और छवि को एक साथ प्रोसेस करना शुरू न कर दे, और फिर उन टुकड़ों को हटा देती हैं जो पूछे गए विशिष्ट प्रश्न के लिए अप्रासंगिक लगते हैं। हालाँकि, दोनों दृष्टिकोणों में एक कमी (blind spot) है। शुरुआती फिल्टर अक्सर महत्वपूर्ण विवरणों को फेंक देते हैं क्योंकि वे नहीं जानते कि उपयोगकर्ता क्या पूछ रहा है, जबकि बाद के फिल्टर किसी भी चीज़ को हटाने से पहले पूरी छवि को प्रोसेस करने में ऊर्जा बर्बाद करते हैं। एक नया अध्ययन एक एकीकृत दृष्टिकोण पेश करता है जो दोनों विधियों की शक्तियों को जोड़ता है, जिससे इन बुद्धिमान प्रणालियों के लिए एक अधिक कुशल मार्ग बनता है।

शोधकर्ताओं ने, जिसका नेतृत्व जियानहुआ कुई और मेइज़ोउ डिंग ने किया, UniPrune नामक एक फ्रेमवर्क विकसित किया, जो टोकन रिडक्शन (टोकन कम करने) को एक एकल घटना के बजाय एक दो-चरणीय यात्रा के रूप में मानता है। कल्पना कीजिए कि आप एक यात्रा के लिए सूटकेस पैक कर रहे हैं जहाँ आपको अभी तक सटीक मौसम का पता नहीं है। आप सब कुछ बस इसमें नहीं डालेंगे और उम्मीद नहीं करेंगे, न ही आप पूरा बैग पैक करने के बाद यह तय करने की कोशिश करेंगे कि क्या रखना है। इसके बजाय, आप पहले समान वस्तुओं को एक साथ समूहबद्ध कर सकते हैं और सबसे प्रतिनिधि वस्तुओं को रख सकते हैं, फिर, एक बार जब आपको अपनी मंजिल का पता चल जाता है, तो आप अधिक सटीक चयन करते हैं। यह अनिवार्य रूप से वही करता है जो UniPrune करता है। यह पहले विजुअल पैटर्न का उपयोग करके छवि डेटा की एक व्यापक सफाई करता है, और फिर, जैसे ही सिस्टम प्रश्न के संदर्भ को समझना शुरू करता है, यह एक दूसरी, अधिक सटीक सफाई करता है।

इस प्रक्रिया का पहला चरण छवि को स्कैन करने के तुरंत बाद होता है, इससे पहले कि लैंग्वेज मॉडल शामिल हो। सिस्टम विजुअल टोकन को उनकी समानता के आधार पर समूहों (clusters) में विभाजित करता है, ठीक वैसे ही जैसे मिश्रित फोटो के ढेर को उनके सामान्य विषय के आधार पर छाँटना। प्रत्येक समूह से, यह सबसे महत्वपूर्ण टोकन को रखता है और बाकी को हटा देता है। यह स्पष्ट अतिरेक (redundancies) को हटा देता है, जैसे कि एक ही नीले आकाश के टुकड़े का प्रतिनिधित्व करने वाले कई टोकन। हालाँकि, शोधकर्ताओं ने महसूस किया कि इस चरण में टोकन की संख्या को केवल आधा कर देना जोखिम भरा हो सकता है। यदि सिस्टम बहुत जल्दी बहुत आक्रामक तरीके से कटौती करता है, तो यह एक ऐसा टोकम खो सकता है जो बाद में एक विशिष्ट प्रश्न का उत्तर देने के लिए महत्वपूर्ण हो। इसे हल करने के लिए, उन्होंने एक डायनेमिक बजटिंग रणनीति पेश की। एक निश्चित नियम का उपयोग करने के बजाय कि इस पहले चरण में कितने टोकन रखने हैं, सिस्टम यह मापता है कि छवि कितनी जटिल है। एक सरल छवि जिसमें स्पष्ट विषय है, उसे कम बजट मिलता है, जबकि एक जटिल, व्यस्त दृश्य को अधिक टोकन रखने की अनुमति दी जाती है। यह सुनिश्चित करता है कि सिस्टम कठिन प्रश्नों को संभालने के लिए पर्याप्त विवरण बनाए रखे बिना सरल प्रश्नों पर ऊर्जा बर्बाद किए बिना।

एक बार यह प्रारंभिक चयन हो जाने के बाद, शेष टोकन को बड़े लैंग्वेज मॉडल को पास कर दिया जाता है, जो उन्हें टेक्स्ट के साथ प्रोसेस करना शुरू करता है। यहाँ, सिस्टम एक दूसरी प्रूनिंग (छंटनी) रणनीति का उपयोग करता है जो एक पिरामिड की तरह काम करती है। जैसे-जैसे डेटा मॉडल की गहरी परतों में जाता है, सिस्टम धीरे-धीरे अधिक टोकन हटाता जाता है। तर्क यह है कि जैसे-जैसे मॉडल प्रश्न के संदर्भ में छवि को बेहतर ढंग से समझता है, यह स्पष्ट होता जाता है कि कौन से हिस्से अब आवश्यक नहीं हैं। शोधकर्ताओं ने पाया कि इन दो चरणों के बीच काम को विभाजित करने का सबसे प्रभावी तरीका टोकन को समान रूप से विभाजित करना नहीं है, बल्कि एक विशिष्ट गणितीय संतुलन का पालन करना है। उन्होंने पाया कि पहले चरण के बाद रखने योग्य टोकनों की आदर्श संख्या मूल संख्या और अंतिम लक्ष्य संख्या के गुणनफल के वर्गमूल के लगभग बराबर होती है। यह नियम, जिसे वे 'इंफॉर्मेशन-अवेयर बजट' कहते हैं, सिस्टम को एक ऐसा 'स्वीट स्पॉट' खोजने की अनुमति देता है जहाँ वह सटीकता से उत्तर देने की क्षमता से समझौता किए बिना पर्याप्त कंप्यूटिंग शक्ति बचाता है।

यह सुनिश्चित करने के लिए कि पहला चरण गलती से उन टोकनों को डिलीट न कर दे जो दूसरे चरण के लिए उपयोगी होते, शोधकर्ताओं ने बुद्धि का एक तीसरा स्तर जोड़ा। उन्होंने विश्लेषण किया कि विजुअल टोकन इमेज एनकोडर के भीतर एक-दूसरे के साथ कैसे इंटरैक्ट करते हैं। उन्होंने पाया कि कुछ टोकन 'ग्लोबल इंटीग्रेटर्स' के रूप में कार्य करते हैं, जो पूरी छवि में सूचनाओं को जोड़ते हैं, जबकि अन्य केवल 'लोकल डिटेक्टर्स' हैं। इन ग्लोबल इंटीग्रेटर्स को पहले कट के दौरान अतिरिक्त महत्व देकर, सिस्टम यह सुनिश्चित करता है कि लैंग्वेज मॉडल को पास किए गए टोकन एक उच्च-गुणवत्ता वाला आधार बनाते हैं। यह "क्रॉस-स्टेज कंटीन्यूटी" (चरणों के बीच निरंतरता) का अर्थ है कि दूसरे चरण के पास एक बेहतर शुरुआती बिंदु होता है, जिससे यह बाद में क्या हटाना है, इसके बारे में स्मार्ट निर्णय लेने में सक्षम होता है।

दो प्रमुख विजन-लैंग्वेज मॉडल परिवारों पर इस फ्रेमवर्क का परीक्षण करने के परिणाम आश्चर्यजनक थे। जब शोधकर्ताओं ने सिस्टम को चरम सीमाओं तक धकेला, जहाँ मूल टोकनों के एक बहुत छोटे अंश को रखा गया था—कभी-कभी 576 में से केवल 24—तो नई विधि मौजूदा तकनीकों से काफी बेहतर प्रदर्शन करती है। सिंगल-स्टेज विधियाँ, जो एक साथ सारा कट करने की कोशिश करती हैं, इन स्थितियों में अपनी सटीकता में भारी गिरावट देखती हैं। इसके विपरीत, दो-चरणीय UniProne दृष्टिकोण उच्च प्रदर्शन बनाए रखता है, और उन वस्तुओं और दृश्यों के बारे में प्रश्नों का सही उत्तर देता है जिन्हें अन्य विधियाँ मिस कर देती हैं। उदाहरण के लिए, विजुअल अंडरस्टैंडिंग के एक मानक परीक्षण पर, नई विधि ने पूर्ण, अनकंप्रेस्ड मॉडल के 90% से अधिक प्रदर्शन को बनाए रखा, जबकि इसने कंप्यूटिंग शक्ति के एक अंश का ही उपयोग किया।

सटीकता के अलावा, अध्ययन ने वास्तविक हार्डवेयर पर इन मॉडलों को चलाने के व्यावहारिक लाभों को भी मापा। प्रक्रिया के शुरुआती चरण में टोकन की संख्या को कम करके, सिस्टम ने मॉडल को चलाने के लिए आवश्यक पीक मेमोरी को काफी कम कर दिया। यह सीमित संसाधनों वाले उपकरणों पर इन तकनीकों को तैनात करने के लिए एक महत्वपूर्ण कारक है। शोधकर्ताओं ने गणना की कि नई विधि ने बिना किसी प्रूनिंग के मॉडल चलाने की तुलना में कुल कम्प्यूटेशनल कार्य को आधे से अधिक कम कर दिया, और उन तरीकों की तुलना में भी अधिक जो टोकन काटने के लिए अंत तक प्रतीक्षा करते हैं। नए स्मार्ट बजटिंग और स्कोरिंग तंत्रों द्वारा जोड़ा गया ओवरहेड नगण्य था, जो कुल समय का एक प्रतिशत से भी कम था, जिसका अर्थ है कि दक्षता के लाभ लगभग पूरी तरह से शुद्ध हैं।

अध्ययन बताता है कि कुशल आर्टिफिशियल इंटेलिजेंस की कुंजी केवल कोनों को काटना (कटिंग कॉर्नर्स) नहीं है, बल्कि यह समझना है कि कहाँ और कब काटना है। यह स्वीकार करते हुए कि विजुअल रेडंडेंसी (दृश्य अतिरेक) दो अलग-अलग रूपों में आती है—एक छवि स्वयं पर आधारित और दूसरा कार्य पर आधारित—शोधकर्ताओं ने एक ऐसी प्रणाली बनाई है जो दोनों को संभालती है। निष्कर्ष बताते हैं कि एक एकीकृत, बहु-चरणीय दृष्टिकोण समस्या को एक ही चरण में हल करने के प्रयास की तुलना में श्रेष्ठ है। यह कार्य शक्तिशाली विजन-लैंग्वेज मॉडलों को तेज़ और अधिक सुलभ बनाने के लिए एक स्पष्ट मार्ग प्रदान करता है, यह सिद्ध करता है कि सही रणनीति के साथ, हम उस सार को खोए बिना जो इन प्रणालियों को बुद्धिमान बनाता है, अतिरिक्त भार को हटा सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →