← नवीनतम पेपर
💬 NLP

Why 1 + 1 < 1 in Visual Token Pruning: Beyond Naive Integration via Multi-Objective Balanced Covering

यह शोध पत्र मल्टी-ऑब्जेक्टिव बैलेंस्ड कवरिंग (MoB) को प्रस्तुत करता है, जो एक नवीन विज़ुअल टोकन प्रूनिंग फ्रेमवर्क है जो हॉर्सडॉर्फ डिस्टेंस (Hausdorff distance) और ϵ\epsilon-कवरिंग थ्योरी का लाभ उठाकर एक क्लोज्ड-फॉर्म एरर बाउंड प्राप्त करता है और प्रॉम्प्ट अलाइनमेंट के साथ विज़ुअल प्रिजर्वेशन के बीच गतिशील रूप से संतुलन बनाता है, जिससे विविध मल्टीमॉडल मॉडल्स में न्यूनतम प्रदर्शन हानि के साथ महत्वपूर्ण इन्फरेंस त्वरण प्राप्त होता है।

मूल लेखक: Yangfu Li, Hongjian Zhan, Tianyi Chen, Qi Liu, Yue Lu

प्रकाशित 2026-03-05
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yangfu Li, Hongjian Zhan, Tianyi Chen, Qi Liu, Yue Lu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "Visual Token Pruning में 1 + 1 < 1" पेपर का सरल भाषा और रचनात्मक उपमाओं (analogies) के साथ विवरण दिया गया है।

बड़ी समस्या: ओवरलोडेड शेफ (Overloaded Chef)

कल्पना कीजिए कि LLaVA जैसा एक मल्टीमॉडल लार्ज लैंग्वेज मॉडल (MLLM) एक शानदार शेफ है। यह शेफ एक तस्वीर के बारे में सवाल का जवाब देने की कोशिश कर रहा है (जैसे, "पार्क में कुत्ता क्या कर रहा है?")।

तस्वीर को समझने के लिए, शेफ उस इमेज को हज़ारों छोटे पहेली के टुकड़ों में तोड़ देता है जिन्हें "टोकन" (tokens) कहा जाता है।

  • समस्या: हाई-रेज़ोल्यूशन वाली तस्वीरें बहुत अधिक टोकन (जैसे 2,000 पहेली के टुकड़े) बना देती हैं। शेफ को हर एक टुकड़े को देखना पड़ता है। इससे शेफ धीमा, थका हुआ और चलाने में महंगा (उच्च कंप्यूटेशनल लागत) हो जाता है।
  • लक्षतः: हम चाहते हैं कि शेफ उबाऊ, बेकार पहेली के टुकड़ों (जैसे नीला आसमान या खाली घास) को फेंक दे और केवल महत्वपूर्ण टुकड़ों (जैसे कुत्ता, गेंद, पेड़) को रखे ताकि शेफ सवाल का सही जवाब देने की क्षमता खोए बिना तेज़ी से काम कर सके।

पुराना तरीका: दो खराब रणनीतियाँ

पहले, शोधकर्ताओं ने यह तय करने के लिए दो मुख्य तरीके आज़माए कि किन टुकड़ों को रखना है:

  1. "विजुअल प्रिजर्वेशन" शेफ (Visual Preservation - VP): यह शेफ तस्वीर को देखता है और कहता है, "मुझे सबसे रंगीन और विस्तृत टुकड़े रखने की ज़रूरत है ताकि इमेज अच्छी दिखे।"
    • परिणाम: यह दृश्य का वर्णन करने के लिए बेहतरीन है, लेकिन शायद उन विशिष्ट विवरणों को मिस कर दे जिनके बारे में उपयोगकर्ता ने पूछा है।
  2. "प्रॉम्प्ट एलाइनमेंट" शेफ (Prompt Alignment - PA): यह शेफ सवाल को देखता है ("कुत्ता कहाँ है?") और कहता है, "मुझे केवल वे टुकड़े चाहिए जो कुत्ते जैसे दिखते हों।"
    • परिणाम: यह विशिष्ट प्रश्न का उत्तर देने के लिए बेहतरीन है, लेकिन संदर्भ (context) को मिस कर सकता है (जैसे कि कुत्ता एक व्यक्ति के हाथ में लीश से बंधा हुआ है)।

हैरानी की बात: शोधकर्ताओं ने इन दोनों शेफों को मिलाने (1 + 1) की कोशिश की ताकि दोनों दुनिया का सर्वश्रेष्ठ प्राप्त किया जा सके। लेकिन आश्चर्यजनक रूप से, 1 + 1 < 1 हुआ। मिला हुआ शेफ अक्सर अकेले उपयोग किए गए किसी भी एक शेफ की तुलना में बदतर प्रदर्शन करता था! क्यों? क्योंकि दोनों शेफ एक ही पहेली के टुकड़ों के लिए लड़ रहे थे, और उन्हें यह नहीं पता था कि काम कैसे बाँटा जाए।

नई खोज: यह "कपलिंग" (Coupling) पर निर्भर करता है

लेखकों ने पाया कि प्रश्न (Prompt) और इमेज (Visuals) के बीच का संबंध कार्य के आधार पर बदल जाता है। वे इसे "प्रॉम्प्ट-विजुअल कपलिंग" (Prompt-Visual Coupling) कहते हैं।

दो परिदृश्यों की कल्पना करें:

  • परिदृश्य A: "स्ट्रॉन्ग कपलिंग" (आसान पहेली)

    • उदाहरण: "कार किस रंग की है?" (इमेज: एक चमकीली लाल फेरारी)।
    • वाइब: जवाब तस्वीर में ही मौजूद है। प्रश्न और इमेज आपस में मजबूती से जुड़े हुए हैं।
    • रणनीति: आपको जवाब खोजने की ज़रूरत नहीं है। आपको बस पूरी इमेज का एक अच्छा, सामान्य ओवरव्यू रखने की ज़रूरत है। यहाँ विजुअल प्रिजर्वेशन (Visual Preservation) जीतता है।
  • परिदृश्य B: "वीक कपलिंग" (कठिन पहेली)

    • उदाहरण: "बैकग्राउंड में साइन बोर्ड पर क्या लिखा है?" (इमेज: एक व्यस्त सड़क का दृश्य)।
    • वाइब: जवाब एक बहुत ही छोटे, विशिष्ट कोने में छिपा हुआ है। प्रश्न बहुत विशिष्ट है, लेकिन इमेज बहुत बड़ी और अस्त-व्यस्त है।
    • रणनीति: आपको उस विशिष्ट टेक्स्ट को खोजने की ज़रूरत है। यहाँ प्रॉम्प्ट एलाइनमेंट (Prompt Alignment) जीतता है। यदि आप केवल इमेज के "सुंदर" हिस्सों को रखते हैं, तो आप साइन बोर्ड को मिस कर देंगे।

पुराने तरीकों की गलती: उन्होंने हर कार्य के लिए एक ही "रेसिपी" का उपयोग किया। उन्होंने दोनों शेफों को समान रूप से संतुलित करने की कोशिश की, चाहे वह कार्य एक "आसान पहेली" हो या "कठिन पहेली"।

समाधान: MoB (मल्टी-ऑब्जेक्टिव बैलेंस्ड कविंग)

लेखकों ने एक नया तरीका बनाया जिसे MoB कहा जाता है। MoB को एक स्मार्ट मैनेजर के रूप में सोचें जो कार्य की विशिष्ट कठिनाई के आधार पर पहेली के टुकड़ों को असाइन करता है।

MoB इस समस्या को कालीन (rugs) से फर्श ढकने की तरह मानता है:

  1. लक्ष्य: आपके पास कालीनों का एक सीमित बजट (वे टोकन जिन्हें आप रखना चाहते हैं) है। आपको "क्वेश्चन एरिया" और "इमेज एरिया" दोनों को कवर करना है।
  2. ट्रेड-ऑफ: यदि आप अपने सभी कालीनों का उपयोग "क्वेश्चन एरिया" को पूरी तरह से कवर करने के लिए करते हैं, तो आप "इमेज एरिया" को खुला छोड़ देते हैं। यदि आप पूरी इमेज को कवर करते हैं, तो आप विशिष्ट प्रश्न को मिस कर सकते हैं।
  3. जादुई चाल: MoB गणना करता है कि प्रश्न और इमेज एक दूसरे से कितने "दूर" हैं (कपलिंग)।
    • यदि वे दूर हैं (Weak Coupling): मैनेजर कहता है, "हमें विशिष्ट उत्तर खोजने के लिए अधिक बजट खर्च करने की आवश्यकता है!" यह प्रॉम्प्ट एलाइनमेंट को अधिक टोकन आवंटित करता है।
    • यदि वे करीब हैं (Strong Coupling): मैनेजर कहता है, "जवाब हर जगह है; चलिए बस एक विस्तृत दृश्य रखते हैं।" यह विजुअल प्रिजर्वेशन को अधिक टोकन आवंटित करता है।

यह एक बड़ी बात क्यों है?

  • यह गणितीय रूप से सिद्ध है: लेखकों ने केवल अनुमान नहीं लगाया; उन्होंने यह साबित करने के लिए ज्यामिति और गणित (Hausdorff distance और covering theory) का उपयोग किया कि सर्वोत्तम परिणामों के लिए बजट को बिल्कुल कैसे विभाजित किया जाए।
  • यह ट्रेनिंग-फ्री है: आपको AI को फिर से सिखाने की आवश्यकता नहीं है। आप बस MoB को प्लग इन करते हैं, और यह काम करता है।
  • यह तेज़ है: यह AI को बिना सटीकता खोए 1.3 से 1.5 गुना तेज़ कर देता है।
  • परिणाम:
    • एक मानक टेस्ट (LLaVA-1.5) पर, MoB ने 88.9% विजुअल टोकन को हटाते हुए 96.4% प्रदर्शन बनाए रखा।
    • यह वीडियो पर भी काम करता है, केवल 6.6% टोकन के साथ 97.9% प्रदर्शन बनाए रखता है।

मुख्य निष्कर्ष (Takeaway)

यह पेपर हमें सिखाता है कि एक आकार सबके लिए फिट नहीं बैठता (one size does not fit all)। AI की दुनिया में, दो अच्छी रणनीतियों को अंधाधुंध मिलाने से अक्सर गड़बड़ी हो जाती है। इसके बजाय, आपको एक स्मार्ट सिस्टम (MoB) की आवश्यकता है जो प्रश्न और इमेज के बीच के संबंध को समझता है, और गतिशील रूप से यह तय करता है कि "जवाब खोजने" बनाम "तस्वीर को सुंदर बनाए रखने" पर कितना ध्यान देना है।

संक्षेप में: MoB वह स्मार्ट मैनेजर है जो जानता है कि कब एक जासूस (सुरागों की तलाश में) बनना है और कब एक चित्रकार (दृश्य को संरक्षित करने में) बनना है, जिससे यह सुनिश्चित होता है कि AI चाहे किसी भी कार्य का सामना करे, वह तेज़ और सटीक बना रहे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →