← नवीनतम पेपर
🤖 AI

CLIP Tricks You: Training-free Token Pruning for Efficient Pixel Grounding in Large VIsion-Language Models

यह शोधपत्र LiteLVLM को प्रस्तुत करता है, जो एक प्रशिक्षण-मुक्त (training-free), टेक्स्ट-गाइडेड टोकन प्रूनिंग विधि है जो लार्ज विजन-लैंग्वेज मॉडल्स में पिक्सेल ग्राउंडिंग के लिए संदर्भ क्षेत्रों (referent regions) को कुशलतापूर्वक बनाए रखने के लिए CLIP के विजुअल-टेक्स्ट समानता रैंकिंग को उलट देती है, जिससे मौजूदा दृष्टिकोणों से बेहतर प्रदर्शन करते हुए महत्वपूर्ण गति वृद्धि और मेमोरी में कमी प्राप्त होती है।

मूल लेखक: Sangin Lee, Yukyung Choi

प्रकाशित 2026-05-14
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Sangin Lee, Yukyung Choi

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान रोबोट सहायक (एक Large Vision-Language Model) है जो किसी तस्वीर को देख सकता है और उसके बारे में सवालों के जवाब दे सकता है। लेकिन एक समस्या है: तस्वीर को "देखने" के लिए, रोबोट उस छवि को हजारों छोटे-छोटे पहेली के टुकड़ों में तोड़ देता है जिन्हें टोकन (tokens) कहा जाता है।

जब आप रोबोट से "गेंद कहाँ है?" जैसा सरल प्रश्न पूछते हैं, तो उसे अभी भी उन हजारों टुकड़ों को प्रोसेस करना पड़ता है, भले ही वे आसमान, घास या बैकग्राउंड के हों। यह वैसा ही है जैसे किसी लाइब्रेरियन से बिल्ली के बारे में एक विशिष्ट वाक्य खोजने के लिए लाइब्रेरी की हर एक किताब पढ़ने को कहना। यह धीमा है, महंगा है और बहुत अधिक ऊर्जा बर्बाद करता है।

यह पेपर इस समस्या को हल करने के लिए LiteLVLM नामक एक नया तरीका पेश करता है। यह कैसे काम करता है, यहाँ सरल भाषा में समझाया गया है:

समस्या: "स्मार्ट" रोबोट को चकमा दिया जाता है

पिछले तरीकों ने "बोरिंग" यानी उबाऊ पहेली के टुकड़ों को फेंककर गति बढ़ाने की कोशिश की। उन्होंने सोचा, "आइए उन टुकड़ों को रखें जो आपके द्वारा टाइप किए गए शब्दों से सबसे अधिक मेल खाते हैं।"

  • पुराना तरीका: यदि आप "गेंद खोजो" कहते हैं, तो रोबलेट उन इमेज टुकड़ों को खोजता है जो "गेंद" शब्द से पूरी तरह मेल खाते हैं और उन्हें सुरक्षित रखता है।
  • आश्चर्य: लेखकों ने पाया कि उन कार्यों के लिए जहाँ आपको सटीक रूप से किसी चीज़ की ओर इशारा करने की आवश्यकता होती है (पिक्सेल ग्राउंडिंग), यह तर्क उल्टा है!
    • उपमा: कल्पना कीजिए कि आप भीड़ भरे कमरे में लाल टोपी पहने एक विशिष्ट व्यक्ति को ढूंढ रहे हैं। "स्मार्ट" रोबोट (CLIP नामक सिस्टम पर आधारित) वास्तव में अपना ध्यान भीड़ और बैकग्राउंड पर केंद्रित करता है जब वह "लाल टोपी" सुनता है, क्योंकि वे कमरे में सबसे आम चीजें हैं। वह वास्तविक व्यक्ति जिसने लाल टोपी पहनी है, इतना विशिष्ट है कि रोबोट का आंतरिक सिस्टम सोचता है, "यह 'लाल टोपी' के सामान्य विचार जैसा नहीं दिखता जिसे मैं जानता हूँ," और वह उसे अनदेखा करने की कोशिश करता है।
    • परिणाम: पुराने तरीकों ने उन्हीं टुकड़ों को फेंक दिया जिनकी उन्हें वास्तव में आवश्यकता थी (टोपी वाला व्यक्ति) और बैकग्राउंड के शोर को रख लिया।

समाधान: "LiteLVLM" (एक रिवर्स साइकोलॉजी ट्रिक)

लेखकों ने महसूस किया कि विशिष्ट वस्तु को खोजने के लिए, उन्हें वास्तव में उन टुकड़ों को रखना चाहिए जो टेक्स्ट विवरण से सबसे कम मेल खाते हैं और उन्हें फेंक देना चाहिए जो उससे सबसे अधिक मेल खाते हैं।

  1. "रिवर्स" फ़िल्टर: "गेंद" शब्द से मेल खाने वाले टुकड़ों को रखने के बजाय, LiteLVLM उन टुकड़ों को रखता है जो "गेंद" शब्द के साथ अच्छी तरह से मेल नहीं खाते।
    • क्यों? क्योंकि गेंद के विशिष्ट, विशेष विवरण (उसका सटीक आकार, बनावट और स्थिति) अक्सर इतने विशिष्ट होते हैं कि वे "गेंद" के सामान्य "टेक्स्ट आइडिया" जैसे नहीं दिखते। इन "बेमेल" टुकड़ों को रखकर, रोबोट वास्तव में वस्तु के सबसे महत्वपूर्ण विवरणों को सुरक्षित रखता है।
  2. "कॉन्टेक्स्ट" सेफ्टी नेट: यदि आप केवल "बेमेल" टुकड़े रखते हैं, तो आप बैकग्राउंड (जैसे वह घास जिस पर गेंद रखी है) को खो सकते हैं। इसलिए, LiteLVLM कुछ अतिरिक्त टुकड़े भी लेता है जो पूरे दृश्य को समझने में मदद करते हैं, ताकि यह सुनिश्चित हो सके कि वह भ्रमित न हो।
  3. कोई ट्रेनिंग आवश्यक नहीं: सबसे अच्छी बात? यह एक "ट्रेनिंग-फ्री" ट्रिक है। आपको रोबोट को कुछ भी नया सिखाने की आवश्यकता नहीं है। आप बस यह नियम बदल देते हैं कि कौन से पहेली के टुकड़ों को रखना है, इससे पहले कि रोबोट सोचना शुरू करे। यह एक फैक्ट्री को फिर से बनाए बिना कन्वेयर बेल्ट पर निर्देश बदलने जैसा है।

परिणाम: तेज़, हल्का और स्मार्ट

इस "रिवर्स साइकोलॉजी" दृष्टिकोण का उपयोग करके, LiteLVLM अद्भुत परिणाम प्राप्त करता है:

  • गति: यह 22% तेज़ चलता है।
  • मेमोरी: यह 2.3 गुना कम मेमोरी का उपयोग करता है।
  • सटीकता: भले ही यह छवि के लगभग दो-तिहाई टुकड़े फेंक देता है, फिर भी यह 90% उत्तर सही देता है।

संक्षेप में

पुराने तरीकों को एक ऐसे सुरक्षा गार्ड के रूप में सोचें जो हर उस व्यक्ति को रोकता है जिसने लाल शर्ट पहनी है क्योंकि वे सोचते हैं कि "लाल शर्ट" एक संदिग्ध कीवर्ड है। लेकिन वास्तविक चोर नीली शर्ट पहनकर घूम रहा है! गार्ड चोर को मिस कर देता है।

LiteLVLM वह नया गार्ड है जो कहता है, "वास्तव में, आइए उन सभी को रोकें जो लाल शर्ट नहीं पहने हुए हैं, क्योंकि चोर के लाल शर्ट के बीच साफ़ दिखते हुए छिपने की संभावना अधिक है।" तर्क को बदलकर, रोबोट ठीक वही पाता है जो आपने पूछा था, बहुत तेज़ी से और कम प्रयास के साथ।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →