← नवीनतम पेपर
🤖 machine learning

AgilePruner: An Empirical Study of Attention and Diversity for Adaptive Visual Token Pruning in Large Vision-Language Models

यह शोध पत्र AgilePruner प्रस्तुत करता है, जो लार्ज विजन-लैंग्वेज मॉडल्स के लिए एक एडेप्टिव विजुअल टोकन प्रूनिंग फ्रेमवर्क है, जो विभिन्न इमेज जटिलताओं के बीच मतिभ्रम (hallucinations) को कम करते हुए कम्प्यूटेशनल ओवरहेड को घटाने के लिए अटेंशन-आधारित और डाइवर्सिटी-आधारित विधियों की पूरक शक्तियों के अनुभवजन्य अंतर्दृष्टि का लाभ उठाता है।

मूल लेखक: Changwoo Baek, Jouwon Song, Sohyeon Kim, Kyeongbo Kong

प्रकाशित 2026-03-03
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Changwoo Baek, Jouwon Song, Sohyeon Kim, Kyeongbo Kong

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही स्मार्ट रोबोट सहायक (एक लार्ज विजन-लैंग्वेज मॉडल) है जो किसी तस्वीर को देख सकता है और उसके बारे में आपको एक कहानी सुना सकता है। लेकिन एक समस्या है: जब रोबोट किसी फोटो को देखता है, तो वह उस इमेज को सैकड़ों छोटे पहेली के टुकड़ों में तोड़ देता है जिन्हें "टोकन" कहा जाता है। 500 से अधिक टुकड़ों के बारे में एक साथ सोचना ऐसा है जैसे आग की तेज़ धार (firehose) से पानी पीने की कोशिश करना—यह धीमा है, महंगा है, और इससे रोबोट का दिमाग ओवरहीट हो जाता है।

इसे ठीक करने के लिए, शोधकर्ता रोबोट को "बोरिंग" टुकड़ों को अनदेखा करना और केवल महत्वपूर्ण टुकड़ों को ही रखना सिखाने की कोशिश कर रहे हैं। इसे टोकन प्रूनिंग (Token Pruning) कहा जाता है।

हालाँकि, जो पेपर आपने साझा किया है, AgilePruner, तर्क देता है कि टोकन प्रूनिंग के वर्तमान तरीके थोड़े अनाड़ी हैं। वे ऐसे हैं जैसे किसी ऐसी चीज़ के लिए हथौड़े का उपयोग करना जिसकी ज़रूरत एक सूक्ष्म स्केलपेल (scalpel) से थी। लेखकों ने यह अध्ययन करने का निर्णय लिया कि ये प्रूनिंग विधियाँ वास्तव में कैसे काम करती हैं और उन्होंने कुछ आश्चर्यजनक सच्चाइयों की खोज की।

यहाँ उनके निष्कर्षों और उनके नए समाधान का विवरण दिया गया है:

1. प्रूनिंग के दो पुराने तरीके

कल्पना कीजिए कि आप एक संग्रहालय में एक समूह का नेतृत्व करने वाले टूर गाइड हैं। आपको यह चुनना होगा कि आप समूह को कौन सी प्रदर्शनियाँ दिखाएंगे क्योंकि आपके पास सब कुछ दिखाने के लिए समय नहीं है।

  • विधि A: "स्पॉटलाइट" (अटेंशन-आधारित/Attention-Based)

    • यह कैसे काम करता है: गाइड सबसे प्रसिद्ध, चमकदार या शोर मचाने वाली प्रदर्शनियों (उच्च अटेंशन स्कोर) को ढूंढता है और बाकी को अनदेखा कर देता है।
    • अच्छी बात: यह मुख्य सितारों पर ध्यान केंद्रित करता है। यदि चित्र सरल है (जैसे मेज पर एक अकेला सेब), तो यह पूरी तरह से काम करता है।
    • बुरी बात: यदि चित्र जटिल है (जैसे कि एक व्यस्त बाज़ार), तो गाइड केवल एक बड़े साइन बोर्ड को देख सकता है और लोगों, कारों और खाद्य स्टालों को मिस कर सकता है। साथ ही, क्योंकि यह केवल "सितारों" पर ही ध्यान देता है, इसलिए यह कभी-कभी दोहराव वाला हो जाता है।
    • भ्रम (Hallucination) का जोखिम: वास्तव में, यह तरीका अधिक सुरक्षित है। यह शायद ही कभी ऐसी चीजें गढ़ता है जो वहां मौजूद नहीं हैं क्योंकि यह सख्ती से स्पष्ट साक्ष्यों पर टिका रहता है।
  • विधि B: "स्कैटरगन" (विविधता-आधारित/Diversity-Based)

    • यह कैसे काम करता है: गाइड यह सुनिश्चित करने की कोशिश करता है कि वह समूह को यथासंभव अलग-अलग प्रकार की प्रदर्शनियाँ दिखाए। वे पेंटिंग सेक्शन से एक, मूर्तिकला सेक्शन से एक, इतिहास सेक्शन से एक चुनते हैं, ताकि कोई भी दो प्रदर्शनियाँ एक जैसी न हों।
    • अच्छी बात: जटिल दृश्यों के लिए बेहतरीन है। यह पूरे कमरे को कवर करता है।
    • बुरी बात: एक साधारण कमरे में, यह बर्बादी है। आप शायद धूल के एक कण को भी चुन लेंगे क्योंकि वह सेब से "अलग" है।
    • भ्रम (Hallucination) का जोखिम: यह खतरनाक वाला है। क्योंकि गाइड बहुत अधिक "विविध" होने की कोशिश कर रहा है, इसलिए वे कभी-कभी चीजें बनाना शुरू कर देते हैं। वे कह सकते हैं, "देखो, कोने में एक ड्रैगन है!" सिर्फ एक खाली जगह को भरने के लिए, भले ही वहां कुछ न हो।

2. बड़ी खोज: "एक आकार सबके लिए उपयुक्त नहीं है" (One Size Does Not Fit All)

लेखकों ने हजारों परीक्षण किए और पाया कि एक सुनहरा नियम है: सबसे अच्छा तरीका इस बात पर निर्भर करता है कि इमेज कितनी "व्यस्त" (busy) है।

  • सरल चित्र (कम जटिलता - Low Complexity): सोफे पर एक अकेली बिल्ली की फोटो के बारे में सोचें।
    • विजेता: स्पॉटलाइट (अटेंशन)। आपको बस बिल्ली पर ध्यान केंद्रित करने की आवश्यकता है। "विविध" चीजें खोजने की कोशिश करना केवल शोर (noise) पैदा करेगा।
  • जटिल चित्र (उच्च जटिलता - High Complexity): भोजन, संगीत, लोग और सजावटों से भरे एक भीड़भाड़ वाले उत्सव की फोटो के बारे में सोचें।
    • विजेता: स्कैटरगन (विविधता)। यदि आप केवल सबसे तेज़ संगीत को देखते हैं, तो आप भोजन और लोगों को मिस कर देंगे। आपको एक व्यापक दृश्य की आवश्यकता है।

समस्या: अधिकांश मौजूदा रोबोट एक निश्चित रणनीति का उपयोग करते हैं। या तो वे हमेशा स्पॉटलाइट का उपयोग करते हैं या हमेशा स्कैटरगन का। इसका मतलब है कि वे आधी बार विफल हो जाते हैं।

3. समाधान: "AgilePruner" (स्मार्ट टूर गाइड)

लेखकों ने AgilePruner नामक एक नया सिस्टम बनाया है। एक रणनीति चुनने और उस पर टिके रहने के बजाय, इस रोबोट के पास एक "कॉम्प्लेक्सिटी मीटर" (जटिलता मापने वाला यंत्र) है।

  • यह कैसे काम करता है: चित्र को देखना शुरू करने से पहले, रोबोट जल्दी से जांच करता है: "क्या यह इमेज सरल है या जटिल?"
    • यदि यह सरल है: यह नियमों को सख्त कर देता है। यह एक सख्त स्पॉटलाइट बन जाता है, केवल सबसे महत्वपूर्ण टोकन पर ध्यान केंद्रित करता है और बाकी को अनदेखा कर देता है।
    • यदि यह जटिल है: यह नियमों को ढीला कर देता है। यह एक स्कैटरगन बन जाता है, यह सुनिश्चित करता है कि वह पूरे दृश्य को कवर करने के लिए विविध मिश्रण में टोकन प्राप्त करे।

उपमा (Analogy):
कल्पना कीजिए कि आप एक सूटकेस पैक कर रहे हैं।

  • यदि आप समुद्र तट (Beach) (सरल इमेज) जा रहे हैं, तो आप धूप का चश्मा, एक तौलिया और एक स्विमसूट पैक करते हैं। आप टक्सीडो या बर्फ हटाने वाला फावड़ा (snow shovel) पैक नहीं करते।
  • यदि आप वर्ल्ड टूर पर जा रहे हैं (जटिल इमेज), तो आप हर चीज़ का थोड़ा-थोड़ा हिस्सा पैक करते हैं: स्विमवियर, एक कोट, औपचारिक कपड़े और हाइकिंग बूट्स।

AgilePruner वह यात्री है जो जानता है कि वे कौन सी यात्रा कर रहे हैं और उसी के अनुसार सामान पैक करता है।

4. यह क्यों मायने रखता है

पेपर यह साबित करता है कि "एजाइल" (इमेज के अनुकूल होने) होकर, रोबोट:

  1. तेजी से चलता है: यह अनावश्यक डेटा को हटा देता है।
  2. बेहतर सोचता है: यह जटिल दृश्यों में महत्वपूर्ण विवरणों को मिस नहीं करता है।
  3. कम झूठ बोलता है: यह "भ्रम" (hallucinating - नकली चीजें बनाना) से बचता है क्योंकि यह फोकस और विविधता के बीच संतुलन बनाता है।

सारांश

पेपर कहता है: "हर चीज़ के लिए हथौड़ा इस्तेमाल करना बंद करें। कभी-कभी आपको स्पॉटलाइट की आवश्यकता होती है, और कभी-कभी एक विस्तृत जाल (wide net) की। हमारा नया रोबोट, AgilePruner, अंतर जानता है और स्वचालित रूप से उनके बीच स्विच करता है, जिससे AI विजन तेज़, स्मार्ट और अधिक ईमानदार बनता है।"

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →