← नवीनतम पेपर
🤖 AI

Combating Textual Noise and Redundancy: Entropy-Aware Dense Visual Token Pruning

यह शोध पत्र एंट्रॉपी-अवेयर डेंस प्रूनिंग (EADP) का प्रस्ताव करता है, जो एक नवीन ढांचा है जो सांख्यिकीय एंट्रॉपी के माध्यम से पाठ्य शोर (textual noise) को फ़िल्टर करके और सघन निर्देशों के तहत सूक्ष्म संकेतों को संरक्षित करने के लिए सबमॉड्यूलर मैक्सिमाइज़ेशन के माध्यम से विजुअल टोकन चयन को अनुकूलित करके विजुअल लैंग्वेज मॉडल की दक्षता को बढ़ाता है।

मूल लेखक: Xuehui Wang, Xuankun Yang, Wei Shen

प्रकाशित 2026-07-03
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xuehui Wang, Xuankun Yang, Wei Shen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान लेकिन थोड़ा घबराया हुआ सहायक (एक विजन-लैंग्वेज मॉडल) है, जो एक तस्वीर के बारे में सवाल का जवाब देने की कोशिश कर रहा है। वह तस्वीर हजारों छोटे पहेली के टुकड़ों (टोकन) से बनी है। सहायक जवाब पता लगाने के लिए हर एक टुकड़े को देखता है।

समस्या क्या है? हर एक टुकड़े को देखना बहुत समय लेता है, और सहायक थक जाता है। इसलिए, हम आमतौर पर "बोरिंग" या उबाऊ टुकड़ों को फेंक देते हैं और केवल महत्वपूर्ण टुकड़ों को रखते हैं। इसे टोकन प्रूनिंग (Token Pruning) कहा जाता है।

हालाँकि, इस शोध पत्र के लेखकों ने पाया कि इसे करने के मौजूदा तरीके दो विशिष्ट और मजेदार तरीकों से खराब हैं। उन्होंने एक नया सिस्टम बनाया जिसे EADP (एन्ट्रॉपी-अवेयर डेंस प्रूनिंग) कहा जाता है ताकि इसे ठीक किया जा सके।

यहाँ बताया गया है कि उन्होंने इसे कैसे ठीक किया, सरल उपमाओं (analogies) का उपयोग करके:

दो बड़ी समस्याएँ

1. "स्टैटिक नॉइज़" की समस्या (टेक्स्टुअल नॉइज़)
कल्पना कीजिए कि आप एक भीड़ भरे कमरे में किसी व्यक्ति को खोजने की कोशिश कर रहे हैं, जिसका विवरण इस प्रकार है: "क्या चित्र में एक कुत्ता है?"

  • पुराना तरीका: सहायक पूरे वाक्य को एक बड़े ब्लॉक के रूप में सुनता है। वह "कुत्ता" तो सुनता है, लेकिन वह "है", "एक", "में" जैसे शब्दों को भी सुनता है। क्योंकि यह पूरे वाक्य को एक ढेर की तरह मानता है, इसलिए बोरिंग शब्द ("है", "एक") बहुत सारा बैकग्राउंड स्टैटिक (शोर) पैदा करते हैं। यह स्टैटिक महत्वपूर्ण शब्द ("कुत्ता") को दबा देता है, जिससे सहायक कमरे के गलत हिस्सों (जैसे खाली फर्श) की ओर देखने लगता है बजाय कुत्ते के।
  • शोध पत्र का समाधान: उन्होंने महसूस किया कि कुछ शब्द (जैसे "है" या विराम चिह्न) "शोर वाले" होते हैं क्योंकि वे तस्वीर में किसी विशिष्ट चीज़ की ओर इशारा नहीं करते हैं। उन्होंने एन्ट्रॉपी (Entropy) नामक एक गणितीय ट्रिक का उपयोग किया (जो अराजकता या यादृच्छिकता को मापता है) ताकि इन शोर वाले शब्दों का पता लगाया जा सके। यदि किसी शब्द का ध्यान कमरे में स्टैटिक की तरह बिखरा हुआ है, तो वे उसे हटा देते हैं। यदि कोई शब्द केंद्रित है (जैसे "कुत्ता"), तो वे उसे रखते हैं। यह निर्देशों को साफ करता है ताकि सहायक को पता चल सके कि वास्तव में क्या देखना है।

2. "एक-बिंदु फोकस" की समस्या (रिडंडेंसी/अतिरेक)
कल्पमा कीजिए कि सहायक आखिरकार कुत्ते को खोजने के लिए तैयार है।

  • पुराना तरीका: यह "टॉप-के (Top-K)" नियम का उपयोग करता है। यह पहेली के उस एक टुकड़े को ढूंढता है जो कुत्ते की नाक जैसा सबसे ज्यादा दिखता है और उसे रखता है। फिर यह नाक जैसा दिखने वाला दूसरा टुकड़ा ढूंढता है और उसे भी रखता है। अंत में, उसके पास कुत्ते की नाक के 10 टुकड़ों का ढेर जमा हो जाता है, और वह कान, पूंछ और शरीर को फेंक देता है। सहायक के पास एक बेहतरीन नाक तो है, लेकिन उसे यह नहीं पता कि कुत्ते का बाकी हिस्सा कैसा दिखता है।
  • शोध पत्र का समाधान: उन्होंने महसूस किया कि हमें एक संतुलित दृश्य की आवश्यकता है, न कि केवल एक "सर्वश्रेष्ठ" दृश्य की। उन्होंने चयन प्रक्रिया को "फैसिलिटी लोकेशन (Facility Location)" नामक एक खेल में बदल दिया।
    • उपमा: कल्पना कीजिए कि आप एक शहर में फायर स्टेशन रख रहे हैं। आप सभी 10 स्टेशन केवल उसी एक पड़ोस में नहीं लगाते जहाँ सबसे अधिक आग लगी है (यह "टॉप-के" वाली गलती है)। इसके बजाय, आप उन्हें इस तरह रखते हैं कि शहर का हर हिस्सा एक स्टेशन के करीब हो।
    • EADP तस्वीर के साथ यही करता है। यह उन टोकन को चुनता है जो पूरे कुत्ते (नाक, कान, पूंछ) को कवर करते हैं, बिना डुप्लिकेट्स पर जगह बर्बाद किए। यह सुनिश्चित करता है कि टोकन का छोटा सेट पूरी कहानी बताए, न कि केवल एक छोटा सा विवरण।

EADP कैसे काम करता है (चरण-दर-चरण)

  1. निर्देशों को साफ करना: यह टेक्स्ट प्रॉम्प्ट को स्कैन करता है, "शोर वाले" शब्दों (जैसे "है" या "?") की पहचान करता है, और उन्हें हटा देता है। यह उन "तेज" शब्दों को रखता है (जैसे "ओवन" या "हाथी") जो वास्तव में चित्र में चीजों की ओर इशारा करते हैं।
  2. एक नक्शा बनाना: यह चित्र का एक हीट मैप बनाता है जो दिखाता है कि महत्वपूर्ण चीजें कहाँ हैं, लेकिन यह इसे स्मूथ (smooth) कर देता है ताकि यह केवल एक छोटे पिक्सेल को हाइलाइट न करे।
  3. स्मार्ट चयन: केवल मैप के सबसे गर्म स्थानों को चुनने के बजाय, यह "फायर स्टेशन" गेम खेलता है। यह टोकन का एक छोटा समूह चुनता जो पूरे चित्र को कवर करने के लिए पर्याप्त रूप से फैले हुए हों, यह सुनिश्चित करते हुए कि कोई भी महत्वपूर्ण हिस्सा पीछे न छूटे।

परिणाम

लेखकों ने कई अलग-अलग AI मॉडल और कठिन सवालों (जैसे छवियों में छोटा टेक्स्ट खोजना या वीडियो के बारे में पेचीदा सवाल पूछना) पर इसका परीक्षण किया।

  • गति (Speed): बेकार तस्वीर के टुकड़ों को 80-90% तक हटाकर, AI 2 से 5 गुना तेज़ चलता है।
  • बुद्धिमत्ता (Smarts): अन्य तरीकों के विपरीत, जो जटिल चित्र या कठिन सवाल होने पर भ्रमित हो जाते हैं, EADP AI को स्मार्ट बनाए रखता है। यह वास्तव में मूल, अन-प्रून्ड (un-pruned) AI की तुलना में बेहतर स्कोर प्राप्त करता है क्योंकि इसने AI को शोर से विचलित होने से रोक दिया।

संक्षेप में: EADP AI विजन के लिए एक स्मार्ट संपादक की तरह है। यह निर्देशों में उबाऊ शब्दों को काट देता है और यह सुनिश्चित करता है कि AI चित्र के टुकड़ों का एक विविध और पूर्ण सेट रखे, जिससे यह विवरण देखने की अपनी क्षमता खोए बिना तेजी से काम कर पाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →