← नवीनतम पेपर
💻 computer science

Entropy Reveals Block Importance in Masked Self-Supervised Vision Transformers

यह शोध पत्र गार्डनर (Gardener) को प्रस्तुत करता है, जो एक डेटा-मुक्त, वन-शॉट प्रूनिंग विधि है जो मास्क किए गए सेल्फ-सुपरवाइज्ड विजन ट्रांसफॉर्मर में अनावश्यक ब्लॉक्स की पहचान करने और उन्हें हटाने के लिए प्रीट्रेंड ब्लॉक वेट्स की सूचना एंट्रॉपी (information entropy) का लाभ उठाती है, जिससे डाउनस्ट्रीम प्रदर्शन पर न्यूनतम प्रभाव के साथ महत्वपूर्ण मॉडल संपीड़न (compression) प्राप्त होता है।

मूल लेखक: Peihao Xiang, Kaida Wu, Ou Bai

प्रकाशित 2026-02-05
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Peihao Xiang, Kaida Wu, Ou Bai

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक विशाल, अविश्वसनीय रूप से बुद्धिमान रोबोटिक मस्तिष्क (एक "विज़न ट्रांसफार्मर") है, जिसने लाखों बिना लेबल वाले वीडियो देखकर दुनिया को समझने में वर्षों बिताए हैं। यह मस्तिष्क बहुत बड़ा है, जिसमें सोचने के 12 अलग-अलग स्तर (layers) शामिल हैं, और यह इतना बड़ा है कि इसे फोन या ड्रोन जैसे छोटे उपकरणों में फिट करना मुश्किल है।

मुख्य प्रश्न जो लेखकों ने पूछा था, वह यह था: क्या हमें एक अच्छा काम करने के लिए वास्तव में इन सभी 12 सोचने वाले ब्लॉकों की आवश्यकता है? या क्या उनमें से कुछ केवल "बेकार का बोझ" (dead weight) हैं जिन्हें हम फेंक सकते हैं?

समस्या: "ओरेकल" (Oracle) बहुत धीमा है

आमतौर पर, यह पता लगाने के लिए कि कौन से ब्लॉक महत्वपूर्ण हैं, आपको "हटाओ और परीक्षण करो" का खेल खेलना पड़ता है। आप एक ब्लॉक निकालते हैं, रोबोट का परीक्षण करते हैं, दूसरा निकालते हैं, फिर से परीक्षण करते हैं, और इसे 12 बार दोहराते हैं। यह एक विशाल सूप में से सबसे अच्छे अवयवों (ingredients) को खोजने के लिए एक समय में एक सामग्री हटाकर सूप चखने जैसा है। यह काम तो करता है, लेकिन इसमें बहुत समय लगता है और बहुत अधिक कंप्यूटिंग शक्ति की आवश्यकता होती है (और अक्सर, आपको परीक्षण करने के लिए एक विशिष्ट डेटासेट की आवश्यकता होती है)।

समाधान: "गार्डनर" (Gardener) विधि

लेखक, पेइहाओ शियांग और उनकी टीम ने एक चतुर शॉर्टकट निकाला जिसे Gardener कहा गया।

मॉडल को डेटा के साथ टेस्ट करने (सूप चखने) के बजाय, उन्होंने केवल रेसिपी को देखने (मॉडल के आंतरिक वेट्स/weights) का निर्णय लिया और अनुमान लगाया कि कौन से अवयव आवश्यक हैं।

उन्होंने रोबोट के मस्तिष्क के गणित में छिपे एक गुप्त कोड की खोज की: एन्ट्रॉपी (Entropy)

  • उपमा: कल्पना करें कि प्रत्येक सोचने वाला ब्लॉक किताबों का एक पुस्तकालय है।
    • कम एन्ट्रॉपी (द "बोरिंग" ब्लॉक): इस पुस्तकालय में केवल एक ही सटीक किताब की कई प्रतियां हैं। यह बहुत दोहराव वाला और एक समान है। लेखकों ने पाया कि ये ब्लॉक "अनावश्यक लाइब्रेरियन" की तरह हैं—आप उन्हें निकाल भी दें, तो भी पुस्तकालय ठीक से चलता रहेगा।
    • उच्च एन्ट्रॉपी (द "बिजी" ब्लॉक): इस पुस्तकालय में विभिन्न प्रकार की किताबों का एक विशाल और विविध मिश्रण है, जो अलमारियों में बिखरा हुआ है। यह अराजक और विविध है। लेखकों ने पाया कि ये ब्लॉक वे "सुपर-लाइब्रेरियन" हैं जो सबसे अनूठे और महत्वपूर्ण ज्ञान को धारण करते हैं।

Gardener कैसे काम करता है

  1. डेटा की आवश्यकता नहीं: Gardener को एक भी वीडियो या छवि देखने की आवश्यकता नहीं है। यह केवल प्री-ट्रेंड मॉडल के भीतर मौजूद संख्याओं को देखता है।
  2. वन-शॉट निर्णय: यह प्रत्येक ब्लॉक के लिए एक "अराजकता स्कोर" (entropy) की गणना करता है।
  3. प्रूनिंग (Pruning): यह तुरंत उन ब्लॉकों की पहचान करता है जिनमें सबसे कम "अराजकता स्कोर" (सबसे अधिक दोहराव वाले) हैं और उन्हें हटा देता है। यह एक ही बार में (single pass में) इसे तुरंत करता है।

परिणाम

टीम ने VideoMAE नामक एक वीडियो रिकग्निशन मॉडल पर इसका परीक्षण किया।

  • चौंकाने वाला तथ्य: उन्होंने पाया कि आप 91.7% तक ब्लॉकों को काट सकते हैं (केवल एक बहुत छोटा हिस्सा छोड़कर) और रोबोट अभी भी पूर्ण-आकार वाले संस्करण की तरह ही लगभग उतनी ही अच्छी तरह से मानवीय क्रियाओं को पहचान सकता है!
  • तुलना: उनकी "गार्डनर" विधि उस धीमी, महंगी "सूप चखने वाली" विधि (सेंसिटिविटी-आधारित प्रूनिंग) जितनी ही अच्छी थी, लेकिन यह हजारों गुना तेज़ थी क्योंकि इसे किसी डेटा या रिट्रेनिंग की आवश्यकता नहीं थी।

यह क्यों मायने रखता है

यह पेपर सिद्ध करता है कि ये विशाल AI मस्तिष्क अत्यधिक रेडंडेंसी (redundancy) से भरे हुए हैं। वे सभी समान रूप से महत्वपूर्ण नहीं हैं। "संख्याएं कितनी मिली-जुली हैं" के सरल गणितीय माप का उपयोग करके, हम इन विशाल मॉडलों से अतिरिक्त भार को तुरंत हटा सकते हैं, जिससे वे बिना रिट्रेनिंग या निजी डेटा तक पहुंच के, रोजमर्रा के उपकरणों पर चलने के लिए पर्याप्त छोटे बन जाते हैं।

संक्षेप में: आपको यह जानने के लिए सूप चखने की आवश्यकता नहीं है कि कौन से अवयव बेकार हैं; आपको बस यह देखने की आवश्यकता है कि अवयवों को कैसे संग्रहीत किया गया है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →