Elastic ViTs from Pretrained Models without Retraining
यह शोध पत्र SnapViT को प्रस्तुत करता है, जो एक रिट्रेनिंग-मुक्त, पोस्ट-प्रीट्रेनिंग स्ट्रक्चर्ड प्रूनिंग विधि है जो ग्रेडिएंट जानकारी और एक इवोल्यूशनरी एल्गोरिदम का उपयोग करके क्रॉस-नेटवर्क सहसंबंधों (क्रॉस-नेटवर्क कोरिलेशन) का अनुमान लगाता है, जिससे प्रीट्रेन किए गए विजन ट्रांसफॉर्मर्स को बिना किसी लेबल वाले डेटा की आवश्यकता के कंप्यूट बजट के एक निरंतरता (कंटीनम) में इलास्टिक इन्फरेंस प्राप्त करने में सक्षम बनाया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक विशाल, अविश्वसनीय रूप से बुद्धिमान लाइब्रेरी है (एक विज़न ट्रांसफार्मर या "ViT") जो लगभग किसी भी चीज़ को पहचानने का ज्ञान रखती है। यह लाइब्रेरी इतनी बड़ी है कि यह एक पूरी इमारत घेर लेती है और इसे चलाने के लिए एक विशाल, महंगे जनरेटर की आवश्यकता होती है।
समस्या यह है कि वास्तविक दुनिया के अधिकांश उपकरण (जैसे आपका फोन, ड्रोन, या स्मार्ट कैमरा) छोटे होते हैं और उनकी बैटरी सीमित होती है। वे पूरी लाइब्रेरी को नहीं समा सकते, और वे इसे चलाने के लिए बिजली का खर्च भी नहीं उठा सकते।
आमतौर पर, यदि आपको एक छोटी लाइब्रेरी चाहिए, तो आपको शुरुआत से एक नई, छोटी लाइब्रेरी बनानी पड़ती है। लेकिन इस पेपर के लेखक, SnapViT, कहते हैं: "एक नई क्यों बनाएं? आइए बस उस बड़ी लाइब्रेरी को तुरंत इतना छोटा कर दें कि वह आपकी ज़रूरत के अनुसार किसी भी आकार में फिट हो जाए, बिना उसकी बुद्धिमत्ता खोए।"
उन्होंने इसे कैसे किया, यहाँ सरल भाषा में समझाया गया है:
1. समस्या: एक आकार सबके लिए सही नहीं होता
इन AI मॉडल्स को रशियन नेस्टिंग डॉल्स (Matryoshka dolls) के एक सेट की तरह समझें। आमतौर पर, आपको केवल कुछ विशिष्ट आकार ही मिलते हैं: छोटा, मध्यम और बड़ा। यदि आपके डिवाइस को "मध्यम" से थोड़ा छोटा लेकिन "छोटा" से थोड़ा बड़ा कुछ चाहिए, तो आप किस्मत के भरोसे हैं। या तो आपको बहुत बड़ा, धीमा वाला उपयोग करना होगा या एक छोटा, कम बुद्धिमान वाला।
2. समाधान: किसी भी आकार में "स्नैप" करें
लेखकों ने एक विधि बनाई जिसे SnapViT कहा जाता है। यह एक जादुई कैंची की तरह है जो आपकी बड़ी लाइब्रेरी को एक ही झटके (snap) में आपके द्वारा चाहे गए किसी भी आकार में काट सकती है (10% छोटी, 50% छोटी, आदि)।
- पुनः प्रशिक्षण (Retraining) की आवश्यकता नहीं: आमतौर पर, यदि आप किसी मशीन का एक हिस्सा काट देते हैं, तो वह काम करना बंद कर देती है और उसे घंटों या दिनों तक ठीक करने (रिट्रेन करने) की आवश्यकता होती है। SnapViT मॉडल को काटता है और यह तुरंत काम करने लगता है। किसी सुधार की आवश्यकता नहीं है।
- लेबल की आवश्यकता नहीं: अधिकांश तरीकों को एक शिक्षक की आवश्यकता होती है जो उन्हें महत्वपूर्ण चीज़ें बता सके (जैसे AI को बिल्लियों और कुत्तों की हज़ारों तस्वीरें दिखाना)। SnapViT स्व-शिक्षित है; यह डेटा में पैटर्न को देखकर खुद ही समझ जाता है कि क्या रखना है।
3. यह कैसे काम करता है: "स्मार्ट कैंची"
यह जानने के लिए कि AI के कौन से हिस्सों को काटना है और किन को रखना है, लेखक दो-चरणीय स्कोरिंग सिस्टम का उपयोग करते हैं:
चरण 1: स्थानीय जाँच (द "हर्ट" टेस्ट - चोट का परीक्षण)
कल्पना कीजिए कि आप AI को एक छड़ी से चुभा रहे हैं। यदि किसी विशिष्ट हिस्से को चुभाने से AI लड़खड़ा जाता है, तो वह हिस्सा महत्वपूर्ण है। यदि वह कोई प्रतिक्रिया नहीं देता, तो वह हिस्सा शायद बेकार है। वे एक "सेल्फ-सुपरवाइज्ड" ट्रिक (एक ही छवि को अलग-अलग कोणों से देखना) का उपयोग करते हैं ताकि यह देख सकें कि मस्तिष्क के कौन से हिस्से संवेदनशील हैं। यह उन्हें काटने के लिए एक बुनियादी सूची देता है।चरण 2: वैश्विक जाँच (द "टीमवर्क" टेस्ट - टीमवर्क का परीक्षण)
यह सबसे चतुर हिस्सा है। कभी-कभी, एक हिस्सा अपने आप में बेकार लग सकता है, लेकिन वह वास्तव में दूसरे हिस्से का एक महत्वपूर्ण साथी होता है। यदि आप एक को काटते हैं, तो दूसरा भ्रमित हो जाता है। इन छिपे हुए समूहों को खोजने के लिए, वे एक जेनेटिक एल्गोरिदम (एक डिजिटल विकास सिम्युलेटर के रूप में सोचें) का उपयोग करते हैं। हर एक कनेक्शन की गणना करने के बजाय (जिसमें बहुत समय लगेगा), वे कुछ ही मिनटों में यह सिम्युलेट करते हैं कि "क्या होगा अगर हम इसे काट दें?" और "क्या होगा अगर हम उसे काट दें?" वे एक मानचित्र विकसित करते हैं कि AI के विभिन्न हिस्से एक-दूसरे पर कैसे निर्भर हैं।
4. परिणाम: इलास्टिक इन्फरेंस (Elastic Inference)
एक बार जब उनके पास यह मानचित्र होता है, तो वे मॉडलों की एक "कंटीनम" (निरंतरता) बना सकते हैं।
- एक सुपर-फास्ट ड्रोन के लिए मॉडल चाहिए? SnapViT आपको एक छोटा संस्करण देता है।
- एक शक्तिशाली सर्वर के लिए मॉडल चाहिए? SnapViT आपको एक बड़ा संस्करण देता है।
- बीच का कुछ चाहिए? SnapViT आपको वह भी देता है।
उन्होंने कई प्रसिद्ध AI मॉडल्स (जैसे DINO और SigLIPv2) पर इनका परीक्षण किया। उन्होंने पाया कि वे मॉडल को 40% तक काट सकते हैं (इसे लगभग आधा छोटा कर सकते हैं) और यह अभी भी मूल के लगभग उतना ही अच्छा काम करता है, जिसमें सटीकता का लगभग कोई नुकसान नहीं होता।
5. यह तेज़ क्यों है
लेखक दावा करते हैं कि वे इस पूरी प्रक्रिया को एक सिंगल शक्तिशाली कंप्यूटर चिप (एक A100 GPU) पर पाँच मिनट से भी कम समय में कर सकते हैं। अन्य तरीकों की तुलना में, जिनमें दिनों का समय लग सकता है, यह अविश्वसनीय रूप से तेज़ है।
सारांश उपमा
कल्पना कीजिए कि आपके पास घर बनाने के लिए 100 पन्नों का एक विशाल निर्देश मैनुअल है।
- पुराना तरीका: यदि आपके पास केवल 50 पन्ने पढ़ने का समय है, तो आपको पूरे मैनुअल को फिर से लिखना होगा ताकि 50 पन्नों का एक ऐसा संस्करण बनाया जा सके जो अभी भी समझ में आए।
- SnapViT तरीका: आप तुरंत सबसे महत्वपूर्ण 50 पन्नों को हाइलाइट करते हैं। आप बाकी पन्नों को फाड़ देते हैं। बचे हुए 50 पन्ने अभी भी आपको घर को बिल्कुल सही तरीके से बनाना सिखाते हैं, और आपने यह बिना किसी नए आर्किटेक्ट के, पाँच मिनट में कर लिया।
यह विधि किसी को भी एक विशाल, शक्तिशाली AI लेने और उसे अपनी विशिष्ट आवश्यकताओं के अनुरूप तुरंत छोटा करने की अनुमति देती है, जिससे बिना AI को फिर से प्रशिक्षित किए या बिना किसी शिक्षक के दिखाए, समय, पैसा और ऊर्जा की बचत होती है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।