← नवीनतम पेपर
🤖 AI

Rethinking Depth Pruning for Vision Transformers: A Heterogeneity-Aware Perspective

यह शोध पत्र HetDPT को प्रस्तुत करता है, जो एक विषमता-जागरूक (heterogeneity-aware) डेप्थ प्रूनिंग विधि है जो इंटर-लेयर विषमता को संबोधित करके मौजूदा दृष्टिकोणों की सटीकता रिकवरी चुनौतियों पर विजय प्राप्त करती है, जिससे कई बेंचमार्क पर विजन ट्रांसफॉर्मर (Vision Transformers) पर न्यूनतम सटीकता हानि के साथ महत्वपूर्ण गति वृद्धि प्राप्त होती है।

मूल लेखक: Zhenfeng Su, Kang Zhao, Han Bao, Tao Yuan, Zhongzhe Hu, Xianzhi Yu, Wenxuan Wang

प्रकाशित 2026-07-07
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhenfeng Su, Kang Zhao, Han Bao, Tao Yuan, Zhongzhe Hu, Xianzhi Yu, Wenxuan Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक विज़न ट्रांसफार्मर (ViT) की कल्पना एक अत्यधिक परिष्कृत, बहु-मंजिला कारखाने के रूप में करें जिसे छवियों को पहचानने के लिए डिज़ाइन किया गया है। इस कारखाने का प्रत्येक तल (floor) एक "लेयर" (layer) का प्रतिनिधित्व करता है जहाँ छवि को प्रोसेस किया जाता है। कुछ तल अटेंशन (Attention) के लिए समर्पित हैं (पूरी तस्वीर को स्कैन करना यह देखने के लिए कि विभिन्न भाग एक-दूसरे से कैसे संबंधित हैं) और अन्य तल एक्टिवेशन (Activation) के लिए हैं (विवरणों को तेज करने के लिए एक विशिष्ट फ़िल्टर या "नॉन-लिनियरिटी" लागू करना)।

वर्षों से, इंजीनियरों ने इन कारखानों को छोटे उपकरणों पर तेज़ चलाने के प्रयास में मुख्य रूप से विड्थ प्रूनिंग (Width Pruning) पर ध्यान केंद्रित किया है। यह प्रत्येक तल पर कम कर्मचारी रखने जैसा है। आपको एक छोटा कारखाना मिलता है, लेकिन इसमें अभी भी मंजिलों की वही संख्या होती है, इसलिए उत्पाद को अभी भी हर स्तर से गुजरना पड़ता है।

पेपर का तर्क है कि तेज़ करने का एक बेहतर तरीका डेप्थ प्रूनिंग (Depth Pruning) है: बस पूरी मंजिलों को हटा देना। यदि आप 50% मंजिलें हटा देते हैं, तो उत्पाद अंत तक दोगुना तेज़ पहुँचता है। हालाँकि, गहराई प्रूनिंग के पिछले प्रयासों ने बुरी तरह विफल होकर दिखाया। कारखाना ढह जाता, और आउटपुट (छवि पहचान) की गुणवत्ता बहुत गिर जाती।

लेखकों ने HetDPT के रूप में एक नया तरीका खोजा जिसने यह समझा कि कारखाना क्यों ढह रहा था और इसे ठीक करने के लिए एक नया तरीका बनाया। यहाँ सरल शब्दों में इसका विवरण दिया गया है:

समस्या: "मिसमैच" और "अलग व्यक्तित्व"

पेपर पहचानता है कि केवल मंजिलों को हटाने से दो मुख्य कारणों से काम नहीं बनता है:

  1. डायमेंशन मिसमैच (टूटी हुई कन्वेयर बेल्ट):
    कल्पित करें कि कारखाने में एक कन्वेयर बेल्ट सिस्टम है। "अटेंशन" फ्लोर और "एक्टिवेशन" फ्लोर एक विशिष्ट तरीके से जुड़े हुए हैं। यदि आप बस एक एक्टिवेशन फ्लोर को निकाल देते हैं, तो पिछले फ्लोर से आने वाली कन्वेयर बेल्ट एक ऐसी मशीन पर पहुँचती है जो अब मौजूद नहीं है, या वह मशीन जो मौजूद है उसे एक अलग आकार के पैकेज की आवश्यकता होती है। पेपर इसे "डायमेंशन मिसमैच" कहता है। यह एक चौकोर खांचे को गोल छेद में फिट करने की कोशिश करने जैसा है क्योंकि आपने बीच में मौजूद अडैप्टर को हटा दिया है।
  • समाधान: लेखकों ने महसूस किया कि वे "एक्टिवेशन" फ्लोर को पूरी तरह से हटा सकते हैं और उसके दोनों ओर स्थित दो "लीनियर" (मशीन) फ्लोर को आपस में मिला (merge) सकते हैं। यह एक नई, निर्बाध मशीन बनाता है जो कन्वेयर बेल्ट में पूरी तरह फिट बैठती है, जिससे कम मंजिलों के बावजूद कारखाना सुचारू रूप से चलता रहता है।
  1. हेटरोजीनिटी (अलग व्यक्तित्व):
    यह पेपर का सबसे बड़ा अंतर्दृष्टि है। लेखकों ने महसूस किया कि अटेंशन फ्लोर और एक्टिवेशन फ्लोर एक जैसे नहीं हैं; उनके "व्यक्तित्व" अलग हैं।
  • अटेंशन फ्लोर सीनियर मैनेजर्स (Senior Managers) की तरह हैं। यदि आप कुछ मैनेजरों को हटा देते हैं, तो कारखाना शुरू में थोड़ा धीमा चलता है, लेकिन उन्हें वापस पूर्ण गति पर लाने के लिए नए मैनेजरों को प्रशिक्षित करने में बहुत लंबा समय लगता है। उन्हें जल्दी से बदलना कठिन है।
  • एक्टिवेशन फ्लोर जूनियर इंटर्न्स (Junior Interns) की तरह हैं। यदि आप उन्हें हटाते हैं, तो कारखाना तुरंत क्रैश हो जाता है (सटीकता लगभग शून्य तक गिर जाती है)। हालाँकि, यदि आप उन्हें 10 मिनट का त्वरित प्रशिक्षण (fine-tuning) देते हैं, तो वे लगभग तुरंत पूर्ण प्रदर्शन पर वापस आ जाते हैं।
  • पुराने तरीकों की गलती: पिछले तरीकों ने सभी मंजिलों के साथ एक जैसा व्यवहार किया। उन्होंने "ग्रेडिएंट्स" (एक माप कि एक फ्लोर कितना योगदान देता है) को देखा और उन्हें हटाया जिनका नंबर सबसे कम था। क्योंकि सीनियर मैनेजर्स (अटेंशन) का "वोल्टेज" इंटर्न्स (एक्टिवेशन) से स्वाभाविक रूप से भिन्न होता है, पुराने तरीकों ने गलत लोगों को हटाया, जिससे पतन (collapse) हुआ।

समाधान: HetDPT (स्मार्ट फैक्ट्री मैनेजर)

लेखकों ने इस कारखाने को प्रबंधित करने के लिए HetDPT (हेटरोजीनिटी-अवेयर डेप्थ प्रूनिंग) नामक एक दो-चरणीय प्रक्रिया बनाई:

चरण 1: बजट आवंटन (रणनीति)
किसी को भी निकालने से पहले, मैनेजर एक "मॉडल एक्यूरेसी प्रेडिक्टर" (एक स्मार्ट कैलकुलेटर) का उपयोग करता है। यह पूछने के बजाय कि "कौन सी विशिष्ट मंजिल सबसे खराब है?", यह पूछता है, "यदि हम 3 सीनियर मैनेजर और 5 इंटर्न हटा देते हैं, तो क्या कारखाना काम करेगा?"

  • यह मैनेजरों बनाम इंटर्न्स को हटाने के विभिन्न संयोजनों का परीक्षण करता है।
  • यह हटाने के सही संतुलन को पाता है (जैसे, "हम कुल 10 फ्लोर हटा सकते हैं, लेकिन गुणवत्ता बनाए रखने के लिए हमें 6 इंटर्न और केवल 4 मैनेजर हटाने चाहिए")।
  • यह प्रबंधकों और इंटर्न्स की सीधे तुलना करने की गलती से बचता है, जो सेब और संतरे की तुलना करने जैसा है।

चरण 2: निष्पादन (सफाई)
एक बार बजट सेट हो जाने के बाद (जैसे, "6 इंटर्न को हटाओ"), यह विधि प्रत्येक समूह में अलग-अलग जाती है।

  • यह सभी इंटर्न्स को देखती है और उन्हें हटाती है जिनकी सबसे कम आवश्यकता है।
  • यह सभी मैनेजर्स को देखती है और उन्हें हटाती है जिनकी सबसे कम आवश्यकता है।
  • महत्वपूर्ण रूप से: यह हटाए गए इंटर्न्स के आसपास की लीनियर मशीनों को मर्ज करती है ताकि कन्वेयर बेल्ट पूरी तरह फिट हो सके (मिसमैच को हल करने के लिए)।
  • अंत में, यह शेष कर्मचारियों को 100% प्रदर्शन पर वापस लाने के लिए एक त्वरित "रिफ्रेशर कोर्स" (fine-tuning) देती है।

परिणाम: गुणवत्ता खोए बिना तेज़

लेखकों ने कई मानक इमेज डेटासेट्स (जैसे ImageNet, जो 1 मिलियन चित्रों का एक विशाल फोटो एल्बम है) पर इस परीक्षण किया।

  • गति (Speed): उन्होंने एक मानक मॉडल (DeiT-B) के लिए 1.58x तेज़ प्रोसेसिंग हासिल की, जबकि सटीकता मूल मॉडल के समान ही बनी रही।
  • अत्यधिक संपीड़न (Extreme Compression): जब उन्होंने इस पद्धति को अन्य तकनीकों (विड्थ प्रूनिंग) के साथ जोड़ा, तो उन्होंने एक सुपर-लाइटवेट मॉडल बनाया जो मूल मॉडल से 5.19x तेज़ है, जिसमें सटीकता का लगभग कोई नुकसान नहीं हुआ।
  • बहुमुखी प्रतिभा (Versatility): यह न केवल मानक मॉडलों पर, बल्कि अधिक जटिल मॉडलों (Swin Transformers) और अरबों पैरामीटर्स वाले विशाल मॉडलों (DINO-V2-Giant) पर भी काम कर गया।

सारांश उपमा

एक कार असेंबली लाइन के बारे में सोचें जो कारें बना रही है।

  • पुराना तरीका: आप लाइन पर काम करने वाले श्रमिकों को तेज़ चलाने की कोशिश करते हैं (विड्थ प्रूनिंग), या आप विभिन्न स्टेशनों से श्रमिकों को बेतरतीब ढंग से हटा देते हैं, जिससे कार का चेसिस लाइन से गिर जाता है क्योंकि अगला स्टेशन तैयार नहीं होता है (विफल डेप्थ प्रूनिंग)।
  • HetDPT तरीका: आप महसूस करते हैं कि कुछ स्टेशनों (इंटर्न्स) को पूरी तरह से हटाया जा सकता है यदि आप दोनों तरफ की मशीनों को आपस में जोड़ दें। आप यह भी समझते हैं कि स्टेशन प्रबंधकों (अटेंशन) को हटाना लाइन को लंबे समय तक प्रभावित करता है, जबकि इंटर्न्स को हटाना क्षणिक रूप से नुकसान पहुँचाता है, लेकिन वे तेज़ी से रिकवर होते हैं। इसलिए, आप सावधानीपूर्वक गणना करते हैं कि प्रत्येक को वास्तव में कितना हटाना है, मशीनों को जोड़ते हैं, और शेष चालक दल को एक त्वरित प्रोत्साहन (pep talk) देते हैं। परिणाम? कार अंत में दोगुना तेज़ आती है, और वह अभी भी एक बेहतरीन कार है।

पेपर निष्कर्ष निकालता है कि परतों के विभिन्न "व्यक्तित्वों" का सम्मान करके और मैकेनिकल मिसमैच को ठीक करके, हम इन शक्तिशाली AI मॉडलों को उनकी बुद्धिमत्ता खोए बिना रोज़मर्रा के उपकरणों पर काफी तेज़ चला सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →