← नवीनतम पेपर
💻 computer science

ToaSt: Token Channel Selection and Structured Pruning for Efficient ViT

ToaSt एक डिकपल्ड (decoupled) फ्रेमवर्क है जो अटेंशन मॉड्यूल्स के लिए कपल्ड हेड-वाइज स्ट्रक्चर्ड प्रूनिंग को फीड-फॉरवर्ड नेटवर्क्स के लिए एक ट्रेनिंग-फ्री टोकन चैनल सिलेक्शन पद्धति के साथ जोड़कर विजन ट्रांसफार्मर की दक्षता को बढ़ाता है, जिससे विविध मॉडलों और कार्यों में बेहतर सटीकता-दक्षता ट्रेड-ऑफ प्राप्त होता है।

मूल लेखक: Hyunchan Moon, Cheonjun Park, Steven L. Waslander

प्रकाशित 2026-06-16
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Hyunchan Moon, Cheonjun Park, Steven L. Waslander

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक विशाल, अविश्वसनीय रूप से बुद्धिमान पुस्तकालय है (एक विज़न ट्रांसफार्मर या ViT) जो किसी भी छवि को पढ़ सकता है और उसे पूरी तरह से समझ सकता है। लेकिन एक समस्या है: यह पुस्तकालय इतना बड़ा और भारी है कि गलियारों में चलने में बहुत समय लगता है, और इसे रखने के लिए एक विशाल, महंगे भवन की आवश्यकता है। आप पुस्तकालय को सिकोड़ना चाहते हैं ताकि यह एक बैकपैक (जैसे फोन या लैपटॉप) में फिट हो सके, बिना उसकी समझने की क्षमता खोए।

यह शोध पत्र एक नई विधि पेश करता है जिसे ToaSt (टोकन चैनल सिलेक्शन और स्ट्रक्चर्ड प्रूनिंग) कहा जाता है। ToaSt को एक मास्टर लाइब्रेरियन के रूप में समझें जो पुस्तकालय को सिकोड़ने के लिए दो अलग-अलग रणनीतियों का उपयोग करता है, एक "रीडिंग रूम" (पढ़ने के कमरों) के लिए और दूसरा "थिंकिंग रूम" (सोचने के कमरों) के लिए।

पुस्तकालय की दो समस्याएँ

शोध पत्र बताता है कि पुस्तकालय दो मुख्य कारणों से धीमा है:

  1. रीडिंग रूम्स (अटेंशन): लाइब्रेरियन को कनेक्शन खोजने के लिए हर एक किताब के पन्ने की तुलना हर दूसरे पन्ने से करनी पड़ती है। यदि आपके पास 1,000 पन्ने हैं, तो यह दस लाख तुलनाएँ हैं! यह "क्वाड्रेटिक" लागत है।
  2. थिंकिंग रूम्स (फीड-फॉरवर्ड नेटवर्क): पढ़ने के बाद, लाइब्रेरियन जानकारी को प्रोसेस करने के लिए एक विशाल कमरे में जाता है। यह कमरा वास्तव में इमारत का सबसे बड़ा हिस्सा है (60% से अधिक काम यहीं होता है), लेकिन यह अनावश्यक, शोर वाले शेल्फों से भरा है जो वास्तव में कोई मूल्य नहीं जोड़ते हैं।

रणनीति 1: "कपल्ड" रीडिंग रूम क्लीनअप (MHSA प्रूनिंग)

रीडिंग रूम में, लाइब्रेरियन आमतौर पर टीमों (जिन्हें "हेड्स" कहा जाता है) में काम करता है। प्रत्येक टीम के पास किताबों को पढ़ने के लिए उपकरणों का एक सेट (वेट्स) होता है।

  • पुराना तरीका: यदि आप केवल एक टीम के सदस्य से कुछ उपकरण बेतरतीब ढंग से हटा देते हैं, तो पूरी टीम भ्रमित हो जाती है और पुस्तकालय ढह जाता है।
  • ToaSt का तरीका: शोध पत्र स्ट्रक्चक्चर्ड कपल्ड प्रूनिंग का प्रस्ताव देता है। कल्पना करें कि टीम मेंबर A द्वारा उपयोग किए जाने वाले प्रत्येक टूल के लिए, टीम मेंबर B के पास एक मिलान वाला टूल है। ToaSt कहता है, "यदि हम मेंबर A से टूल #5 हटाते हैं, तो हमें मेंबर B से भी ठीक उसी समय टूल #5 हटाना होगा।"
  • परिणाम: इन उपकरणों को हटाने के लिए तालमेल बिठाकर, टीम पूरी तरह से तालमेल में रहती है। वे छोटे और तेज़ हो जाते हैं, लेकिन वे अभी भी किताबों को पूरी तरह से समझते हैं। यह एक गायक दल (choir) को छोटा करने जैसा है जहाँ हर सेक्शन से समान संख्या में गायकों को हटाया जाता है ताकि सामंजस्य बना रहे।

रणनीति 2: थिंकिंग रूम्स के लिए "नॉइज़ फ़िल्टर" (टोकन चैनल सिलेक्शन)

थिंकिंग रूम्स (FFN) वह जगह है जहाँ भारी काम होता है। शोधकर्ताओं ने पाया कि ये कमरे "घोस्ट शेल्फ्स" (भूतिया शेल्फ) से भरे हुए हैं—ऐसे चैनल्स जो या तो खाली हैं या बस एक ही शोर को दोहरा रहे हैं।

  • खोज: शोधकर्ताओं ने पाया कि पुस्तकालय के गहरे हिस्सों में, जानकारी अत्यधिक दोहराव वाली होती है। आप अन्य शेल्फों के एक छोटे से नमूने को देखकर 90% की भविष्यवाणी कर सकते हैं कि उन पर क्या है।
  • ToaSt का तरीका: पूरे पुस्तकालय को फिर से प्रशिक्षित (retraining) करने के बजाय (जिसमें महीनों लग सकते हैं), ToaSt एक ट्रेनिंग-फ्री विधि का उपयोग करता है। यह थिंकिंग रूम के दरवाजे पर एक स्मार्ट बाउंसर की तरह काम करता है।
    • यह कुछ "टोकन" (कुछ प्रतिनिधि किताबों) का तेजी से नमूना लेता है।
    • यह गणना करता है कि कौन से शेल्फ (चैनल्स) वास्तव में उपयोगी जानकारी रख रहे हैं और कौन से केवल शोर रख रहे हैं।
    • यह वास्तविक रीडिंग प्रक्रिया के दौरान तुरंत शोर वाले, बेकार शेल्फों के दरवाजे बंद कर देता है।
  • परिणाम: पुस्तकालय सूचना को एक बहुत ही संकीर्ण, स्वच्छ गलियारे के माध्यम से प्रोसेस करता है। क्योंकि यह "घोस्ट शेल्फ्स" पर समय बर्बाद नहीं कर रहा है, यह बहुत तेज़ी से चलता है, और दिलचस्प बात यह है कि यह अक्सर अधिक स्मार्ट हो जाता है क्योंकि यह शोर से विचलित होना बंद कर देता है।

यह एक बड़ी बात क्यों है

आमतौर पर, जब आप एक विशाल AI मॉडल को सिकोड़ने की कोशिश करते हैं, तो आपको इसे यह सुनिश्चित करने के लिए "रिट्रेन" करने में बहुत समय बिताना पड़ता है कि यह सोचना न भूल जाए।

  • ToaSt का जादू: क्योंकि यह तरीका इस बात के बारे में बहुत स्मार्ट है कि यह क्या काट रहा है (रीडिंग रूम को सिंक्रोनाइज़ करना और थिंकिंग रूम में शोर को फ़िल्टर करना), पुस्तकालय को लगभग कुछ भी फिर से सीखने की आवश्यकता नहीं होती है।
  • प्रमाण: शोध पत्र ने नौ अलग-अलग प्रकार के पुस्तकालयों (DeiT, ViT-MAE और Swin जैसे मॉडल) पर इसका परीक्षण किया।
    • एक विशाल मॉडल (ViT-MAE-Huge) पर, उन्होंने काम को लगभग 40% कम कर दिया लेकिन वास्तव में सटीकता (accuracy) में सुधार किया।
    • यह फोटो में वस्तुओं को खोजने (COCO) या मानचित्रों को समझने (ADE20K) जैसे विभिन्न कार्यों पर भी काम करता है, जो यह साबित करता है कि यह केवल एक विशिष्ट काम के लिए चाल नहीं है।

निचोड़ (The Bottom Line)

ToaSt एक मास्टर आर्किटेक्ट की तरह है जो महसूस करता है कि किसी इमारत को सिकोड़ने के लिए, आप केवल रैंडम दीवारें नहीं काटते हैं। इसके बजाय, आप:

  1. संरचनात्मक सपोर्ट को सिंक्रोनाइज़ करते हैं ताकि इमारत पतली होने के बावजूद मजबूत बनी रहे।
  2. प्रोसेसिंग रूम में शोर को फ़िल्टर करते हैं ताकि इमारत एक सुव्यवस्थित, हाई-स्पीड ट्रैक पर चले।

परिणामस्वरूप, एक विज़न ट्रांसफार्मर काफी तेज़ और हल्का होता है, छोटे उपकरणों पर फिट बैठता है, और अक्सर मूल विशाल संस्करण की तुलना में बेहतर प्रदर्शन करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →