← नवीनतम पेपर
💬 NLP

From Layers to Submodules: Rethinking Granularity in Replacement-Based LLM Compression

यह शोधपत्र SubFit को प्रस्तुत करता है, जो एक पोस्ट-ट्रेनिंग एलएलएम (LLM) संपीड़न विधि है जो व्यक्तिगत रूप से फिट किए गए रेसिडुअल बायपास के साथ अटेंशन (Attention) और फीडफॉरवर्ड (FeedForward) घटकों के गैर-निरंतर, सबमॉड्यूल-स्तर के चयन को सक्षम करके मौजूदा लेयर-आधारित दृष्टिकोणों की सीमाओं को दूर करता है, जिससे विभिन्न मॉडलों और स्पर्सिटी (sparsity) स्तरों में बेहतर सटीकता-परप्लेक्सिटी (accuracy-perplexity) ट्रेड-ऑफ और इन्फरेंस दक्षता प्राप्त होती है।

मूल लेखक: Elia Cunegatti, Marcus Vukojevic, Erik Nielsen, Giovanni Iacca

प्रकाशित 2026-06-02
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Elia Cunegatti, Marcus Vukojevic, Erik Nielsen, Giovanni Iacca

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक लार्ज लैंग्वेज मॉडल (LLM) की कल्पना एक विशाल, हाई-एंड फैक्ट्री असेंबली लाइन के रूप में करें। इस फैक्ट्री में सैकड़ों समान वर्कस्टेशन (परतें/layers) हैं, और प्रत्येक वर्कस्टेशन में दो मुख्य कर्मचारी हैं: एक जो अटेंशन (Attention) में विशेषज्ञ है (संदर्भ को देखने और विचारों को जोड़ने में) और दूसरा जो फीडफॉरवर्ड (FeedForward) में विशेषज्ञ है (उन विचारों को प्रोसेस करने और बदलने में)।

इस फैक्ट्री को तेज़ चलाने और बिजली (मेमोरी) का कम उपयोग करने के लिए, आप इनमें से कुछ वर्कस्टेशन हटाना चाहते हैं। लेकिन समस्या यह है कि यदि आप केवल लाइन के बीच से एक वर्कस्टेशन निकाल देते हैं, तो उत्पाद (AI का उत्तर) बिखर जाता है क्योंकि सूचना का प्रवाह टूट जाता है।

पुराना तरीका: "पड़ोस का विध्वंस" (The Neighborhood Demolition)

पिछले तरीकों ने यह हल करने की कोशिश की कि कैसे वर्कस्टेशन के एक पूरे निरंतर ब्लॉक (मान लीजिए परत 10 से 15 तक) को चुना जाए और उन सभी को एक साथ हटा दिया जाए। फिर उन्होंने उस पूरे ब्लॉक को बदलने के लिए एक एकल, छोटा "शॉर्टकट टनल" बनाने की कोशिश की।

लेखक तर्क देते हैं कि यह एक पूरे मोहल्ले को गिराकर एक छोटा सा शेड बनाने जैसा है। यह बहुत ही भद्दा तरीका है। उन्होंने महसूस किया कि:

  1. अतिरेक (Redundancy) व्यवस्थित नहीं है: हटाया जा सकने वाला "अतिरिक्त" काम हमेशा एक साफ, क्रमिक पंक्ति में नहीं होता है। लाइन के बीच के कुछ वर्कस्टेशन बहुत कम काम कर रहे हैं, जबकि पास के अन्य बहुत अधिक काम कर रहे हैं।
  2. अलग-अलग कर्मचारियों को अलग-अलग सुधारों की आवश्यकता होती है: "अटेंशन" कर्मचारी और "फीडफॉरवर्ड" कर्मचारी अलग-अलग हैं। उन्हें प्रभावी ढंग से बदलने के लिए अलग-अलग प्रकार के शॉर्टकट की आवश्यकता होती है।

नया तरीका: "SUBFIT" (एक कस्टम पैच जॉब)

यह पेपर SUBFIT पेश करता है। पूरे मोहल्ले को गिराने के बजाय, SUBFIT एक मास्टर टेलर या सर्जन की तरह काम करता है।

  1. काटना और पैच करना, विध्वंस नहीं: यह लाइन में अपनी स्थिति की परवाह किए बिना हर एक वर्कस्टेशन को व्यक्तिगत रूप से देखता है। यह उन विशिष्ट वर्कस्टेशनों को चुनता है जो सबसे कम अद्वितीय कार्य (अतिरेक) कर रहे हैं और उन्हें हटा देता है। इन्हें एक-दूसरे के बगल में होना ज़रूरी नहीं है; ये पूरी फैक्ट्री में बिखरे हुए हो सकते हैं।
  2. कस्टम-मेड बायपास: प्रत्येक वर्कस्टेशन जिसे हटाया जाता है, उसके लिए यह एक छोटा, कस्टम-मेड "बायपास" (एक शॉर्टकट) सिल देता है।
    • अटेंशन कर्मचारियों के लिए: यह एक बहुत ही सरल, लो-रैंक शॉर्टकट (जैसे एक संकरा पैदल पथ) का उपयोग करता है।
    • फीडफॉरवर्ड कर्मचारियों के लिए: यह थोड़ा अधिक जटिल पथ का उपयोग करता है, लेकिन यहाँ एक चतुर ट्रिक है: यह इस पथ के "ब्लूप्रिंट" को सभी हटाए गए फीडफॉरवर्ड कर्मचारियों के बीच साझा करता है। यह बहुत अधिक स्थान बचाता है, जैसे कई अलग-अलग दरवाजों को खोलने के लिए एक मास्टर की का उपयोग करना।

परिणाम: तेज़, छोटा और फिर भी स्मार्ट

लेखकों ने दस अलग-अलग AI मॉडलों (बुनियादी और निर्देशों का पालन करने वाले दोनों) पर इसका परीक्षण किया। उन्होंने इसकी तुलना पुराने "नेबरहुड डेमोलिशन" तरीकों से की।

  • ट्रेड-ऑफ (समझौता): आमतौर पर, जब आप किसी AI को कंप्रेस करते हैं, तो वह तेज़ हो जाता है लेकिन गलतियाँ करने लगता है (उच्च "परप्लेक्सिटी" और कम "सटीकता")।
  • विजेता: SUBFIT ने पुराने तरीकों की तुलना में AI को बहुत अधिक स्मार्ट बनाए रखा। 25% कंप्रेशन स्तर पर (चौथाई वर्कस्टेशन हटाकर), पुराने तरीके अपनी मूल बुद्धिमत्ता के लगभग 81% तक गिर गए। SUBFIT 84.6% पर बना रहा।
  • "आक्रामक" परीक्षण: जब उन्होंने मॉडलों को और अधिक कंप्रेस करने की कोशिश की (37.5%), तो पुराने तरीके पूरी तरह से विफल हो गए। SUBFIT ने बहुत बेहतर तरीके से अपनी स्थिति बनाए रखी।
  • गति: क्योंकि उन्होंने वास्तव में भारी मशीनरी (सबमॉड्यूल्स) को हटा दिया है, इसलिए फैक्ट्री तेज़ी से चलती है। AI अपना पहला शब्द तेज़ी से जेनरेट करता है और बातचीत को याद रखने के लिए कम मेमोरी (KV-cache) का उपयोग करता है।

निचोड़ (The Bottom Line)

पेपर का दावा है कि "ग्रैनुलैरिटी" (जिन टुकड़ों को आप काट रहे हैं का आकार) को पूरे लेयर्स से बदलकर व्यक्तिगत सब-कंपोनेंट्स (उप-घटकों) में बदलने से, और उन घटकों के साथ उनके काम के आधार पर अलग-अलग व्यवहार करने से, आप उनकी दिमागी शक्ति को बहुत अधिक खोए बिना AI मॉडलों को काफी छोटा कर सकते हैं।

यह समझने जैसा है कि वजन कम करने के लिए आपको पूरे इंजन ब्लॉक को बदलने की ज़रूरत नहीं है; आपको बस उन विशिष्ट भारी बोल्टों को सावधानी से हटाने की ज़रूरत है जो बहुत कम काम कर रहे हैं और उन्हें हल्के, कस्टम-फिट स्पेसर्स से बदलने की ज़रूरत है। परिणाम एक हल्का इंजन है जो अभी भी उतना ही सुचारू रूप से चलता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →