← नवीनतम पेपर
💬 NLP

FLAT-LLM: Fine-grained Low-rank Activation Space Transformation for Large Language Model Compression

FLAT-LLM एक तेज़, प्रशिक्षण-मुक्त संरचनात्मक संपीड़न विधि है जो हेड-वार PCA और अनुकूलित रैंक आवंटन के माध्यम से सूक्ष्म-स्तरीय लो-रैंक एक्टिवेशन स्पेस ट्रांसफॉर्मेशन का उपयोग करती है ताकि बिना किसी रिकवरी फाइन-ट्यूनिंग की आवश्यकता के, उच्च सटीकता बनाए रखते हुए LLM मॉडल के आकार को महत्वपूर्ण रूप से कम करने और अनुमान गति में सुधार करने के लिए।

मूल लेखक: Jiayi Tian, Ryan Solgi, Jinming Lu, Yifan Yang, Hai Li, Zheng Zhang

प्रकाशित 2026-02-09
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jiayi Tian, Ryan Solgi, Jinming Lu, Yifan Yang, Hai Li, Zheng Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि लार्ज लैंग्वेज मॉडल्स (LLMs) मानव ज्ञान के सार से भरी विशाल, अत्यंत बुद्धिमान पुस्तकालयों की तरह हैं। वे अविश्वसनीय रूप से स्मार्ट हैं, लेकिन वे बहुत विशाल भी हैं। एक मानक लैपटॉप या फोन पर इन पुस्तकालयों को चलाने की कोशिश करना एक पॉकेट वॉच में पूरी विश्वकोश (encyclopedia) को फिट करने जैसा है—यह बहुत भारी है, इसे पढ़ने में बहुत समय लगता है, और अक्सर डिवाइस को क्रैश कर देता है।

यह शोध पत्र FLAT-LLM को पेश करता है, जो एक नई विधि है जो इन विशाल पुस्तकालयों को उनकी अच्छी कहानियाँ सुनाने या सटीक उत्तर देने की क्षमता खोए बिना, एक प्रबंधनीय आकार में सिकोड़ने का काम करती है। यह कैसे काम करता है, इसके लिए सरल उपमाओं का उपयोग किया गया है:

1. समस्या: "भारी" पुस्तकालय

इन मॉडल्स को सिकोड़ने के मौजूदा तरीके एक चौकोर खांचे में गोल खूंटी डालने की कोशिश करने जैसे हैं।

  • पुराने तरीके (जैसे SVD): कल्पना कीजिए कि आप पुस्तकालय को सिकोड़ने के लिए हर एक किताब को बीच से काटने और पन्नों को आपस में चिपकाने की कोशिश कर रहे हैं। आप जगह तो बचाते हैं, लेकिन किताबें पढ़ना कठिन हो जाता है, और पुस्तकालय धीमा हो जाता है क्योंकि हर बार एक वाक्य पढ़ने के लिए आपको पन्नों को फिर से जोड़ने की आवश्यकता होती है।
  • अन्य तरीके (जैसे SliceGPT): कल्पना कीजिए कि जगह बचाने के लिए आप किताबों की पूरी अलमारियों को ही हटा देते हैं। इससे जगह तो बचती है, लेकिन अक्सर आप महत्वपूर्ण विधाएं (genres) खो देते हैं, और आपको शेष अलमारियों को जोड़ने के लिए अजीब से पुल (अडैप्टर मॉड्यूल) बनाने पड़ते हैं, जो चलने की गति को धीमा कर देते हैं।

2. समाधान: FLAT-LLM (एक "स्मार्ट सॉर्टर")

FLAT-LLM एक अलग दृष्टिकोण अपनाता है। किताबों को काटने या अलमारियों को हटाने के बजाय, यह एक अत्यंत कुशल लाइब्रेरियन की तरह कार्य करता है जो इस आधार पर पुस्तकालय को पुनर्गठित करता है कि लोग वास्तव में क्या पढ़ते हैं।

चरण A: "हेड-वाइज" सॉर्ट (फाइन-ग्रेन्ड PCA)

मॉडल के भीतर, जानकारी कई समानांतर "हेड्स" (सोचिए कि ये एक कंपनी में विभिन्न विभागों की तरह हैं) में प्रोसेस की जाती है।

  • अंतर्दृष्टि: शोधकर्ताओं ने देखा कि "वैल्यू" विभाग (जहाँ जानकारी संग्रहीत की जाती है) में, अधिकांश डेटा वास्तव में अनावश्यक (redundant) है। यह एक ही मेमो की 100 प्रतियों को रखने जैसा है।
  • तरीका: FLAT-LLM एक गणितीय उपकरण जिसका नाम PCA (प्रिंसिपल कंपोनेंट एनालिसिस) है, का उपयोग प्रत्येक विभाग में डेटा को अलग-अलग देखने के लिए करता है। यह पहचानता है कि "शीर्ष 10% मेमो" में 90% महत्वपूर्ण जानकारी है और बाकी को हटा देता है।
  • जादू: बाकी हिस्से को केवल फेंकने के बजाय, यह शेष किताबों में आवश्यक भागों को सीधे अवशोषित (absorb) कर लेता है। इसका मतलब है कि पुस्तकालय छोटा हो जाता है, लेकिन किताबों में अभी भी सारा आवश्यक अर्थ होता है। इसके लिए किसी अतिरिक्त पुल या अडैप्टर की आवश्यकता नहीं होती।

चरण B: "ग्रीडी बजट" (महत्व-संरक्षण रैंक चयन)

पुस्तकालय के सभी विभाग समान रूप से महत्वपूर्ण नहीं होते। कुछ सरल कार्य संभालते हैं (जैसे "नमस्ते"), जबकि अन्य जटिल तर्क (जैसे "इस गणित के सवाल को हल करें") संभालते हैं।

  • समस्या: यदि आप हर विभाग को बिल्कुल समान मात्रा में सिकोड़ते हैं (उदाहरण के लिए, हर किसी के स्टाफ में 20% की कटौती करना), तो जटिल विभाग ढह जाएंगे और मॉडल मूर्ख बन जाएगा।
  • समाधान: FLAT-LLM एक ग्रीडी रिडिस्ट्रीब्यूशन स्ट्रैटेजी का उपयोग करता है। यह एक स्मार्ट मैनेजर की तरह कार्य करता है जो प्रत्येक विभाग के "महत्व स्कोर" को देखता है।
    • यह जटिल, संवेदनशील विभागों को अधिक स्टाफ देता है (उनके आकार को बड़ा रखता है)।
    • यह सरल, दोहराव वाले विभागों में अधिक कटौती करता है।
  • परिणाम: कुल आकार काफी कम हो जाता है, लेकिन मॉडल का "मस्तिष्क" तेज बना रहता है क्योंकि महत्वपूर्ण हिस्सों को सुरक्षित रखा गया था। यह पूरी प्रक्रिया केवल कुछ मिनटों में पूरी हो जाती है और इसमें किसी री-ट्रेनिंग (पुनः प्रशिक्षण) की आवश्यकता नहीं होती (पुस्तकालय को नई चीजें सीखने की जरूरत नहीं है; इसे बस पुनर्गठित करने की आवश्यकता है)।

3. परिणाम: तेज़ और स्मार्ट

लेखकों ने कई प्रसिद्ध मॉडल्स (जैसे Llama-2 और Mistral) पर इसका परीक्षण किया और पाया:

  • बेहतर गुणवत्ता: अन्य संकुचन विधियों की तुलना में, FLAT-LLM मॉडल्स कम गलतियाँ करते हैं और बेहतर टेक्स्ट लिखते हैं (कम "परप्लेक्सिटी", जो कि एक तकनीकी शब्द है जिसका अर्थ है "कम भ्रमित होना")।
  • गति: क्योंकि मॉडल सुव्यवस्थित है और इसे अजीब अतिरिक्त पुलों की आवश्यकता नहीं है, यह मानक हार्डवेयर पर 1.5x से 1.6x तेज़ चलता है।
  • मेमोरी: यह काफी कम मेमोरी का उपयोग करता है, जिससे इन मॉडल्स को उन उपकरणों पर चलाना संभव हो जाता है जो पहले इन्हें संभालने में सक्षम नहीं थे।
  • कोई फाइन-ट्यूनिंग नहीं: अन्य तरीकों के विपरीत, जिन्हें संकुचन के कारण हुए नुकसान को ठीक करने के लिए हफ्तों के री-ट्रेनिंग की आवश्यकता होती है, FLAT-LLM पुनर्गठन के तुरंत बाद काम करता है।

सारांश

FLAT-LLM को एक स्मार्ट, सर्जिकल श्रिंक-रे (shrink-ray) के रूप में सोचें। मॉडल को बेरहमी से आधा काटने या उसके बड़े हिस्से को हटाने के बजाय, यह सावधानीपूर्वक विश्लेषण करता है कि मॉडल के कौन से हिस्से भारी काम कर रहे हैं और कौन से हिस्से केवल जगह भर रहे हैं। यह अतिरिक्त चर्बी को काटता है, मांसपेशियों को पुनर्वितरित करता है, और सब कुछ अधिक सघन रूप से पैक करता है, जिसके परिणामस्वरूप एक ऐसा मॉडल प्राप्त होता है जो मूल मॉडल की तुलना में छोटा, तेज़ और उतना ही स्मार्ट है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →