← नवीनतम पेपर
🤖 machine learning

Train Large, Deploy Compact: Structured Compression for Compact Low-Rank Adaptation

यह शोध पत्र PrunedLoRA प्रस्तुत करता है, जो एक नवीन ढांचा है जो ओवर-पैरामीटराइज्ड स्पेस से अत्यधिक अभिव्यंजक लो-रैंक एडेप्टर प्राप्त करने और रैंक को गतिशील रूप से आवंटित करने के लिए ग्रेडिएंट-आधारित स्ट्रक्चर्ड प्रूनिंग का उपयोग करता है, जो सैद्धांतिक रूप से इसकी मजबूती को सिद्ध करता है और मौजूदा LoRA वेरिएंट्स एवं प्रूनिंग विधियों की तुलना में विविध फाइन-ट्यूनिंग कार्यों में बेहतर प्रदर्शन को अनुभवजन्य रूप से प्रदर्शित करता है।

मूल लेखक: Xin Yu, Cong Xie, Xunmei Liu, Tiantian Fan, Lingzhou Xue, Zhi Zhang

प्रकाशित 2026-07-30
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xin Yu, Cong Xie, Xunmei Liu, Tiantian Fan, Lingzhou Xue, Zhi Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, अत्यंत बुद्धिमान रोबोट को एक नई भाषा बोलना या एक विशिष्ट प्रकार की पहेली हल करना सिखाने की कोशिश कर रहे हैं। रोबोट पहले से ही अविश्वसनीय रूप से जानकार है, लेकिन वह बहुत विशाल है—इतना बड़ा कि उसे एक नया कौशल सिखाने के लिए उसके पूरे मस्तिष्क को फिर से लिखना अनंत काल ले लेगा और इसके लिए एक गोदाम के आकार के कंप्यूटर की आवश्यकता होगी। यह "लार्ज लैंग्वेज मॉडल्स" (Large Language Models) की दुनिया है, जहाँ वैज्ञानिक लगातार इन दिग्गजों को एक नया कौशल सिखाने के तरीके खोज रहे हैं बिना भारी खर्च या कंप्यूटर संसाधनों को बर्बाद किए।

इस समस्या को हल करने के लिए, शोधकर्ताओं ने एक चतुर तकनीक खोजी जिसे LoRA (लो-रैंक अडैप्टेशन) कहा जाता है। सोचिए कि विशाल रोबोट एक विशाल पुस्तकालय है। लाइब्रेरी की हर एक किताब को नया कौशल सिखाने के लिए फिर से लिखने के बजाय, LoRA उस लाइब्रेरी के बगल में एक छोटा, हल्का नोटबुक जोड़ देता है। आप केवल इस छोटे नोटबुक को प्रशिक्षित करते हैं, और जब रोबोट को किसी प्रश्न का उत्तर देने की आवश्यकता होती है, तो वह मुख्य लाइब्रेरी और उस छोटे नोटबुक को एक साथ पढ़ता है। यह तेज़, सस्ता और कुशल है। हालाँकि, इसमें एक पेच है: क्योंकि नोटबुक बहुत छोटा है, इसलिए कभी-कभी यह उस सूक्ष्मता और विवरण को चूक जाता है जो पूरे मस्तिष्क को फिर से लिखने से मिल सकता था। यह एक जटिल फिल्म की कहानी को केवल तीन स्टिकी नोट्स (sticky notes) के माध्यम से समझाने जैसा है; आप मूल बात समझ तो जाते हैं, लेकिन उसका जादू खो देते हैं।

यहाँ मुख्य सवाल है: क्या हम बारीकियों को पूरी तरह से सीखने के लिए एक बड़ा, अधिक अभिव्यंजक नोटबुक शुरू कर सकते हैं, और फिर सीखने के बाद उसे एक छोटे आकार में सिकोड़ सकते हैं, बिना वह जादू खोए? यह ठीक वही है जिसे ByteDance Seed और द पेंसिल्वेनिया स्टेट यूनिवर्सिटी का एक नया शोध पत्र (paper) संबोधित करता है। वे PrunedLoRA नामक एक विधि प्रस्तावित करते हैं। प्रशिक्षण के पहले सेकंड से ही नोटबुक को छोटा रखने के बजाय, वे इसे बड़ा होने और स्वतंत्र रूप से सीखने देते हैं। फिर, प्रशिक्षण प्रक्रिया के दौरान, वे एक कुशल संपादक की तरह कार्य करते हैं, नोटबुक के अनावश्यक हिस्सों को सावधानीपूर्वक काटते हैं ताकि वह फिर से संक्षिप्त हो जाए। परिणाम क्या है? एक छोटा, कुशल अडैप्टर जो लगभग उतना ही याद रखता है जितना कि पूरे विशाल मस्तिष्क को फिर से लिखने से मिलता, लेकिन बिना उस भारी लागत के।

"बड़ा करो फिर तराशों" (Grow-Then-Trim) रणनीति की कहानी

शोधकर्ताओं ने एक दिलचस्प बात देखी: यदि आप LoRA नोटबुक को एक बड़ा रैंक (मूल रूप से अधिक पृष्ठ) देते हैं, तो यह अधिक स्मार्ट हो जाता है। वास्तव में, यदि आप इसे पर्याप्त बड़ा बना देते हैं, तो यह लगभग उस प्रदर्शन से मेल खाता है जो पूरे रोबोट के मस्तिष्क को फिर से लिखने से मिलता है। लेकिन हम इसे हमेशा के लिए बड़ा नहीं रख सकते क्योंकि हमें अंतिम उत्पाद के लिए इसे छोटा रखना होता है। इसलिए, उन्होंने पूछा: क्या होगा यदि हम बड़े से शुरू करें और छोटे की ओर बढ़ें?

यहाँ आता है PrunedLoRA। कल्पना कीजिए कि आप एक मूर्ति गढ़ रहे हैं। पुराना तरीका (मानक LoRA) तुरंत मिट्टी के एक छोटे ब्लॉक से अंतिम मूर्ति तराशने जैसा था। आप सीमित हैं कि आपके पास कितना मिट्टी उपलब्ध है। नया तरीका (PrunedLoRA) एक विशाल संगमरमर के ब्लॉक से शुरू करने जैसा है। आप काम के दौरान ही अतिरिक्त पत्थर को तराशते रहते हैं, आकार को परिष्कृत करते हुए। जब तक आप समाप्त करते हैं, आपके पास एक पूर्ण, संक्षिप्त मूर्ति होती है, लेकिन आपके पास बड़े ब्लॉक के साथ काम करते समय सभी जटिल विवरणों को खोजने की स्वतंत्रता थी।

यह कैसे काम करता है: "स्मार्ट कैंची" (Smart Scissors)

PrunedLoRA का जादू इस बात में निहित है कि यह नोटबुक को कैसे काटता है। यह तय करने के दो मुख्य तरीके हैं कि क्या काटना है:

  1. "एक्टिवेशन" (Activation) विधि: यह देखता है कि नोटबुक का एक हिस्सा अभी कितना उपयोग किया जा रहा है। यदि एक पेज को बहुत कम पढ़ा जा रहा है, तो उसे काट दें।
  2. "ग्रेडिएंट" (Gradient) विधि (पेपर का चुनाव): यह देखता है कि नोटबुक का एक हिस्सा रोबोट को सीखने में कितनी मदद करता है। यह पूछता है, "यदि मैं इस पेज को हटा दूँ, तो पूरी कहानी की समझ में रोबोट को कितनी क्षति होगी?"

पेपर का तर्क है कि दूसरा तरीका बहुत अधिक मजबूत (robust) है। उन्होंने रोबनों के ध्यान केंद्रित करने के तरीके (जिसे "सेल्फ-अटेंशन" कहा जाता है) के एक सरलीकृत मॉडल पर सिमुलेशन चलाया और पाया कि "ग्रेडिएंट" विधि गलतियों को संभालने में बेहतर है। यदि आप गलती से वेट्स (weights - नोटबुक के अंदर की संख्याएँ) को हिला देते हैं, तो "एक्टिवेशन" विधि पूरी कहानी को बिगाड़ सकती है, लेकिन "ग्रेडिएंट" विधि कहानी को बरकरार रखती है। यह एक धागे को इसलिए काटने के बीच के अंतर जैसा है क्योंकि वह ढीला दिखता है (Activation) बनाम एक धागे को इसलिए काटने के बीच का अंतर क्योंकि आप जानते हैं कि वह संरचना को थामे रखने के लिए आवश्यक नहीं है (Gradient)। दूसरा तरीका बहुत अधिक सुरक्षित है।

परिणाम: छोटे पदचिह्न के साथ बड़ी जीत

टीम ने कठिन कार्यों पर इसका परीक्षण किया: गणित की समस्याओं को हल करना, कोड लिखना और मानव भाषा को समझना। उन्होंने अपने "बड़ा करो फिर तराशों" (Grow-Then-Trim) तरीके की तुलना मानक छोटे नोटबुक, छोटे नोटबुक के अन्य फैंसी संस्करणों और यहाँ तक कि विशाल "पूरे मस्तिष्क को फिर से लिखने" वाले दृष्टिकोण से की।

उन्होंने यह पाया:

  • मामूली शुरुआती आकार के साथ भी: यदि उन्होंने अंतिम लक्ष्य से दोगुना बड़ा नोटबुक (उदाहरण के लिए, 64 पेज से शुरू करके 8 तक छाँटना) से शुरुआत की, तो भी PrunedLoRA ने मानक छोटे नोटबुक को पछाड़ दिया। इसने गणित (GSM8K) और कोडिंग चुनौतियों (HumanEval) में बेहतर स्कोर प्राप्त किया।
  • बड़े बजट के साथ: यदि उन्हें एक विशाल नोटबुक (512 पेज तक) के साथ शुरू करने और उसे 64 तक छाँटने की अनुमति दी गई, तो परिणाम आश्चर्यजनक थे। PrunedLo la मॉडल ने गणित में 74.88 और कोडिंग में 48.31 का स्कोर प्राप्त किया। ये संख्याएँ "फुल फाइन-ट्यूनिंग" (पूरे मस्तिष्क को फिर से लिखने) के स्कोर 73.48 और 48.28 के अविश्वसनीय रूप से करीब हैं।
  • लागत: सबसे अच्छी बात? भले ही उन्होंने एक बड़े नोटबुक के साथ शुरुआत की, लेकिन इसे प्रशिक्षित करने के लिए आवश्यक मेमोरी पूरे मस्तिष्क को फिर से लिखने की तुलना में बहुत कम थी। उदाहरण के लिए, 64 रैंक के साथ एक मानक LoRA को प्रशिक्षित करने में लगभग 2 घंटे और 28 मिनट लगे। PrunedLoRA, उच्च शुरुआती रैंक के साथ भी, केवल लगभग 2 घंटे और 29 मिनट से 3 घंटे और 23 मिनट (शुरुआत के आकार के आधार पर) तक लगा। "ट्रिमिंग" प्रक्रिया के लिए अतिरिक्त समय बहुत कम था—केवल कुछ मिनट।

यह क्यों महत्वपूर्ण है

यह पेपर सुझाव देता है कि हमें एक "बेवकूफ लेकिन छोटे" अडैप्टर और एक "स्मार्ट लेकिन विशाल" अडैप्टर के बीच चयन करने की आवश्यकता नहीं है। एक संरचित प्रूनिंग रणनीति (pruning strategy) का उपयोग करके जो इस बात से निर्देशित है कि रोबोट कैसे सीखता है (ग्रेडिएंट), हम एक विशाल, ओवर-पैरामीटराइज्ड दुनिया में प्रशिक्षित हो सकते हैं और फिर इसे एक सुव्यवस्थित, कुशल उपकरण में संकुचित कर सकते हैं।

यह उन लोगों के लिए बहुत बड़ी बात है जो अपने स्वयं के उपकरणों पर AI चलाना चाहते हैं या उन कंपनियों के लिए जिन्हें प्रत्येक कार्य के लिए एक विशाल मॉडल स्टोर किए बिना हजारों अलग-अलग कार्यों को संचालित करने की आवश्यकता है। PrunedLoRA दिखाता है कि आप उच्च प्रदर्शन (high performance) भी प्राप्त कर सकते हैं और कम मेमोरी लागत (low memory cost) भी, जब तक कि आप बड़े से शुरू करने और सही तरह की कैंची के साथ अतिरिक्त हिस्से को काटने के लिए तैयार हैं। लेखक दिखाते हैं कि यह दृष्टिकोण "स्पैरसिटी" (sparsity - कितनी कटौती की जाती है) के विभिन्न स्तरों पर काम करता है और लगातार उन अन्य तरीकों को मात देता है जो मॉडलों को छाँटने (prune करने) का प्रयास करते हैं। यह एक याद दिलाता है कि कभी-कभी, सबसे अच्छा छोटा परिणाम पाने के लिए, आपको बड़े से शुरू करने का साहस दिखाना पड़ता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →