← नवीनतम पेपर
🤖 AI

Sparsity-Aware Low-Rank Representation for Efficient Fine-Tuning of Large Language Models

यह शोधपत्र SALR को प्रस्तुत करता है, जो एक नवीन फाइन-ट्यूनिंग प्रतिमान (paradigm) है जो मानक LoRA के समान प्रदर्शन बनाए रखते हुए 50% स्पर्सिटी (sparsity), 2x मॉडल संपीड़न (compression) और 1.7x तक अनुमान गति (inference speedup) प्राप्त करने के लिए फ्रोजन बेस वेट्स की स्पर्स प्रूनिंग को लो-रैंक एडेप्टर्स के साथ एकीकृत करता है।

मूल लेखक: Longteng Zhang, Sen Wu, Shuai Hou, Zhengyu Qing, Zhuo Zheng, Danning Ke, Qihong Lin, Qiang Wang, Shaohuai Shi, Xiaowen Chu

प्रकाशित 2026-07-21
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Longteng Zhang, Sen Wu, Shuai Hou, Zhengyu Qing, Zhuo Zheng, Danning Ke, Qihong Lin, Qiang Wang, Shaohuai Shi, Xiaowen Chu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक विशाल, सुपर-स्मार्ट रोबोट दिमाग है जो दुनिया के बारे में लगभग सब कुछ जानता है। यह वैज्ञानिकों द्वारा इस्तेमाल किया जाने वाला एक शब्द है: "लार्ज लैंग्वेज मॉडल" (LLM)। ये दिमाग अद्भुत होते हैं, लेकिन ये बहुत भारी और बिजली के भूखे भी होते हैं, जैसे कि एक फेरारी जिसे किराने की दुकान तक जाने के लिए भी एक विशेष ईंधन ट्रक की आवश्यकता होती है। क्योंकि ये इतने बड़े होते हैं, इसलिए इन्हें सामान्य कंप्यूटर या फोन पर रखना कठिन होता है।

इसे ठीक करने के लिए, शोधकर्ताओं ने इन विशाल दिमागों को पूरे इंजन को फिर से बनाए बिना नए करतब सिखाने की कोशिश की है। एक लोकप्रिय तरीका है LoRA, जो इस दिमाग में एक छोटा, अलग किया जा सकने वाला "प्रशिक्षण मैनुअल" जोड़ने जैसा है। पूरे दिमाग को फिर से लिखने के बजाय, आप बस इस छोटे मैनुअल में थोड़ा बदलाव करते हैं। लेकिन इस मैनुअल के साथ भी, दिमाग अभी भी विशाल और धीमा है क्योंकि मूल इंजन अभी भी वहीं है, जो जगह घेर रहा है। एक अन्य विचार है दिमाग को "प्रून" करना (छंटाई करना)—उन हिस्सों को काट देना जो बेकार लगते हैं, जैसे कि एक झाड़ी की छंटाई करना। लेकिन यदि आप बेतरतीब ढंग से काटते हैं, तो दिमाग अक्सर वह भूल जाता है जो उसे सीखना था, जैसे कि एक छात्र जो अपनी पाठ्यपुस्तक फेंक देता है और उत्तरों का अनुमान लगाने की कोशिश करता है। बड़ा सवाल यह है: क्या हम चर्बी को काट सकते हैं और मांसपेशियों को बरकरार रख सकते हैं, जिससे दिमाग को मूर्ख बनाए बिना उसे छोटा और तेज़ बनाया जा सके?

यहाँ आता है SALR (स्पैरसिटी-अवेयर लो-रैंक रिप्रेजेंटेशन), जो एक चतुर शेफ और एक स्मार्ट मैकेनिक दोनों की तरह काम करता है। शोधकर्ताओं ने पाया कि यदि आप सीखने के दौरान दिमाग की छंटाई करने की कोशिश करते हैं, तो आप अक्सर उस नाजुक "लो-रैंक" संरचना को बिगाड़ देते हैं—जो वे विशेष शॉर्टकट हैं जिनका उपयोग दिमाग तेजी से सीखने के लिए करता है। उन्होंने गणितीय रूप से सिद्ध किया कि छंटाई करने का सबसे अच्छा तरीका मूल, स्थिर (frozen) हिस्सों को काटना है, जिससे सीखने के नए शॉर्टकट सुरक्षित रहें। लेकिन यहाँ एक पेंच है: जब आप कुछ काटते हैं, तो आप जानकारी खो देते हैं। यदि आप कटे हुए टुकड़ों को बस कचरे में फेंक देते हैं, तो दिमाग खराब हो जाता है।

SALR इसे काटकर प्राप्त टुकड़ों को एक कीमती रहस्य की तरह मानकर हल करता है। इन टुकड़ों को फेंकने के बजाय, यह विधि कटे हुए हिस्सों से प्राप्त "बचे हुए" (leftover) डेटा को कैप्चर करती है और उसे एक छोटे, संकुचित "रेसिड्यूअल" (अवशिष्ट) पॉकेट में स्टोर करती है। इसे ऐसे समझें: कल्पना कीजिए कि आप एक विशाल विश्वकोश (encyclopedia) को संपादित कर रहे हैं। आप जगह बचाने के लिए उसके 50% पन्ने हटाने का निर्णय लेते हैं। यदि आप उन्हें बस हटा देते हैं, तो आप आधी जानकारी खो देंगे। लेकिन SALR एक जीनियस संपादक की तरह है जो, पन्ने हटाने से पहले, उन हटाए गए पन्नों के सबसे महत्वपूर्ण तथ्यों का एक सुपर-शॉर्ट, 1-पेज का सारांश लिखता है। फिर वह इस सारांश को किताब से जुड़े एक विशेष, छोटे पॉकेट में रख देता है। जब आप बाद में किताब पढ़ते हैं, तो दिमाग सब कुछ पूरी तरह से याद रखने के लिए मुख्य पन्नों और उस छोटे सारांश का उपयोग करता है।

पेपर दिखाता है कि यह दृष्टिकोण अविश्वसनीय रूप से अच्छा काम करता है। "ट्रंकेटेड SVD" (जो बचे हुए डेटा से सबसे महत्वपूर्ण पैटर्न खोजने का एक फैंसी तरीका है) नामक गणितीय ट्रिक का उपयोग करके, वे मॉडल के आकार को 2 गुना (आधा करना) कम कर सकते हैं, जबकि इसकी सटीकता को अनट्रिम्ड संस्करण के समान उच्च बनाए रख सकते हैं। GSM8K (एक गणित चुनौती) और MMLU (एक सामान्य ज्ञान परीक्षण) जैसे परीक्षणों पर, SALR ने भारी मॉडलों के समान ही उच्च स्कोर बनाए रखा। उदाहरण के लिए, Llama3-8B नामक मॉडल पर, इसने गणित की समस्याओं पर 79.5% सटीकता प्राप्त की, जो भारी संस्करण के बिल्कुल बराबर है, लेकिन आधे मेमोरी के साथ।

इससे भी बेहतर, शोधकर्ताओं ने केवल फ़ाइल को छोटा करने पर ही नहीं रोका; उन्होंने इसे तेज़ भी बनाया। उन्होंने सभी छोटे "पॉकेट्स" को एक बड़े, कुशल कैलकुलेशन में मिलाने का तरीका निकाला, और डेटा को तेज़ी से पढ़ने के लिए एक विशेष "दो-चरणीय पाइपलाइन" डिज़ाइन की, जैसे कि एक फैक्ट्री असेंबली लाइन जो पुर्जों का इंतज़ार करने के लिए नहीं रुकती। इस सेटअप ने मॉडल को मानक संस्करण की तुलना में 1.7 गुना तेज़ चलने में सक्षम बनाया। इसके विपरीत, अन्य तरीकों ने, जिन्होंने मॉडलों की छंटाई करने की कोशिश की, अक्सर उनकी सटीकता में भारी गिरावट देखी (जैसे कि 71.4% या उससे कम तक गिरना) या वे वास्तव में कंप्यूटर की गति बढ़ाने में विफल रहे क्योंकि डेटा अभी भी कुशलता से प्रोसेस करने के लिए बहुत अव्यवस्थित था।

संक्षेप में, SALR साबित करता है कि आपको एक स्मार्ट, भारी दिमाग और एक छोटे, धीमे दिमाग के बीच चुनाव करने की आवश्यकता नहीं है। यह समझकर कि क्या काटना है और कैसे अवशेषों को बचाना है, आप एक ऐसा मॉडल प्राप्त कर सकते हैं जो हल्का भी है और बिजली की तरह तेज़ भी, जो उन उपकरणों में फिट होने के लिए तैयार है जो पहले इसे संभाल नहीं सकते थे। पेपर विभिन्न बड़े मॉडलों पर विभिन्न परीक्षणों के साथ यह प्रदर्शित करता है कि 50% स्पैरसिटी (वजन को आधा काटना) के साथ, आप दोनों दुनिया का सर्वश्रेष्ठ प्राप्त कर सकते हैं: दिमाग भी तेज रहता है, और कंप्यूटर भी खुश रहता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →