← नवीनतम पेपर
💬 NLP

ShapLoRA: Allocation of Low-rank Adaption on Large Language Models via Shapley Value Inspired Importance Estimation

यह शोध पत्र ShapLoRA का प्रस्ताव करता है, जो एक पैरामीटर-कुशल फाइन-ट्यूनिंग फ्रेमवर्क है जो 'शैपली सेंसिटिविटी' (Shapley sensitivity) नामक अधिक व्याख्यात्मक और विश्वसनीय महत्व माप को पेश करके मौजूदा रैंक आवंटन विधियों में सुधार करता है, जो विभिन्न कार्यों में उत्कृष्ट प्रदर्शन प्राप्त करने के लिए संवेदनशीलता विश्लेषण (sensitivity analysis) को शैपली वैल्यू (Shapley Value) अवधारणाओं के साथ जोड़ता है।

मूल लेखक: Yi Zhao, Qinghua Yao, Xinyuan song, Wei Zhu

प्रकाशित 2026-01-27
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yi Zhao, Qinghua Yao, Xinyuan song, Wei Zhu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक बड़ी तस्वीर: बिना भारी खर्च के एक विशाल मस्तिष्क को ट्यून करना

कल्प-ना कीजिए कि आपके पास एक विशाल, सुपर-इंटेलिजेंट रोबोटिक दिमाग (एक लार्ज लैंग्वेज मॉडल, या LLM) है जो लगभग सब कुछ जानता है। आप उसे एक विशिष्ट नया कौशल सिखाना चाहते हैं, जैसे गणित की समस्याओं को हल करना या सामान्य ज्ञान (trivia) के उत्तर देना।

इसे करने का पुराना तरीका "फुल फाइन-ट्यूनिंग" (Full Fine-Tuning) था। यह रोबोट के दिमाग को नए काम के अनुकूल बनाने के लिए 1,00,000 इंजीनियरों की एक टीम को पूरी तरह से नया रूप देने जैसा है। यह अविश्वसनीय रूप से महंगा है, इसके लिए कंप्यूटरों (GPUs) के एक विशाल गोदाम की आवश्यकता होती है, और इसमें बहुत समय लगता है।

LoRA (लो-रैंक अडैप्टेशन) एक स्मार्ट, बजट-अनुकूल विकल्प है। पूरे दिमाग को फिर से बनाने के बजाय, LoRA रोबोट में एक छोटा, हटाने योग्य "ट्रेनिंग मॉड्यूल" जोड़ देता है। यह रोबोट को ट्रेनिंग व्हील्स या एक 'चीट शीट' देने जैसा है। यह सस्ता और तेज़ है।

समस्या: LoRA का मानक संस्करण (जिसे "वैनिला LoRA" कहा जाता है) रोबोट के दिमाग के हर हिस्से के साथ एक जैसा व्यवहार करता है। यह हर सिंगल मॉड्यूल को प्रशिक्षण मॉड्यूल का बिल्कुल समान आकार देता है, चाहे उस हिस्से को वास्तव में उसकी आवश्यकता हो या न हो। यह एक ऐसे हिस्से को 10 पन्नों का निर्देश मैनुअल देने जैसा है जिसे केवल एक स्टिकी नोट की आवश्यकता है, जबकि दूसरा हिस्सा जो भारी काम कर रहा है, उसे भी वही स्टकी नोट मिलता है। यह अक्षम (inefficient) है।

समाधान: ShapLoRA (एक "फेयर शेयर" सिस्टम)

इस शोध पत्र के लेखकों ने ShapLoRA नामक एक नई विधि बनाई है। इसका लक्ष्य यह पता लगाना है कि रोबोट के दिमाग के प्रत्येक हिस्से को वास्तव में कितनी प्रशिक्षण शक्ति की आवश्यकता है, ताकि हम अनावश्यक भार को कम कर सकें और केवल आवश्यक क्षमता को बनाए रख सकें।

इसे करने के लिए, उन्होंने गेम थ्योरी (game theory) की एक अवधारणा का उपयोग किया जिसे शापली वैल्यू (Shapley Value) कहा जाता है।

उपमा: डिनर पार्टी और शापली वैल्यू

कल्पना कीजिए कि दोस्तों का एक समूह (रोबोट के मस्तिष्क के विभिन्न भाग) एक बेहतरीन डिनर (एक कार्य को हल करना) पकाने की कोशिश कर रहा है।

  • समस्या: स्वादिष्ट भोजन के लिए सबसे अधिक श्रेय किसे मिलना चाहिए? क्या प्याज काटने वाले व्यक्ति ने सबसे अधिक काम किया, या जिसने स्टेक को मसाला दिया?
  • पुराना तरीका: आप बस इस आधार पर अनुमान लगाते हैं कि कौन व्यस्त दिख रहा है।
  • शापली वैल्यू वाला तरीका: आप दोस्तों के मिलकर खाना पकाने के हर संभावित संयोजन (combination) का परीक्षण करते हैं।
    • आप देखते हैं कि केवल शेफ के साथ डिनर कितना अच्छा है।
    • आप देखते हैं कि शेफ और सहायक शेफ (sous-chef) के साथ यह कितना अच्छा है।
    • आप देखते हैं कि शेफ, सहायक शेफ और बर्तन धोने वाले के साथ यह कैसा है।
    • इन अलग-अलग "टीमों" (coalitions) की तुलना करके, आप गणितीय रूप से प्रत्येक व्यक्ति के सटीक योगदान की गणना कर सकते हैं।

ShapLoRA इस तर्क को रोबोट के दिमाग पर लागू करता है। यह प्रशिक्षण मॉड्यूल के प्रत्येक छोटे टुकड़े को एक खेल के "खिलाड़ी" के रूप में मानता है। यह यादृच्छिक (randomly) रूप से कुछ खिलाड़ियों को "बंद" (mask) कर देता है और देखता है कि रोबोट के प्रदर्शन में क्या बदलाव आता है। ऐसा हजारों बार अलग-अलग रैंडम समूहों के साथ करने से, यह एक "शापली सेंसिटिविटी" (Shapley Sensitivity) स्कोर की गणना करता है।

  • उच्च स्कोर (High Score): यह मस्तिष्क का हिस्सा महत्वपूर्ण है। यदि आप इसे बंद कर देते हैं, तो रोबलेट विफल हो जाता है। इसे एक बड़ा प्रशिक्षण मॉड्यूल दें।
  • कम स्कोर (Low Score): यह हिस्सा बहुत ज्यादा कुछ नहीं कर रहा है। यदि आप इसे बंद कर देते हैं, तो रोबोट फिर भी ठीक से काम करता है। इसके प्रशिक्षण मॉड्यूल को छोटा कर दें या इसे पूरी तरह से हटा दें।

यह कैसे काम करता है (कार्यप्रवाह)

  1. बड़े से शुरुआत करें: वे रोबोट के प्रत्येक हिस्से को एक बड़ा, समान आकार का प्रशिक्षण मॉड्यूल देकर शुरुआत करते हैं।
  2. "टेस्ट ऑफ टेस्ट" (वैलिडेशन): वे रोबोट को प्रश्नों के एक विशिष्ट सेट पर अभ्यास करने देते हैं (एक वैलिडेशन सेट)। इस अभ्यास के दौरान, वे भागों को चालू और बंद करने के हर संभावित संयोजन का परीक्षण करने के लिए "शापली वैल्यू" गेम का उपयोग करते हैं।
  3. कटौती (The Cut): स्कोर के आधार पर, वे मस्तिष्क के "आलसी" हिस्सों की पहचान करते हैं। वे इन प्रशिक्षण मॉड्यूल्स को काट (prune) देते हैं, जिससे "मेहनती" हिस्सों के मॉड्यूल्स बड़े रहते हैं।
  4. अंतिम प्रशिक्षण: वे इस नए, अनुकूलित और कुशल सेटअप के साथ रोबोट को फिर से प्रशिक्षित करते हैं।

यह बेहतर क्यों है?

शोध पत्र का दावा है कि ShapLoRA दो मुख्य कारणों से पिछले तरीकों (जैसे AdaLoRA या AutoLoRA) से बेहतर है:

  1. यह अधिक निष्पक्ष और स्मार्ट है: पिछले तरीकों ने ऐसी "संवेदनशीलता" स्कोर का उपयोग किया जो केवल एक समय में एक चीज़ को देखती थी (उदाहरण के लिए, "यदि मैं इस एक नंबर को बदल दूँ, तो क्या स्कोर बढ़ जाता है?")। ShapLoRA टीमवर्क को देखता है। यह समझता है कि एक हिस्सा अकेले बेकार हो सकता है लेकिन दूसरों के साथ काम करते समय आवश्यक हो सकता है।
  2. यह अधिक विश्वसनीय है: उन्होंने कई अलग-अलग कार्यों (जैसे प्रश्न पूछना, गणित हल करना और कोड लिखना) पर इस पद्धति का परीक्षण किया। लगभग हर मामले में, ShapLoRA ने अन्य शीर्ष तरीकों की तुलना में बेहतर परिणाम दिए, भले ही उन सभी ने लगभग समान मात्रा में कंप्यूटर पावर का उपयोग किया हो।

परिणाम

लेखकों ने इसका परीक्षण एक लोकप्रिय रोबोट ब्रेन (LLaMA-3 8B) पर किया।

  • प्रदर्शन (Performance): ShapLoRA ने लगातार प्रतिस्पर्धा को पछाड़ दिया। उदाहरण के लिए, गणित और सामान्य ज्ञान के कार्यों पर, इसने उच्च सटीकता स्कोर प्राप्त किया।
  • दक्षता (Efficiency): इसे प्रशिक्षित करने में अन्य तरीकों की तुलना में बहुत अधिक समय नहीं लगा। संयोजनों के परीक्षण का "खेल" गणनात्मक रूप से भारी था, लेकिन उन्होंने इसे स्मार्ट तरीके से अनुमानित करने का एक तरीका खोजा ताकि यह बहुत धीमा न हो जाए।
  • स्थिरता (Stability): उन्होंने अलग-अलग रैंडम सीड्स के साथ परीक्षण को कई बार चलाया, और परिणाम बहुत सुसंगत थे। यह तरीका केवल भाग्यशाली नहीं था; यह मजबूत (robust) था।

संक्षेप में

ShapLoRA एक ऐसी विधि है जो AI के मस्तिष्क के हर हिस्से के साथ समान व्यवहार करना बंद करती है। इसके बजाय, यह गेम थ्योरी से प्रेरित एक "टीमवर्क टेस्ट" का उपयोग करता है ताकि यह पता लगाया जा सके कि मस्तिष्क के कौन से हिस्से वास्तव में भारी काम कर रहे हैं। फिर यह आलसी हिस्सों के लिए प्रशिक्षण मॉड्यूल को छोटा कर देता है और मेहनती हिस्सों के लिए उन्हें बड़ा रखता है। परिणाम एक ऐसा AI है जो उतना ही स्मार्ट है, लेकिन इसे प्रशिक्षित करना अधिक कुशल और सस्ता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →