← नवीनतम पेपर
🤖 AI

DR-LoRA: Dynamic Rank LoRA for Fine-Tuning Mixture-of-Experts Models

DR-LoRA एक डायनेमिक रैंक एडेप्टेशन फ्रेमवर्क है जो मिक्सचर-ऑफ-एक्सपर्ट्स मॉडल्स को फाइन-ट्यून करने के लिए डिज़ाइन किया गया है, जो रूटिंग फ्रीक्वेंसी और ग्रेडिएंट इम्पॉर्टेंस के आधार पर टास्क-क्रिटिकल एक्सपर्ट्स के रैंक को प्रगतिशील रूप से बढ़ाकर यूनिफॉर्म पैरामीटर एलोकेशन की अक्षमता को संबोधित करता है, जिससे विषम रैंक वितरण के माध्यम से बेहतर प्रदर्शन प्राप्त होता है।

मूल लेखक: Guanzhi Deng, Bo Li, Ronghao Chen, Xiujin Liu, Zhuo Han, Huacan Wang, Lijie Wen, Linqi Song

प्रकाशित 2026-04-02
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Guanzhi Deng, Bo Li, Ronghao Chen, Xiujin Liu, Zhuo Han, Huacan Wang, Lijie Wen, Linqi Song

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास 100 विशिष्ट सलाहकारों (विशेषज्ञों) की एक विशाल टीम है जो एक बड़ी कंपनी (लार्ज लैंग्वेज मॉडल) के लिए काम करती है। ये विशेषज्ञ अविश्वसनीय रूप से बुद्धिमान हैं, लेकिन वे सभी एक जैसा काम नहीं करते हैं। कुछ गणित के जादूगर हैं, कुछ कोडिंग के जीनियस हैं, और कुछ कानूनी अनुबंध लिखने में माहिर हैं।

जब कंपनी को किसी विशिष्ट समस्या को हल करने की आवश्यकता होती है, जैसे "स्टॉक डेटा का विश्लेषण करने के लिए एक पायथन स्क्रिप्ट लिखें," तो एक मैनेजर (राउटर) केवल कुछ विशेषज्ञों को ही कार्य के लिए चुनता है। बाकी लोग खाली बैठे रहते हैं। Mixture-of-Experts (MoE) मॉडल इसी तरह काम करते हैं: वे बहुत बड़े होते हैं, लेकिन किसी भी समय उनका केवल एक छोटा हिस्सा ही "सक्रिय" होता है।

समस्या: "एक ही आकार सबके लिए" (One-Size-Fits-All) वाली गलती

अब, कल्पना कीजिए कि कंपनी इन विशेषज्ञों को एक नए, विशिष्ट प्रोजेक्ट के लिए प्रशिक्षित करना चाहती है: मेडिकल डायग्नोसिस (चिकित्सा निदान)

वर्तमान विधि (जिसे LoRA कहा जाता है) ऐसी है जैसे इमारत के हर एक विशेषज्ञ को उनके काम की परवाह किए बिना, प्रशिक्षण के लिए बिल्कुल समान बजट और समान संख्या में नए उपकरण देना।

  • गणित के जादूगर को 10 नए उपकरण मिलते हैं।
  • कानूनी विशेषज्ञ को 10 नए उपकरण मिलते हैं।
  • मेडिकल विशेषज्ञ को 10 नए उपकरण मिलते हैं।

यहाँ एक दोष है:

  1. मेडिकल विशेषज्ञ को 90% समय बुलाया जाएगा। वे काम के बोझ तले दबे हुए हैं और जटिल चिकित्सा मामलों को संभालने के लिए उन्हें वास्तव में अधिक उपकरणों (क्षमता) की आवश्यकता है। लेकिन उन्हें केवल 10 ही मिले। वे कम सुसज्जित हैं।
  2. कानूनी विशेषज्ञ को शायद कभी-कभार ही बुलाया जाएगा। उन्हें 10 उपकरण मिले, लेकिन उन्हें केवल 2 की आवश्यकता है। बाकी 8 उपकरण बस धूल फांक रहे हैं, जिससे पैसा और जगह बर्बाद हो रही है।

इसे रिसोर्स मिसमैच (संसाधन बेमेल) कहा जाता है। यह प्रणाली अक्षम है क्योंकि यह सबको एक जैसा मानती है, भले ही उनकी भूमिकाएं पूरी तरह से अलग हों।

समाधान: DR-LoRA (डायनेमिक मैनेजर)

इस शोध पत्र के लेखक एक नया मैनेजर प्रस्तावित करते हैं जिसे DR-LoRA (डायनेमिक रैंक LoRA) कहा जाता है। सबको पहले से ही समान उपकरण देने के बजाय, DR-LoRA एक स्मार्ट और चौकस पर्यवेक्षक की तरह काम करता है जो टीम को काम करते हुए देखता है और वास्तविक समय में संसाधनों को समायोजित करता है।

DR-LoRA कैसे काम करता है, इसके चरण यहाँ दिए गए हैं:

1. शुरुआत छोटी करें (बीज/Seed)

शुरुआत में, DR-LoRA प्रत्येक विशेषज्ञ को एक बहुत ही बुनियादी टूलकिट (एक छोटा "रैंक") देता है। यह एक पेन और एक नोटबुक देने जैसा है। यह सस्ता है और इसमें जगह बर्बाद नहीं होती।

2. देखें और स्कोर दें (सेलिएंसी स्कोर/Saliency Score)

जैसे ही टीम मेडिकल डायग्नोसिस प्रोजेक्ट पर काम करना शुरू करती है, DR-LoRA प्रत्येक विशेषज्ञ के लिए दो चीजें देखता है:

  • आवृत्ति (Frequency): इस विशेषज्ञ को मीटिंग के लिए कितनी बार बुलाया जा रहा है? (क्या मेडिकल विशेषज्ञ को लगातार उपयोग किया जा रहा है?)
  • सीखने की तीव्रता (Learning Intensity): जब वे काम कर रहे होते हैं, तो क्या वे संघर्ष कर रहे हैं और नई चीजें सीख रहे हैं, या वे पहले से ही इसमें महारत हासिल कर चुके हैं? (क्या मेडिकल विशेषज्ञ अभी भी चीजों को समझ रहे हैं, या वे बस सहजता से काम चला रहे हैं?)

DR-LoRA इन दोनों को एक "सेलिएंसी स्कोर" में मिला देता है।

  • उच्च स्कोर: "यह विशेषज्ञ बहुत अधिक उपयोग किया जा रहा है और वे अभी भी सीख रहे हैं। उन्हें अधिक उपकरणों की आवश्यकता है!"
  • कम स्कोर: "यह विशेषज्ञ शायद ही कभी उपयोग किया जाता है या वे पहले ही काम पूरा कर चुके हैं। उन्हें और अधिक उपकरणों की आवश्यकता नहीं है।"

3. गतिशील रूप से बढ़ें (विस्तार/Expansion)

हर कुछ घंटों में, DR-LoRA स्कोर की जांच करता है।

  • मेडिकल विशेषज्ञ का स्कोर बहुत अधिक है। DR-LoRA कहता है, "ठीक है, आपको एक नया टूलबॉक्स मिलता है!" (उनका रैंक बढ़ता है)।
  • कानूनी विशेषज्ञ का स्कोर कम है। DR-LoRA कहता है, "आप अपनी छोटी नोटबुक के साथ ही रहें। अभी आपको और अधिक उपकरणों की आवश्यकता नहीं है।"

यह प्रक्रिया बार-बार होती है। समय के साथ, मेडिकल विशेषज्ञ के पास एक विशाल, उच्च-तकनीकी लैब (एक बड़ा रैंक) होती है, जबकि कानूनी विशेषज्ञ के पास एक छोटा किट रहता है। सिस्टम वहां क्षमता बढ़ाता है जहां इसकी आवश्यकता है, न कि वहां से छंटनी (कटौती) करता है जहां इसकी जरूरत नहीं है।

यह पुराने तरीके से बेहतर क्यों है?

  • पुराना तरीका (AdaLoRA): कल्पना कीजिए कि आप सभी के लिए एक विशाल टूलबॉक्स से शुरुआत करते हैं और फिर उन लोगों से उपकरण वापस लेने की कोशिश करते हैं जिन्हें उनकी आवश्यकता नहीं है। समस्या यह है कि यदि किसी विशेषज्ञ को बहुत कम बुलाया जाता है, तो आप यह नहीं बता सकते कि वे "काम पूरा कर चुके हैं" या वे सिर्फ "बोर हो रहे हैं" क्योंकि आप उन्हें पर्याप्त काम करते हुए नहीं देख पाते। आप अनजाने में उनके उपकरण बहुत जल्दी वापस ले सकते हैं।
  • DR-LoRA: यह छोटा होकर शुरू होता है और केवल तभी उपकरण जोड़ता है जब वह पूरी तरह आश्वस्त हो जाता है कि विशेषज्ञ को उनकी आवश्यकता है। यह बहुत अधिक सुरक्षित और सटीक है, विशेष रूप से तब जब विशेषज्ञों को कभी-कभी ही बुलाया जाता है (स्पार्स रूटिंग)।

परिणाम

DR-LoRA का उपयोग करके, कंपनी को दोनों दुनियाओं का सर्वश्रेष्ठ मिलता है:

  1. दक्षता (Efficiency): उन विशेषज्ञों को उपकरण देकर पैसा बर्बाद नहीं किया जाता जिन्हें उनकी आवश्यकता नहीं है।
  2. प्रदर्शन (Performance): जो विशेषज्ञ भारी काम संभालते हैं, उन्हें जटिल समस्याओं को पूरी तरह से हल करने के लिए आवश्यक सुपर-टूल्स मिलते हैं।

शोध पत्र के प्रयोगों में, इस पद्धति ने AI मॉडलों को गणित, कोडिंग और चिकित्सा जैसे कार्यों में मानक "एक ही आकार सबके लिए" वाले दृष्टिकोण की तुलना में काफी अधिक स्मार्ट बनाया, और यह सब बिना अधिक कंप्यूटर मेमोरी की आवश्यकता के किया गया।

संक्षेप में: DR-LoRA हर विशेषज्ञ को एक क्लोन की तरह व्यवहार करने से रोकता है। यह पहचानता है कि कुछ विशेषज्ञ शो के "सितारे" हैं और उन्हें चमकने के लिए आवश्यक अतिरिक्त संसाधन देता है, जबकि दूसरों को न्यूनतम संसाधनों के साथ रहने देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →