← नवीनतम पेपर
💬 NLP

PreLort: Prefix-Nested LoRA for Federated Fine-Tuning under Rank Heterogeneity

PreLort, सेगमेंट-वाइज एग्रीगेशन (segment-wise aggregation) और मल्टी-ट्रंकेशन ट्रेनिंग (multi-truncation training) के साथ एक प्रीफिक्स-नेस्टेड लोरा (prefix-nested LoRA) फॉर्मूलेशन पेश करके रैंक विषमता (rank heterogeneity) के तहत फेडरेटेड फाइन-ट्यूनिंग की चुनौतियों का समाधान करता है, जो यह सुनिश्चित करता है कि कम-रैंक वाले क्लाइंट्स उच्च-रैंक वाले क्लाइंट्स के समृद्ध प्रतिनिधित्व (richer representations) से लाभान्वित हों और मौजूदा तरीकों की तुलना में बेहतर सटीकता और दक्षता प्राप्त करें।

मूल लेखक: Muhammad Waseem, Nurbek Tastan, Andrej Jovanovic, Nicholas D. Lane, Nils Lukas, Karthik Nandakumar, Samuel Horvath

प्रकाशित 2026-06-16
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Muhammad Waseem, Nurbek Tastan, Andrej Jovanovic, Nicholas D. Lane, Nils Lukas, Karthik Nandakumar, Samuel Horvath

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप लोगों के एक समूह को एक महान कहानी लिखना सिखाने की कोशिश कर रहे हैं। आपके पास एक बहुत ही बुद्धिमान, पूर्व-प्रशिक्षित "बेस" लेखक (लार्ज लैंग्वेज मॉडल) है जो व्याकरण और तथ्यों के बारे में सब कुछ जानता है, लेकिन उन्हें आपके प्रोजेक्ट के लिए एक विशिष्ट शैली सीखने की आवश्यकता है।

एक आदर्श दुनिया में, आपके समूह में हर किसी के पास इस नई शैली को सीखने के लिए समान मात्रा में मानसिक शक्ति और स्मृति होगी। लेकिन वास्तविक दुनिया (फेडरेटेड लर्निंग) में, कुछ लोगों के पास शक्तिशाली कंप्यूटर (उच्च रैंक) होते हैं, जबकि अन्य के पास सीमित मेमोरी वाले पुराने फोन (निम्न रैंक) होते हैं।

समस्या: "एक ही आकार सबके लिए" वाली गड़बड़ी

पेपर इसे रैंक हेटेरोजेनिटी (Rank Heterogeneity) कहता है।

यदि आप उनके सीखने के अपडेट को सीधे संयोजित करने की कोशिश करते हैं, तो यह एक पूर्ण ऑर्केस्ट्रा को एक एकल वायलिन वादक (सोलो वायलनिस्ट) के साथ मिलाने जैसा है।

  • पुराना तरीका (जीरो-पैडिंग): उन्हें फिट होने के लिए, आप एकल वायलिन वादक को यह कल्पना करने के लिए कहते हैं कि उनके पीछे एक पूरा ऑर्केस्ट्रा है, लेकिन वे गायब वाद्ययंत्रों के लिए केवल सन्नाटा बजाते हैं। जब आप समूह के प्रदर्शन का औसत निकालते हैं, तो एकल वादक का "सन्नाटा" ऑर्केस्ट्रा के शानदार संगीत को हल्का (dilute) कर देता है। परिणाम एक धुंधला, भ्रमित करने वाला स्वर होता है।
  • मिसअलाइनमेंट (Misalignment): भले ही आप उन्हें गणितीय रूप से मिलाने की कोशिश करें, उच्च-शक्ति वाले शिक्षार्थी गाने के अंत पर ध्यान केंद्रित कर सकते हैं, जबकि निम्न-शक्ति वाले शिक्षार्थी शुरुआत पर ध्यान केंद्रित कर रहे होते हैं। जब आप उन्हें मिलाते हैं, तो शुरुआत और अंत मेल नहीं खाते।

समाधान: PreLort (पर्फिक्स-नेस्टेड LoRA)

लेखक PreLort नामक एक नई विधि प्रस्तावित करते हैं। इसे एक रशियन नेस्टिंग डॉल या परतदार केक (Layered Cake) की तरह व्यवस्थित करने के रूप में सोचें।

1. नेस्टेड ट्रेनिंग (द "लेयर्ड केक" रणनीति)

उच्च-शक्ति वाले शिक्षार्थियों को पूरे केक पर ध्यान केंद्रित करने देने और निम्न-शक्ति वाले शिक्षार्थियों को केक के एक छोटे टुकड़े पर ध्यान केंद्रित करने देने के बजाय, PreLort सभी को केक की निचली परतों को पहले सीखने के लिए मजबूर करता है।

  • यह कैसे काम करता है: प्रत्येक छात्र, उनकी शक्ति की परवाह किए बिना, कार्य के "कोर" (निचली परतों) में कुशल होने के लिए प्रशिक्षित किया जाता है।
    • निम्न-रैंक (Low-Rank) छात्र केवल निचली परत सीखते हैं।
    • उच्च-रैंक (High-Rank) छात्र निचली परत के साथ-साथ मध्य और ऊपरी परतें भी सीखते हैं।
  • जादू: उच्च-शक्ति वाले छात्रों को यह सुनिश्चित करने के लिए मजबूर किया जाता है कि उनके शानदार ऊपरी स्तर जोड़ने से पहले निचली परत एकदम सही हो। यह सुनिश्चित करता है कि "निचली परत" (प्रीफिक्स) में सबसे महत्वपूर्ण, साझा जानकारी शामिल है जिस पर सभी सहमत हैं।

2. सेगमेंट-वाइज एग्रीगेशन (द "स्मार्ट मिक्सिंग" रणनीति)

जब सभी के सीखने को संयोजित करने का समय आता है, तो सर्वर (शिक्षक) सब कुछ बस एक बाल्टी में नहीं डाल देता। इसके बजाय, वे परतों को अलग-अलग मिलाते हैं।

  • निचली परत: शिक्षक सभी (दोनों एकल वादक और ऑर्केस्ट्रा) से निचली परत को मिलाते हैं। चूंकि सभी ने इस परत को अच्छी तरह से सीखा है, इसलिए यह एक सुपर-स्ट्रॉन्ग आधार बन जाता है।
  • मध्य परत: शिक्षक केवल उन छात्रों से मध्य परत को मिलाते हैं जिन्होंने वास्तव में इसे सीखा है (ऑर्केस्ट्रा)। वे यहाँ एकल वादक के "सन्नाटे" को शामिल नहीं करते हैं।
  • ऊपरी परत: केवल सबसे शक्तिशाली छात्र यहाँ योगदान देते हैं।

यह क्यों काम करता है

"महत्वपूर्ण चीजों" को साझा निचली परतों (प्रीफिक्स) में डालने के लिए मजबूर करके और केवल आपकी "अतिरिक्त क्षमता" को ऊपरी परतों में जाने देकर, PreLort दो समस्याओं को हल करता है:

  1. कोई विलोपन (No Dilution) नहीं: ऊपरी परतों को मिलाते समय निम्न-शक्ति वाले छात्र "सन्नाटे" (जीरो-पैडिंग) द्वारा डूबे नहीं जाते हैं।
  2. पूर्ण संरेखण (Perfect Alignment): सभी इस बात पर सहमत हैं कि निचली परतें क्या अर्थ रखती हैं, जिससे अंतिम मॉडल स्थिर और सुसंगत रहता है, भले ही कुछ छात्रों ने केवल निचली परतें ही योगदान दी हों।

परिणाम

पेपर ने विभिन्न "लेखकों" (TinyLlama और Qwen) और विभिन्न कार्यों (निर्देश लिखना, समाचार वर्गीकृत करना) पर इसका परीक्षण किया।

  • बेहतर सटीकता: मॉडल ने पिछले तरीकों की तुलना में बेहतर लिखा और निर्देशों को अधिक सटीक रूप से समझा।
  • बेहतर दक्षता: उन्होंने इन परिणामों को प्राप्त करने के लिए मॉडल को बड़ा या धीमा करने की आवश्यकता नहीं पड़ी।
  • स्थिरता: यह विधि लगातार काम करती रही, चाहे समूह में बहुत शक्तिशाली और बहुत कमजोर कंप्यूटरों का मिश्रण हो।

संक्षेप में: PreLort "कमजोर" छात्रों को "मजबूत" छात्रों को रोकने से रोकता है, यह सुनिश्चित करके कि सभी मिलकर बुनियादी बातों में महारत हासिल करें, और फिर केवल मजबूत छात्रों को अपने अतिरिक्त कौशल को ऊपर जोड़ने की अनुमति देता है, बिना साझा आधार को प्रदूषित किए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →