PreLort: Prefix-Nested LoRA for Federated Fine-Tuning under Rank Heterogeneity
PreLort, सेगमेंट-वाइज एग्रीगेशन (segment-wise aggregation) और मल्टी-ट्रंकेशन ट्रेनिंग (multi-truncation training) के साथ एक प्रीफिक्स-नेस्टेड लोरा (prefix-nested LoRA) फॉर्मूलेशन पेश करके रैंक विषमता (rank heterogeneity) के तहत फेडरेटेड फाइन-ट्यूनिंग की चुनौतियों का समाधान करता है, जो यह सुनिश्चित करता है कि कम-रैंक वाले क्लाइंट्स उच्च-रैंक वाले क्लाइंट्स के समृद्ध प्रतिनिधित्व (richer representations) से लाभान्वित हों और मौजूदा तरीकों की तुलना में बेहतर सटीकता और दक्षता प्राप्त करें।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप लोगों के एक समूह को एक महान कहानी लिखना सिखाने की कोशिश कर रहे हैं। आपके पास एक बहुत ही बुद्धिमान, पूर्व-प्रशिक्षित "बेस" लेखक (लार्ज लैंग्वेज मॉडल) है जो व्याकरण और तथ्यों के बारे में सब कुछ जानता है, लेकिन उन्हें आपके प्रोजेक्ट के लिए एक विशिष्ट शैली सीखने की आवश्यकता है।
एक आदर्श दुनिया में, आपके समूह में हर किसी के पास इस नई शैली को सीखने के लिए समान मात्रा में मानसिक शक्ति और स्मृति होगी। लेकिन वास्तविक दुनिया (फेडरेटेड लर्निंग) में, कुछ लोगों के पास शक्तिशाली कंप्यूटर (उच्च रैंक) होते हैं, जबकि अन्य के पास सीमित मेमोरी वाले पुराने फोन (निम्न रैंक) होते हैं।
समस्या: "एक ही आकार सबके लिए" वाली गड़बड़ी
पेपर इसे रैंक हेटेरोजेनिटी (Rank Heterogeneity) कहता है।
यदि आप उनके सीखने के अपडेट को सीधे संयोजित करने की कोशिश करते हैं, तो यह एक पूर्ण ऑर्केस्ट्रा को एक एकल वायलिन वादक (सोलो वायलनिस्ट) के साथ मिलाने जैसा है।
- पुराना तरीका (जीरो-पैडिंग): उन्हें फिट होने के लिए, आप एकल वायलिन वादक को यह कल्पना करने के लिए कहते हैं कि उनके पीछे एक पूरा ऑर्केस्ट्रा है, लेकिन वे गायब वाद्ययंत्रों के लिए केवल सन्नाटा बजाते हैं। जब आप समूह के प्रदर्शन का औसत निकालते हैं, तो एकल वादक का "सन्नाटा" ऑर्केस्ट्रा के शानदार संगीत को हल्का (dilute) कर देता है। परिणाम एक धुंधला, भ्रमित करने वाला स्वर होता है।
- मिसअलाइनमेंट (Misalignment): भले ही आप उन्हें गणितीय रूप से मिलाने की कोशिश करें, उच्च-शक्ति वाले शिक्षार्थी गाने के अंत पर ध्यान केंद्रित कर सकते हैं, जबकि निम्न-शक्ति वाले शिक्षार्थी शुरुआत पर ध्यान केंद्रित कर रहे होते हैं। जब आप उन्हें मिलाते हैं, तो शुरुआत और अंत मेल नहीं खाते।
समाधान: PreLort (पर्फिक्स-नेस्टेड LoRA)
लेखक PreLort नामक एक नई विधि प्रस्तावित करते हैं। इसे एक रशियन नेस्टिंग डॉल या परतदार केक (Layered Cake) की तरह व्यवस्थित करने के रूप में सोचें।
1. नेस्टेड ट्रेनिंग (द "लेयर्ड केक" रणनीति)
उच्च-शक्ति वाले शिक्षार्थियों को पूरे केक पर ध्यान केंद्रित करने देने और निम्न-शक्ति वाले शिक्षार्थियों को केक के एक छोटे टुकड़े पर ध्यान केंद्रित करने देने के बजाय, PreLort सभी को केक की निचली परतों को पहले सीखने के लिए मजबूर करता है।
- यह कैसे काम करता है: प्रत्येक छात्र, उनकी शक्ति की परवाह किए बिना, कार्य के "कोर" (निचली परतों) में कुशल होने के लिए प्रशिक्षित किया जाता है।
- निम्न-रैंक (Low-Rank) छात्र केवल निचली परत सीखते हैं।
- उच्च-रैंक (High-Rank) छात्र निचली परत के साथ-साथ मध्य और ऊपरी परतें भी सीखते हैं।
- जादू: उच्च-शक्ति वाले छात्रों को यह सुनिश्चित करने के लिए मजबूर किया जाता है कि उनके शानदार ऊपरी स्तर जोड़ने से पहले निचली परत एकदम सही हो। यह सुनिश्चित करता है कि "निचली परत" (प्रीफिक्स) में सबसे महत्वपूर्ण, साझा जानकारी शामिल है जिस पर सभी सहमत हैं।
2. सेगमेंट-वाइज एग्रीगेशन (द "स्मार्ट मिक्सिंग" रणनीति)
जब सभी के सीखने को संयोजित करने का समय आता है, तो सर्वर (शिक्षक) सब कुछ बस एक बाल्टी में नहीं डाल देता। इसके बजाय, वे परतों को अलग-अलग मिलाते हैं।
- निचली परत: शिक्षक सभी (दोनों एकल वादक और ऑर्केस्ट्रा) से निचली परत को मिलाते हैं। चूंकि सभी ने इस परत को अच्छी तरह से सीखा है, इसलिए यह एक सुपर-स्ट्रॉन्ग आधार बन जाता है।
- मध्य परत: शिक्षक केवल उन छात्रों से मध्य परत को मिलाते हैं जिन्होंने वास्तव में इसे सीखा है (ऑर्केस्ट्रा)। वे यहाँ एकल वादक के "सन्नाटे" को शामिल नहीं करते हैं।
- ऊपरी परत: केवल सबसे शक्तिशाली छात्र यहाँ योगदान देते हैं।
यह क्यों काम करता है
"महत्वपूर्ण चीजों" को साझा निचली परतों (प्रीफिक्स) में डालने के लिए मजबूर करके और केवल आपकी "अतिरिक्त क्षमता" को ऊपरी परतों में जाने देकर, PreLort दो समस्याओं को हल करता है:
- कोई विलोपन (No Dilution) नहीं: ऊपरी परतों को मिलाते समय निम्न-शक्ति वाले छात्र "सन्नाटे" (जीरो-पैडिंग) द्वारा डूबे नहीं जाते हैं।
- पूर्ण संरेखण (Perfect Alignment): सभी इस बात पर सहमत हैं कि निचली परतें क्या अर्थ रखती हैं, जिससे अंतिम मॉडल स्थिर और सुसंगत रहता है, भले ही कुछ छात्रों ने केवल निचली परतें ही योगदान दी हों।
परिणाम
पेपर ने विभिन्न "लेखकों" (TinyLlama और Qwen) और विभिन्न कार्यों (निर्देश लिखना, समाचार वर्गीकृत करना) पर इसका परीक्षण किया।
- बेहतर सटीकता: मॉडल ने पिछले तरीकों की तुलना में बेहतर लिखा और निर्देशों को अधिक सटीक रूप से समझा।
- बेहतर दक्षता: उन्होंने इन परिणामों को प्राप्त करने के लिए मॉडल को बड़ा या धीमा करने की आवश्यकता नहीं पड़ी।
- स्थिरता: यह विधि लगातार काम करती रही, चाहे समूह में बहुत शक्तिशाली और बहुत कमजोर कंप्यूटरों का मिश्रण हो।
संक्षेप में: PreLort "कमजोर" छात्रों को "मजबूत" छात्रों को रोकने से रोकता है, यह सुनिश्चित करके कि सभी मिलकर बुनियादी बातों में महारत हासिल करें, और फिर केवल मजबूत छात्रों को अपने अतिरिक्त कौशल को ऊपर जोड़ने की अनुमति देता है, बिना साझा आधार को प्रदूषित किए।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।