← नवीनतम पेपर
📊 statistics

Federated LoRA Fine-Tuning for LLMs via Collaborative Alignment

यह शोध पत्र CLAIR प्रस्तुत करता है, जो एक संदूषण-जागरूक (contamination-aware) फेडरेटेड लर्निंग फ्रेमवर्क है जो अत्यधिक विषम सेटिंग्स में लार्ज लैंग्वेज मॉडल्स के फाइन-ट्यूनिंग प्रदर्शन को सुधारने, दुर्भावनापूर्ण क्लाइंट्स का पता लगाने और एक साझा LoRA सबस्पेस को सहयोगात्मक रूप से रिकवर करने के लिए स्ट्रक्चर्ड लो-रैंक प्लस ब्लॉक-स्पार्स डिकंपोजिशन का उपयोग करता है।

मूल लेखक: Shuaida He, Liwen Chen, Long Feng

प्रकाशित 2026-05-21
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Shuaida He, Liwen Chen, Long Feng

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि शेफों का एक समूह है, जिनमें से प्रत्येक अपने स्वयं के निजी रसोईघर में काम कर रहा है। वे सभी एक ही विशाल, पूर्व-प्रशिक्षित "मास्टर रेसिपी बुक" (लार्ज लैंग्वेज मॉडल) के साथ शुरुआत करते हैं। उनका लक्ष्य केवल अपनी निजी सामग्री (निजी डेटा) का उपयोग करके एक विशिष्ट, नया व्यंजन (एक स्थानीय कार्य) सीखना है।

समय और स्थान बचाने के लिए, वे पूरी मास्टर बुक को फिर से नहीं लिखते हैं। इसके बजाय, वे अपने विशिष्ट व्यंजन के लिए आवश्यक कुछ बदलावों के साथ एक छोटा, लो-रैंक "स्टिकी नोट" (जिसे LoRA कहा जाता है) लिखते हैं। यह कुशल है और मूल पुस्तक को सुरक्षित रखता है।

अब, कल्पना कीजिए कि ये शेफ बेहतर खाना बनाना सीखने के लिए सहयोग करना चाहते हैं, बिना अपनी गुप्त सामग्री साझा किए। वे अपने स्टिकी नोट्स को मिलाकर एक "सुपर स्टिकी नोट" बनाना चाहते हैं जो सभी के लिए मददगार हो।

समस्या:
वास्तविक दुनिया में, हर कोई अच्छा शेफ नहीं होता है। कुछ भ्रमित हो सकते हैं, कुछ गलत सामग्री का उपयोग कर रहे हो सकते हैं, और कुछ तो समूह को नुकसान पहुँचाने या गलत या टूटे हुए स्टिकी नोट्स जमा करने की कोशिश भी कर सकते हैं। यदि समूह उनके सभी नोट्स का औसत निकाल देता है (एक मानक विधि जिसे FedAvg कहा जाता है), तो खराब नोट्स सबके लिए रेसिपी को बिगाड़ देते हैं। साथ ही, चूंकि वे अलग-अलग रसोईघरों में हैं, इसलिए यह भी संभव है कि उन्होंने मास्टर बुक के थोड़े अलग संस्करणों के साथ शुरुआत की हो, जिससे नोट्स की सीधे तुलना करना कठिन हो जाता है।

समाधान: CLAIR
यह पेपर एक नई विधि पेश करता है जिसे CLAIR (कोलेबोरेटिव लो-रैंक अलाइनमेंट एंड आइडेंटिफिएबल रिकवरी) कहा जाता है। CLAIR को एक स्मार्ट "रेसिपी डिटेक्टिव" के रूप में समझें।

यह इस प्रकार काम करता है, सरल उपमाओं का उपयोग करते हुए:

1. "अंतर का खेल" (शोर को रद्द करना)

हर शेफ से उनका पूरा स्टिकी नोट दिखाने के बजाय, CLAIR उनसे जोड़ियों में नोट्स की तुलना करने के लिए कहता है।

  • शेफ A कहता है: "मेरा नोट X है।"
  • शेफ B कहता है: "मेरा नोट Y है।"
  • CLAIR पूछता है: "X और Y के बीच क्या अंतर है?"

चूंकि सभी शेफ एक ही मास्टर बुक के साथ शुरुआत करते हैं, इसलिए जब आप उन्हें घटाते हैं, तो "मास्टर बुक" वाला हिस्सा कट जाता है। आपके पास केवल उनके खाना पकाने के तरीकों के अंतर बचते हैं। यह CLAIR को मूल मास्टर बुक को देखे बिना, अच्छे नोट्स की वास्तविक संरचना देखने की अनुमति देता है।

2. "खराब सेबों" को खोजना (संदूषण का पता लगाना)

CLAIR इन सभी अंतरों को देखता है और उन्हें दो ढेरों में बांटने की कोशिश करता है:

  • "साझा पैटर्न" (लो-रैंक): यह सामान्य, उपयोगी संरचना है जिसे सभी अच्छे शेफ साझा करते हैं। यह एक सामान्य लय या तकनीक की तरह है जो सभी अच्छी रेसिपी में उपयोग की जाती है।
  • "आउटलेयर्स" (ब्लॉक-स्पार्स): ये अजीब, अव्यवस्थित अंतर हैं जो खराब शेफ या तोड़-फोड़ के कारण उत्पन्न होते हैं।

CLAIR साफ, साझा लय को शोर से अलग करने के लिए एक गणितीय "छलनी" का उपयोग करता है। यदि किसी शेफ का नोट एक ऐसा पैटर्न बनाता है जो साझा लय में फिट नहीं बैठता है, तो CLAIR उन्हें "संदूषित" (खराब या आउटलेयर) के रूप में चिह्नित करता है और उन्हें अनदेखा कर देता है।

3. "सुपर नोट" बनाना (परिष्करण)

एक बार जब CLAIR "अच्छे शेफों" (सहयोगात्मक सेट) की पहचान कर लेता है, तो वह केवल उनके नोट्स का अंधाधुंध औसत नहीं निकालता है। इसके बजाय, वह उस "साझा पैटर्न" का उपयोग करता है जो उसने पाया है और प्रत्येक व्यक्तिगत शेफ के नोट को पॉलिश करने के लिए करता है।

  • यह प्रत्येक शेफ के व्यंजन के अनूठे स्वाद को बनाए रखता है।
  • लेकिन यह उन हिस्सों को ठीक करता है जो केवल रैंडम शोर थे, अन्य अच्छे शेफों से "साझा लय" उधार लेकर।

यह पेपर क्या सिद्ध करता है

लेखकों ने केवल यह अनुमान नहीं लगाया कि यह काम करेगा; उन्होंने यह साबित करने के लिए गणित का उपयोग किया कि:

  • सटीक रिकवरी (Exact Recovery): यदि कोई शोर (noise) नहीं है, तो CLAIR पूरी तरह से साझा संरचना को पा सकता है और खराब शेफ की पहचान कर सकता है।
  • स्थिरता (Stability): शोर और त्रुटियों के बावजूद, जैसे-जैसे समूह में अधिक शेफ जुड़ते हैं, CLAIR सत्य के बहुत करीब पहुँच जाता है।
  • "स्वीट स्पॉट" (The Sweet Spot): उन्होंने ठीक से सिद्ध किया कि कब यह सहयोग मदद करता है। यह तब मदद करता है जब "साझा लय" उस लागत से अधिक मजबूत होती है जो उस लय को समझने में लगती है। यदि शेफ बहुत अलग हैं या तोड़-फोड़ बहुत भारी है, तो अकेले खाना बनाना ही बेहतर है।

परिणाम

टीम ने एक कंप्यूटर सिमुलेशन पर परीक्षण किया जहाँ "शेफ" AI मॉडल थे जो एक "कॉपीइंग टास्क" (अक्षरों के अनुक्रम को दोहराना) सीखने की कोशिश कर रहे थे।

  • सेटअप: उनके पास 10 शेफ थे। 9 अच्छे थे, और 1 "तोड़-फोड़ करने वाला" (saboteur) था जो गड़बड़ी करने की कोशिश कर रहा था।
  • परिणाम:
    • स्थानीय कुकिंग (Local Cooking): प्रत्येक शेफ ने अकेले खाना बनाया। अच्छा था, लेकिन पूर्ण नहीं।
    • मानक समूह कुकिंग (FedAvg): उन्होंने सभी के नोट्स का औसत निकाला। तोड़-फोड़ करने वाले ने रेसिपी को बिगाड़ दिया, और समूह अकेले खाना बनाने की तुलना में खराब प्रदर्शन कर गया।
    • CLAIR: जासूस ने तोड़-फोड़ करने वाले को ढूंढ निकाला, उसे समूह से बाहर निकाल दिया, और अच्छे शेफों के नोट्स को पॉलिश करने के लिए साझा लय का उपयोग किया। परिणाम सबसे सटीक कुकिंग था, जिसने एकल शेफ और अव्यवस्थित समूह औसत दोनों को पीछे छोड़ दिया।

संक्षेप में: CLAIR मॉडलों के लिए एक साथ सीखने का एक स्मार्ट तरीका है बिना अपना निजी डेटा साझा किए, भले ही समूह में कुछ लोग धोखाधड़ी करने की कोशिश कर रहे हों या भ्रमित हों। यह सामान्य आधार को खोजता है, परेशान करने वालों को अनदेखा करता है, और सभी को बेहतर व्यंजन बनाने में मदद करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →