← नवीनतम पेपर
💻 computer science

Decoupled Training with Local Reinforcement Fine-Tuning in Federated Learning

यह शोध पत्र FedDTL का प्रस्ताव करता है, जो विजन-लैंग्वेज मॉडल्स के लिए एक नवीन फेडरेटेड लर्निंग फ्रेमवर्क है जो सुसंगत वैश्विक अपडेट सुनिश्चित करने के लिए इमेज और टेक्स्ट एनकोडर को अलग करता है और विषम डेटा वितरण के तहत वैश्विक कार्य अनुकूलन और सामान्यीकरण को प्रभावी ढंग से संतुलित करने के लिए सुपरवाइज्ड लर्निंग के साथ रिइन्फोर्समेंट लर्निंग को संयोजित करने वाली एक टू-स्टेज लोकल फाइन-ट्यूनिंग रणनीति का उपयोग करता है।

मूल लेखक: Yuting Ma, Lechao Cheng, Xiaohua Xu

प्रकाशित 2026-05-28
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yuting Ma, Lechao Cheng, Xiaohua Xu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि दोस्तों का एक समूह एक साथ एक नया कौशल सीखने की कोशिश कर रहा है, जैसे कि विभिन्न प्रकार के पक्षियों की पहचान करना, लेकिन वे अलग-अलग शहरों में रहते हैं और अपने निजी फोटो एल्बम साझा नहीं कर सकते। यह फेडरेटेड लर्निंग (Federated Learning) का मूल विचार है: हर कोई अपने स्वयं के डिवाइस पर स्थानीय रूप से सीखता है और केवल वही साझा करता है जो उसने सीखा है, न कि अपना कच्चा डेटा (raw data)।

अब, कल्पना कीजिए कि ये दोस्त एक सुपर-स्मार्ट, प्री-ट्रेन्ड "बर्ड एक्सपर्ट" (एक विजन-लैंग्वेज मॉडल) का उपयोग कर रहे हैं ताकि उन्हें मदद मिल सके। समस्या यह है कि यदि हर कोई बस अपने स्थानीय फोटो का अध्ययन करता है और फिर अपने नोट्स को औसत (average) करने की कोशिश करता है, तो चीजें गड़बड़ा सकती हैं। कुछ दोस्त अपने ही आँगन के विशिष्ट पक्षियों के प्रति बहुत अधिक जुनूनी (over-specialization) हो सकते हैं, या कुछ लोग पक्षियों का वर्णन करने के पूरी तरह से अलग तरीके सीख सकते हैं, जिससे एक उपयोगी गाइड बनाने के लिए उनके ज्ञान को जोड़ना असंभव हो जाता है (असंगति/inconsistency)।

यह पेपर इस समस्या को ठीक करने के लिए एक नई विधि FedDTL पेश करता है। यह कैसे काम करता है, यहाँ सरल अवधारणाओं में दिया गया है:

1. "स्प्लिट टीम" रणनीति (डिकपल्ड ट्रेनिंग)

अधिकांश विधियों में, प्रत्येक मित्र यह सीखने की कोशिश करता है कि पक्षी को कैसे देखना है (इमेज एनकोडर) और उसे शब्दों में कैसे वर्णित करना है (टेक्स्ट एनकोडर), और यह सब वे अपने स्तर पर करते हैं। इससे भ्रम पैदा होता है क्योंकि सभी के विवरण एक-दूसरे से अलग होते जाते हैं।

FedDTL इस काम को विभाजित करता है:

  • स्थानीय कलाकार (क्लाइंट्स): प्रत्येक मित्र अपना कैमरा और फोटो एल्बम अपने पास रखता है। वे अपने स्वयं के फोटो में पक्षियों को पहचानने के लिए अपने "इमेज एनकोडर" को स्थानीय रूप से प्रशिक्षित करते हैं। यह उनके निजी फोटो को सुरक्षित रखता है।
  • केंद्रीय लाइब्रेरियन (सर्वर): एक केंद्रीय सर्वर "टेक्स्ट एनकोडर" को प्रशिक्षित करता है। फोटो देखने के बजाय, सर्वर केवल पक्षियों के नाम (जैसे, "कार्डिनल," "ब्लू जे") सीखता है।
  • संबंध: मित्र अपनी "दृश्य समझ" (visual understanding) सर्वर को भेजते हैं, और सर्वर बदले में "पाठ्य परिभाषाएँ" (textual definitions) वापस भेजता है। यह ऐसा है जैसे मित्र लाइब्रेरियन को स्केच भेजते हैं, और लाइब्रेरियन उन्हें सही शब्दकोश परिभाषाएँ वापस भेजता है। यह सुनिश्चित करता है कि हर कोई जो देख रहा है उसे वर्णित करने के लिए एक ही "भाषा" का उपयोग कर रहा है, जिससे बिना एक-दूसरे के निजी फोटो देखे, समूह को एक साथ रखा जा सके।

2. "दो-चरणीय नृत्य" (टू-स्टेज लोकल फाइन-ट्यूनिंग)

इस स्प्लिट टीम के साथ भी, यदि कोई मित्र अपने स्थानीय फोटो का बहुत लंबे समय तक अध्ययन करता है, तो वह अपने बगीचे की विशिष्ट रोशनी या बैकग्राउंड को याद करने लग सकता है, और किसी अन्य सेटिंग में पक्षी को पहचानने की क्षमता भूल सकता है। इसे "ओवर-स्पेशलाइजेशन" कहा जाता है।

FedDTL इसे प्रत्येक मित्र के लिए दो-चरणीय प्रशिक्षण प्रक्रिया के साथ हल करता है:

  • चरण 1: वॉर्म-अप (सुपरवाइज्ड फाइन-ट्यूनिंग - SFT):
    सबसे पहले, मित्र एक त्वरित, मानक अध्ययन सत्र करता है। वे अपने फोटो देखते हैं और केंद्रीय लाइब्रेरियन द्वारा प्रदान किए गए पक्षियों के नामों के साथ मेल बिठाना सीखते हैं। यह उन्हें जल्दी और विश्वसनीय रूप से गति पकड़ने में मदद करता है। इसे फ्लैशकार्ड याद करने के रूप में सोचें।

  • चरण 2: सुदृढीकरण बूस्ट (रीइन्फोर्समेंट लर्निंग - RL):
    वॉर्म-अप के बाद, मित्र "ट्रायल एंड एरर" (प्रयास और त्रुटि) मोड में बदल जाता है। केवल याद करने के बजाय, उसे सामान्य होने के लिए पुरस्कृत किया जाता है, न कि केवल विशिष्ट होने के लिए।

    • उपमा: कल्पना कीजिए कि एक मित्र पक्ष का अनुमान लगाने का खेल खेल रहा है। यदि वह सही अनुमान लगाता है, तो उसे एक अंक मिलता है। लेकिन यहाँ ट्विस्ट यह है: उसे तब भी सही अनुमान लगाने के लिए प्रोत्साहित किया जाता है जब फोटो थोड़ी धुंधली हो या उसका एंगल अजीब हो।
    • पेपर एक तकनीक का उपयोग करता है जिसे GRPO (ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइजेशन) कहा जाता है। यह एक ही समय में एक ही पक्ष का अनुमान लगाने वाले दोस्तों के समूह जैसा है। यदि एक मित्र सही अनुमान लगाता है जबकि अन्य गलत अनुमान लगाते हैं, तो उसे अधिक सामान्य होने के लिए "बोनस" मिलता है। यह उन्हें केवल अपने स्थानीय फोटो के सटीक पिक्सेल को याद करने से रोकता है और उन्हें पक्षी के वास्तविक सार को सीखने के लिए मजबूर करता है, जिससे वे उन पक्षियों को पहचानने में बेहतर बनते हैं जिन्हें उन्होंने पहले कभी नहीं देखा है।

यह एक बड़ी बात क्यों है?

पिछली विधियों ने जटिल नियम जोड़कर या बस सबके नोट्स का औसत निकालकर इन समस्याओं को ठीक करने की कोशिश की थी। लेकिन "फुल-डेटा" सेटिंग्स (जहाँ दोस्तों के पास बहुत सारा फोटो है, न कि केवल कुछ ही) में, वे पुरानी विधियाँ विफल रहीं। वे या तो समूह को बहुत अधिक असंगत बना देती थीं या व्यक्तियों को उनके अपने डेटा के प्रति बहुत अधिक जुनूनी बना देती थीं।

FedDTL का दावा है कि यह एक साथ दो चीजों को सफलतापूर्वक संतुलित करने वाला पहला तरीका है:

  1. ग्लोबल एडेप्टेशन (वैश्विक अनुकूलन): समूह कार्य को अच्छी तरह से सीखता है (हर कोई सहमत है कि एक "कार्डिनल" क्या है)।
  2. जनरलाइजेशन (सामान्यीकरण): समूह अभी भी नए, अनदेखे वातावरण में पक्षियों को पहचान सकता है (न कि केवल उनके अपने बैकयार्ड के विशिष्ट फोटो)।

परिणाम

लेखकों ने कई अलग-अलग डेटासेट्स (जैसे फूल, पालतू जानवर और भोजन की पहचान करना) पर कठिन परिस्थितियों के तहत परीक्षण किया (कुछ दोस्तों के पास बहुत अलग प्रकार का डेटा था)। उन्होंने पाया कि FedDTL अन्य विधियों की तुलना में लगातार बेहतर प्रदर्शन करता है, विशेष रूप से जब डेटा प्रोसेस करने के लिए बहुत अधिक मात्रा हो। इसने समूह को एकजुट रखने के साथ-साथ यह भी सुनिश्चित किया कि कोई भी अकेला मित्र अपने स्थानीय डेटा के प्रति बहुत अधिक "जिद्दी" न हो जाए।

संक्षेप में, FedDTL एक वितरित समूह के लिए एक साथ सीखने का एक स्मार्ट तरीका है: यह "देखने" को "नाम देने" से अलग करता है ताकि सभी एक समान रहें, और यह सुनिश्चित करने के लिए दो-चरणीय प्रशिक्षण प्रक्रिया का उपयोग करता है कि वे केवल अपने बैकयार्ड के विशिष्ट विवरणों को नहीं, बल्कि खेल के सामान्य नियमों को सीखें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →