← नवीनतम पेपर
🤖 machine learning

FedGuide: Diffusion Prior Alignment and Value Baseline Guidance for Heterogeneous Federated Reinforcement Learning

FedGuide एक नवीन फेडरेटेड रीइन्फोर्समेंट लर्निंग फ्रेमवर्क है जो ऑप्टिमल-ट्रांसपोर्ट मिक्स्चर-ऑफ-एक्सपर्ट्स के माध्यम से डिफ्यूजन प्रायर्स को एकत्रित करके और मजबूत, उच्च-प्रदर्शन वाले सहयोगात्मक पॉलिसी लर्निंग को प्राप्त करने के लिए डिस्ट्रीब्यूशन करेक्शन एस्टीमेशन वैल्यू बेसलाइन का उपयोग करके विषम वातावरणों में वितरण संबंधी बेमेल (distributional mismatch) को संबोधित करता है।

मूल लेखक: Zhilin He, Gauri Joshi

प्रकाशित 2026-09-17
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhilin He, Gauri Joshi

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

रोबोटिक्स की दुनिया में, सीखना अक्सर एक एकाकी प्रयास होता है। एक रोबोट अपने विशिष्ट वातावरण के भीतर परीक्षण और त्रुटि (trial and error) के माध्यम से चलना या किसी वस्तु को पकड़ना सीखता है, जो उसके अपने सेंसर, उसके मोटरों और उसके पैरों के नीचे की सतह से जुड़े अद्वितीय डेटा को एकत्र करता है। यह एक एकल मशीन के लिए तो अच्छा काम करता है, लेकिन जब हम रोबोट के एक बेड़े (fleet) को मिलकर सीखने के लिए चाहते हैं, तो यह एक बाधा बन जाता है। यदि प्रत्येक रोबोट अलग-थलग रहता है, तो वे अपने साथियों की सफलताओं या विफलताओं से लाभ नहीं उठा सकते। इसका समाधान एक सहयोगात्मक दृष्टिकोण में निहित है जहाँ मशीनें अपने कच्चे, निजी डेटा को केंद्रीय सर्वर पर भेजे बिनाสิ่งที่ सीखा है उसे साझा कर सकती हैं। यही फेडरेटेड लर्निंग (federated learning) का वादा है: वितरित एजेंटों के लिए एक साझा बुद्धिमत्ता बनाने का एक तरीका, जबकि वे अपने स्थानीय अनुभवों को निजी रखते हैं। हालाँकि, एक बड़ी बाधा अभी भी बनी हुई है। जब रोबोट अलग-अलग परिवेशों में काम करते हैं—जैसे कि एक चिकने कारखाने के फर्श पर और दूसरा पथरीले निर्माण स्थल पर—तो उनके अनुभव मौलिक रूप से भिन्न होते हैं। उनकी सीखी गई व्यवहारों को केवल औसत निकालना अक्सर एक भ्रमित करने वाली, अप्रभावी रणनीति का परिणाम देता है जो न तो उस वातावरण के लिए उपयुक्त होती है और न ही दूसरे के लिए। चुनौती इन विविध अनुभवों को एक एकल, समझौतापूर्ण आकार में मजबूर किए बिना उन्हें संयोजित करने का तरीका खोजने की है।

कार्नेगी मेलन यूनिवर्सिटी के शोधकर्ताओं ने इस समस्या को एक नए ढांचे (framework) के साथ हल किया है जिसे 'FedGuide' कहा जाता है, जिसे विशेष रूप से उन स्थितियों के लिए डिज़ाइन किया गया है जहाँ रोबोटों को अलग-अलग भौतिक वास्तविकताओं का सामना करना पड़ता है। मुख्य विचार रोबोटों के अंतिम निर्णय लेने के नियमों को औसत निकालने की कोशिश को रोकना है, जिससे अक्सर महत्वपूर्ण विवरणों का नुकसान होता है। इसके बजाय, टीम गति और क्रिया के अंतर्निहित पैटर्न पर ध्यान केंद्रित करती है जिसे प्रत्येक रोबोट ने खोजा है। वे आर्टिफिशियल इंटेलिजेंस के एक प्रकार के मॉडल का उपयोग करते हैं जिसे डिफ्यूजन मॉडल (diffusion model) कहा जाता है, जो एक परिष्कृत स्मृति (memory) की तरह कार्य करता है कि अतीत में एक रोबोट ने सफलतापूर्वक कौन सी क्रियाएं की हैं। रोबोट की अंतिम नीति (policy) को साझा करने के बजाय, यह प्रणाली इन "व्यवहार स्मृतियों" (behavior memories) को साझा करती है। एक केंद्रीय सर्वर पर, विभिन्न रोबोटों की इन स्मृतियों को एक गणितीय तकनीक का उपयोग करके सावधानीपूर्वक मिश्रित किया जाता है जो प्रत्येक रोबोट द्वारा विकसित किए गए व्यवहार के अद्वितीय मोड का सम्मान करती है। यह प्रक्रिया सुनिश्चित करती है कि बर्फ पर चलने का अभ्यास कर रहा रोबोट अपनी विशिष्ट सावधानी बनाए रखे, जबकि सूखे फुटपाथ पर चल रहा रोबोट अपना आत्मविश्वास बनाए रखे, भले ही वे एक-दूसरे से सीख रहे हों।

इस सहयोग को और भी प्रभावी बनाने के लिए, शोधकर्ताओं ने मार्गदर्शन की एक दूसरी परत जोड़ी। जबकि साझा स्मृतियाँ रोबरों को बताती हैं कि कौन सी क्रियाएं संभव हैं, वे अनिवार्य रूप से यह नहीं बतातीं कि कौन सी क्रियाएं सबसे अधिक पुरस्कृत (rewarding) हैं। इसे हल करने के लिए, टीम ने एक 'वैल्यू एस्टिमेटर' (value estimator) पेश किया जो एक स्थानीय दिशा-सूचक (compass) के रूप में कार्य करता है। यह उपकरण प्रत्येक रोबोट को यह समझने में मदद करता है कि उसके अपने अद्वितीय वातावरण के भीतर एक विशिष्ट क्रिया कितनी अच्छी है, जो एक स्थिर संकेत प्रदान करता है जो सीखने की प्रक्रिया को अनियंत्रित होने से रोकता है। इन साझा व्यवहारिक स्मृतियों को स्थानीय, पुरस्कार-जागरूक मार्गदर्शन के साथ जोड़कर, यह प्रणाली प्रत्येक रोबोट को अपने साथियों के वातावरण के अंतर से नीचे खींचे बिना अपने स्वयं के प्रदर्शन में सुधार करने की अनुमति देती है।

शोधकर्ताओं ने विभिन्न सिम्युलेटेड दुनिया में इस दृष्टिकोण का परीक्षण किया, जिसमें लक्ष्य तक पहुँचने जैसे सरल कार्यों से लेकर कूदने, चलने और दौड़ने जैसी जटिल लोकोमोशन चुनौतियों तक शामिल थे। इन परीक्षणों में, उन्होंने अपने नए तरीके की तुलना मानक तकनीकों से की जो केवल रोबोट की नीतियों को औसत निकालती हैं। परिणामों ने इस नए ढांचे के लिए एक स्पष्ट लाभ दिखाया। उन वातावरणों में जहाँ रोबोटों को अपने कार्यों या भौतिक सेटअप में महत्वपूर्ण अंतरों का सामना करना पड़ा, मानक तरीके संघर्ष करते रहे, कभी-कभी कुछ भी उपयोगी सीखने में विफल रहे या एक खराब रणनीति में सिमट गए। इसके विपरीत, नया दृष्टिकोण सभी क्लाइंट्स में उच्च प्रदर्शन बनाए रखता है। इसने न केवल उच्च अंतिम स्कोर प्राप्त किया बल्कि अधिक स्थिरता भी प्रदर्शित की, जिससे प्रदर्शन के उन उतार-चढ़ाव से बचा जा सका जो अक्सर सहयोगात्मक शिक्षण में देखे जाते हैं। सबसे कठिन परिदृश्यों में भी, जहाँ रोबोटों के बीच अंतर अत्यधिक था, सिस्टम ने हर रोबोट को सुधार की राह पर बनाए रखा।

अध्ययन का एक प्रमुख निष्कर्ष यह है कि रोबोटों के विशिष्ट व्यवहारों को अलग रखते हुए भी उन्हें एक साथ सीखने की अनुमति देना कितना महत्वपूर्ण है। जब शोधकर्ताओं ने सीखने की प्रक्रिया को विज़ुअलाइज़ किया, तो उन्होंने देखा कि मानक तरीके सभी रोबोटों को एक ही, औसत व्यवहार पैटर्न में धकेलने की कोशिश करते हैं, जिससे प्रभावी रूप से प्रत्येक रोबोट द्वारा खोजे गए अद्वितीय समाधान मिट जाते हैं। हालाँकि, नया तरीका इन विविध पैटर्न को सुरक्षित रखता है। यह सिस्टम को यह पहचानने की अनुमति देता है कि संदर्भ के आधार पर किसी समस्या को हल करने के कई वैध तरीके हो सकते हैं। इस विविधता का संरक्षण मजबूती (robustness) के लिए महत्वपूर्ण था। सिस्टम ने केवल औसत रूप से बेहतर प्रदर्शन नहीं किया; यह सबसे खराब परिस्थितियों में भी अधिक विश्वसनीय था, यह सुनिश्चित करते हुए कि कोई भी अकेला रोबोट पीछे न छूटे या ऐसी रणनीति अपनाने के लिए मजबूर न हो जो उसकी वास्तविकता के अनुकूल न हो।

अध्ययन ने इस प्रणाली के दो मुख्य घटकों द्वारा निभाई गई विशिष्ट भूमिकाओं पर भी प्रकाश डाला। साझा व्यवहारिक स्मृतियाँ सुरक्षित, डेटा-समर्थित क्रियाओं का आधार प्रदान करने के लिए आवश्यक थीं, जो रोबोटों को खतरनाक या असंभव चालों में भटकने से रोकती हैं। स्थानीय वैल्यू एस्टिमेटर समान रूप से महत्वपूर्ण था, जो एक स्टेबलाइज़र के रूप में कार्य करता है जो सीखने की प्रक्रिया में शोर (noise) को कम करता है। जब शोधकर्ताओं ने इनमें से किसी भी घटक को हटाया, तो सिस्टम का प्रदर्शन गिर गया, जिससे पुष्टि हुई कि विविध व्यवहारों की साझा स्मृति और क्या मूल्यवान है इसके स्थानीय मार्गदर्शन, दोनों ही सफलता के लिए आवश्यक हैं। परिणाम बताते हैं कि रोबertों के लिए एक वितरित दुनिया में प्रभावी ढंग से सीखने के लिए, उन्हें अपने अंतरों का सम्मान करते हुए अपने अनुभवों को साझा करने के तरीके की आवश्यकता है, न कि उन्हें मिटाकर।

यह कार्य रोबोटिक लर्निंग को वास्तविक दुनिया के अनुप्रयोगों के लिए व्यावहारिक बनाने की दिशा में एक महत्वपूर्ण कदम है। एक एकल, सार्वभौमिक नीति के विचार से हटकर, विविध स्थानीय अनुभवों का सम्मान करने और उन्हें एकीकृत करने वाले सिस्टम की ओर बढ़ते हुए, शोधकर्ताओं ने दिखाया है कि मशीनें अपनी व्यक्तिगत प्रभावशीलता खोए बिना एक साथ सीख सकती हैं। यह ढांचा एक ब्लूप्रिंट प्रदान करता है कि भविष्य के रोबोट बेड़े, गोदाम श्रमिकों से लेकर स्वायत्त वाहनों तक, कैसे एक-दूसरे से सीख सकते हैं। हालाँकि वर्तमान परीक्षण सिमुलेशन में किए गए थे, प्रदर्शित सिद्धांत एक स्पष्ट मार्ग प्रदान करते हैं कि मशीनों को तब कैसे सिखाया जाए जब वे अलग-अलग दुनिया में रहते हैं। इस दृष्टिकोण की सफलता एकरूपता थोपने में नहीं, बल्कि विविध दृष्टिकोणों को एक सुसंगत, सामूहिक बुद्धिमत्ता में संरेखित करने में निहित है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →