← नवीनतम पेपर
🤖 machine learning

Federated Client Selection under Partial Visibility: A POMDP Approach with Spatio-Temporal Attention

यह शोध पत्र आंशिक दृश्यता के तहत फेडरेटेड लर्निंग में क्लाइंट चयन की चुनौती को संबोधित करता है, जिसमें समस्या को पार्शियली ऑब्जर्वेबल मार्कोव डिसीजन प्रोसेस (POMDP) के रूप में स्वरूपित किया गया है और एक नवीन स्थानिक-कालिक अटेंशन-आधारित सुदृढीकरण लर्निंग फ्रेमवर्क प्रस्तावित किया गया है जो विषम वातावरणों में बेहतर प्रदर्शन प्राप्त करने के लिए ऐतिहासिक वैश्विक मॉडलों और क्लाइंट एम्बेडिंग्स का लाभ उठाता है।

मूल लेखक: Qijun Hou, Yuchen Shi, Pingyi Fan, Khaled B. Letaief

प्रकाशित 2026-05-13
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Qijun Hou, Yuchen Shi, Pingyi Fan, Khaled B. Letaief

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल ऑर्केस्ट्रा के कंडक्टर हैं, लेकिन इसमें एक ट्विस्ट है: आप सभी संगीतकारों को एक साथ नहीं देख सकते। कभी केवल पहली पंक्ति के वायलिन वादक दिखाई देते हैं; कभी केवल पीछे के ड्रमर दिखाई देते हैं। आपका काम यह चुनना है कि गाने के एक विशिष्ट हिस्से को बजाने के लिए संगीतकारों का सबसे अच्छा समूह कौन सा है, ताकि समय के साथ पूरा ऑर्केस्ट्रा बेहतर सुनाई दे।

यह बिल्कुल वही समस्या है जिसे यह पेपर हल करता है, लेकिन ऑर्केस्ट्रा के बजाय, यह फेडरेटेड लर्निंग (कंप्यूटर के बिना अपना निजी डेटा साझा किए एक साथ सीखने का एक तरीका) है, और संगीतकारों के बजाय, ये क्लाइंट्स (जैसे आपका फोन या कोई सेंसर) हैं।

यहाँ उनके समाधान की कहानी दी गई है, जिसे सरल रूप में समझाया गया है:

समस्या: "अंधा" कंडक्टर

एक आदर्श दुनिया में, केंद्रीय कंप्यूटर (सर्वर) हर बार निर्णय लेने के लिए प्रत्येक क्लाइंट को देख सकता है। वह मॉडल को प्रशिक्षित करने में मदद करने के लिए सबसे अच्छे क्लाइंट्स को चुन सकता है।

लेकिन वास्तविक दुनिया में, चीजें अस्त-व्यển होती हैं:

  • मोबाइल सर्वर: कल्पना कीजिए कि सर्वर एक शहर के ऊपर उड़ता हुआ ड्रोन है। वह केवल उसी पड़ोस के उपकरणों को "सुन" सकता है जिसके ऊपर वह वर्तमान में मंडरा रहा है। वह अगले शहर के उपकरणों को नहीं देख सकता।
  • रैंडम उपलब्धता: कल्पना कीजिए कि डिवाइस ऐसे लोग हैं जो व्यस्त हैं। कभी वे अपना वाई-फाई बंद कर देते हैं, सो जाते हैं, या बस भाग लेने में रुचि नहीं रखते। सर्वर केवल भीड़ का एक रैंडम हिस्सा ही देख पाता है।

इसे पार्शियल विज़िबिलिटी (आंशिक दृश्यता) कहा जाता है। सर्वर आंखों पर पट्टी बांधकर निर्णय ले रहा है, उसे नहीं पता कि "अदृश्य" क्लाइंट क्या कर रहे हैं। यदि वह गलत दृश्य क्लाइंट्स को चुनता है, तो पूरी सीखने की प्रक्रिया धीमी हो जाती है या भ्रमित हो जाती है।

समाधान: एक समय-यात्रा करने वाला जासूस (Time-Traveling Detective)

लेखकों ने महसूस किया कि जब आप सब कुछ नहीं देख सकते, तो अच्छा निर्णय लेने के लिए आपको एक जासूस बनने की आवश्यकता है जो इतिहास का उपयोग करता है। उन्होंने इस समस्या को एक खेल की तरह माना जहाँ सर्वर को निम्नलिखित के आधार पर सबसे अच्छा कदम अनुमान लगाने की आवश्यकता है:

  1. अभी कौन दिखाई दे रहा है? (वर्तमान सुराग)।
  2. पिछले कुछ राउंड में क्या हुआ था? (पिछले सुराग)।

उन्होंने इसे एक POMDP (पार्शियली ऑब्जर्वेबल मार्कोव डिसीजन प्रोसेस) कहा। इसे एक फैंसी तरीके के रूप में समझें जिसका अर्थ है: "मेरे पास पूरी तस्वीर नहीं है, लेकिन मेरे पास पिछले कुछ कदमों की याददाश्त है, इसलिए मैं एक स्मार्ट अनुमान लगा सकता हूँ।"

गुप्त हथियार: "स्पैटियो-टेम्पोरल" मस्तिष्क

इसे हल करने के लिए, उन्होंने रीइन्फोर्समेंट लर्निंग (ट्रायल एंड एरर से सीखना) का उपयोग करके एक विशेष AI मस्तिष्क बनाया। लेकिन इस मस्तिष्क के पास एक सुपरपावर है: स्पैटियो-टेम्पोरल अटेंशन

आइए इसे एक उपमा के साथ समझते हैं:

  • स्पेशियल अटेंशन (The "Who's Here?" Eye - "यहाँ कौन है?" वाली आँख): जब सर्वर दृश्य क्लाइंट्स के समूह को देखता है, तो वह उन सभी के साथ एक जैसा व्यवहार नहीं करता। वह पूछता है, "दिखाई देने वाले लोगों में से, कौन दूसरों के साथ सबसे अच्छा फिट बैठता है?" वह एक-दूसरे के सापेक्ष उनके महत्व को तौलता है।
  • टेम्पोरल अटेंशन (The "Memory" Eye - "याददाश्त" वाली आँख): सर्वर प्रशिक्षण के पिछले कुछ राउंडों को देखता है। वह पूछता है, "ग्लोबल मॉडल कैसे बदल रहा है? हमने पिछली बार क्या सीखा था?" वह वर्तमान स्थिति को बेहतर ढंग से समझने के लिए इस इतिहास का उपयोग करता है।

उन्होंने इन दोनों "आंखों" को एक Q-नेटवर्क में मिला दिया। इस नेटवर्क को एक कोच के रूप में सोचें जो प्रत्येक दृश्य क्लाइंट को एक "स्कोर" (Q-वैल्यू) देता है। कोच क्लाइंट के वर्तमान प्रदर्शन और उनके पिछले व्यवहार को याद रखता है ताकि यह तय किया जा सके: "क्या यह क्लाइंट अभी एक स्टार प्लेयर है, या सिर्फ एक साधारण खिलाड़ी?"

"ID कार्ड" ट्रिक

पार्शियल विज़िबिलिटी का एक कठिन हिस्सा यह है कि एक क्लाइंट कुछ समय के लिए गायब हो सकता है और फिर वापस आ सकता है। उन्हें पहचानने का तरीका न होने पर, सर्वर उन्हें एक अजनबी की तरह मान सकता है।

लेखकों ने प्रत्येक क्लाइंट को एक अद्वितीय आइडेंटिटी एम्बेडिंग (एक स्थायी आईडी कार्ड की तरह) दी। भले ही कोई क्लाइंट 10 राउंड के लिए अदृश्य हो जाए, जब वह वापस आता है, तो सर्वर का AI याद रखता है, "आह, यह क्लाइंट #42 है। मुझे पहले से ही उनकी शैली पता है।" यह सिस्टम को स्थिर रखने में मदद करता है, भले ही भीड़ बदलती रहती हो।

परिणाम: बेहतर संगीत, कम शोर

टीम ने अपने "टाइम-ट्रैवलिंग डिटेक्टिव" का परीक्षण तीन अलग-अलग "ऑर्केस्ट्रा" (डेटासेट: कपड़ों की छवियां, वस्तुओं की छवियां और मूवमेंट डेटा) पर किया। उन्होंने इसकी तुलना अन्य तरीकों से की जो या तो विज़िबिलिटी समस्या को अनदेखा करते थे या इतिहास का उपयोग नहीं करते थे।

निष्कर्ष स्पष्ट थे:

  • उच्च सटीकता: उनका तरीका अन्य तरीकों की तुलना में तेजी से सीखा और अंततः एक स्मार्ट मॉडल बना।
  • कम अस्थिरता: प्रशिक्षण प्रक्रिया बहुत सहज थी। अन्य तरीकों के प्रदर्शन में उतार-चढ़ाव (जैसे कांपता हुआ हाथ) होता था, लेकिन उनका तरीका स्थिर रहा।
  • इतिहास मायने रखता है: उन्होंने परीक्षण किया कि सर्वर को कितनी पीछे तक देखना चाहिए। केवल एक कदम पीछे देखना (इतिहास को अनदेखा करना) सबसे खराब था। लगभग 5 कदम पीछे देखना सबसे सटीक (sweet spot) था। बहुत पीछे देखने से ज्यादा फायदा नहीं हुआ।

संक्षेप में

पेपर कहता है: जब आप एक साथ सीख रहे समूह में सभी को नहीं देख सकते, तो केवल रैंडम तरीके से न चुनें। एक ऐसे AI का उपयोग करें जो वर्तमान में कौन दिखाई दे रहा है उसे देखता है, हाल ही में क्या हुआ उसे याद रखता है, और समय के साथ प्रत्येक व्यक्ति कौन है उसे पहचानता है। यह "स्पैटियो-टेम्पोरल" दृष्टिकोण सीखने की प्रक्रिया को बहुत स्मार्ट और स्थिर बनाता है, भले ही सर्वर अंधे होकर उड़ रहा हो।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →