← नवीनतम पेपर
🤖 AI

Carpe Diem: Critical Learning Period-Aware Contract-Based Incentives for Federated Learning

यह शोध पत्र R3T का प्रस्ताव करता है, जो एक समय-जागरूक अनुबंध-सैद्धांतिक प्रोत्साहन ढांचा (time-aware contract-theoretic incentive framework) है जो फेडरेटेड लर्निंग में सूचना विषमता और महत्वपूर्ण शिक्षण अवधियों को संबोधित करता है, जिससे प्रशिक्षण के शुरुआती चरणों के दौरान उच्च-गुणवत्ता वाले क्लाइंट योगदानों को गतिशील रूप से पुरस्कृत किया जाता है, और इस प्रकार पारंपरिक तरीकों की तुलना में मॉडल सटीकता, प्रशिक्षण गति और क्लाउड उपयोगिता में उल्लेखनीय सुधार किया जाता है।

मूल लेखक: Thanh Linh Nguyen, Dinh Thai Hoang, Diep N. Nguyen, Quoc-Viet Pham

प्रकाशित 2026-07-27
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Thanh Linh Nguyen, Dinh Thai Hoang, Diep N. Nguyen, Quoc-Viet Pham

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि दोस्तों का एक समूह मिलकर एक परम रोबोट बनाने की कोशिश कर रहा है, लेकिन वे सभी अलग-अलग घरों से काम कर रहे हैं और एक-दूसरे को अपने गुप्त ब्लूप्रिंट नहीं दिखा सकते। यही फेडरेटेड लर्निंग (Federated Learning) की दुनिया है, जो कंप्यूटरों के बीच एक चतुर तरीका है जिससे वे अपने निजी डेटा को साझा किए बिना एक-दूसरे से सीख सकते हैं। डेटा को एक केंद्रीय बॉस के पास भेजने के बजाय, कंप्यूटर (जिन्हें "क्लाइंट्स" कहा जाता है) रोबोट के एक हिस्से को स्थानीय रूप से प्रशिक्षित करते हैं और केवल "सीखी गई सीख" (lessons learned) वापस भेजते हैं। फिर बॉस (एक क्लाउड सर्वर) उस रोबोट को और स्मार्ट बनाने के लिए इन सीखों को जोड़ता है।

हालाँकि, इसमें एक पेंच है। जैसे एक नन्हे पक्षी को मजबूत पंख विकसित करने के लिए सही समय पर सही भोजन की आवश्यकता होती है, वैसे ही एक सीखने वाले रोबोट के लिए एक क्रिटिकल लर्निंग पीरियड (CLP - महत्वपूर्ण शिक्षण अवधि) होता है। यह प्रशिक्षण प्रक्रिया का बिल्कुल शुरुआती समय है। यदि रोबोट को शुरुआती कुछ दिनों के दौरान गलत या आलसी सबक मिलते हैं, तो वह एक स्थायी "ब्रेन फॉग" (दिमागी धुंध) में फंस सकता है जिसे बाद में कितनी भी कड़ी मेहनत से ठीक नहीं किया जा सकता। बड़ी समस्या यह है कि बॉस को यह नहीं पता होता कि कौन से दोस्त मेहनती हैं और कौन से सुस्त हैं, और दोस्त तभी काम करते हैं जब उन्हें भुगतान किया जाता है। बॉस को यह सुनिश्चित करने के लिए कि रोबमाट की शुरुआत एकदम सही हो, सही लोगों को, सही समय पर, सही राशि देने का एक तरीका चाहिए।

यहाँ आता है R3T (राइट रिवॉर्ड राइट टाइम - सही समय पर सही इनाम), एक नई रणनीति जिसे शोधकर्ताओं द्वारा इस समय के पहेली को सुलझाने के लिए प्रस्तावित किया गया है। क्लाउड सर्वर को एक कोच के रूप में सोचें जो एक चैंपियनशिप टीम बनाने की कोशिश कर रहा है। अतीत में, कोच अक्सर हर अभ्यास सत्र के लिए सभी को समान राशि का भुगतान करते थे, यह मानकर कि सभी अभ्यास सत्र समान रूप से महत्वपूर्ण हैं। लेकिन R3T महसूस करता है कि पहले कुछ अभ्यास सबसे महत्वपूर्ण होते हैं। शोधकर्ताओं ने एक विशेष "अनुबंध" (contract) प्रणाली डिजाइन की है जहाँ कोच सौदों का एक मेनू पेश करता है: "यदि आप शुरुआती महत्वपूर्ण हफ्तों के दौरान जल्दी आते हैं और बहुत कड़ी मेहनत करते हैं, तो आपको भारी बोनस मिलेगा। यदि आप देर से आते हैं, तो आपको छोटा इनाम मिलेगा।"

यह शोध पत्र इस सौदे को सटीक रूप से तैयार करने के लिए कॉन्ट्रैक्ट थ्योरी (Contract Theory) नामक एक गणितीय उपकरण का उपयोग करता है। यह एक खेल की तरह है जहाँ कोच को यह तो नहीं पता कि प्रत्येक खिलाड़ी कितना मजबूत है, लेकिन खिलाड़ियों को खुद के बारे में पता है। विभिन्न पुरस्कार पैकेज पेश करके, स्मार्ट खिलाड़ियों को "कड़ी मेहनत, बड़ा इनाम" वाला सौदा चुनकर अपनी वास्तविक ताकत प्रकट करने के लिए प्रेरित किया जाता है, जबकि आलसी खिलाड़ी "आसान काम, छोटा इनाम" वाला विकल्प चुन लेते हैं। यह बिना किसी के निजी प्रशिक्षण लॉग में झाँके, यह रहस्य सुलझा देता है कि कौन कौन है।

शोधकर्ताओं ने इस विचार का दो तरह से परीक्षण किया। सबसे पहले, उन्होंने कंप्यूटर सिमुलेशन चलाकर देखा कि गणित कैसे काम करता है। उन्होंने पाया कि शुरुआती "क्रिटिकल" राउंड्स पर पुरस्कार केंद्रित करके, क्लाउड सर्वर कम पैसे में बहुत बेहतर परिणाम प्राप्त कर सकता है। वास्तव में, यह प्रणाली इतनी कुशल थी कि यह पारंपरिक तरीकों की तुलना में 47.6% कम क्लाइंट्स के साथ भी समान सीखने के लक्ष्यों को प्राप्त कर सकती थी। दूसरा, उन्होंने भुगतान को स्वचालित रूप से संभालने के लिए एक ब्लॉकचेन (एक डिजिटल लेजर जो एक सार्वजनिक, अपरिवर्तनीय नोटबुक के रूप में कार्य करता है) का उपयोग करके एक वास्तविक प्रोटोटाइप बनाया। इन वास्तविक दुनिया के परीक्षणों में, R3T प्रणाली ने रोबोट को मानक तरीकों की तुलना में 300% तेजी से सीखने में मदद की, और केवल 20 राउंड में अपनी अंतिम सटीकता प्राप्त कर ली, जबकि सामान्यतः इसमें 61 राउंड लगते।

यह शोध पत्र तर्क देता है कि इन शुरुआती महत्वपूर्ण अवधियों को अनदेखा करना एक गलती है। पिछले तरीकों ने हर प्रशिक्षण दौर को समान माना, जिससे पैसा बर्बाद हुआ और सीखने की गति धीमी हुई। R3T साबित करता है कि "सही समय पर सही इनाम" देकर, आप सर्वश्रेष्ठ श्रमिकों को ठीक उसी समय आगे आने के लिए प्रेरित कर सकते हैं जब उनका प्रयास सबसे अधिक मायने रखता है, जिससे अंतिम मॉडल मजबूत, सटीक और कुशलता से निर्मित होता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →