COHORT: Hybrid RL for Collaborative Large DNN Inference on Multi-Robot Systems Under Real-Time Constraints
यह शोध पत्र COHORT प्रस्तुत करता है, जो मल्टी-रोबोट सिस्टम के लिए एक ROS-आधारित सहयोगात्मक ढांचा है जो बड़े DNN इन्फरेंस कार्यों को गतिशील रूप से वितरित करने के लिए एक हाइब्रिड ऑफलाइन-ऑनलाइन सुदृढीकरण शिक्षण (reinforcement learning) रणनीति का लाभ उठाता है, जिससे वास्तविक समय की बाधाओं के तहत बैटरी दक्षता, GPU उपयोगिता और डेडलाइन अनुपालन में महत्वपूर्ण सुधार प्राप्त होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि बचाव कार्यों के लिए रोबोट की एक टीम को आपदा क्षेत्र में भेजा गया है—जैसे कि कोई ढही हुई इमारत या जंगल की आग वाला इलाका। उनका काम चारों ओर देखना, जीवित बचे लोगों को ढूंढना, मलबे की पहचान करना और ऐसे सवालों के जवाब देना है जैसे, "आपको कितने लोग दिखाई दे रहे हैं?" या "सबसे सुरक्षित रास्ता कहाँ है?"
यह करने के लिए, उन्हें अविश्वसनीय रूप से स्मार्ट लेकिन बहुत भारी कंप्यूटर प्रोग्राम चलाने की आवश्यकता होती है जिन्हें Large DNNs (डीप न्यूरल नेटवर्क) कहा जाता है। इन प्रोग्रामों को विशाल, भूखे दिमाग के रूप में सोचें जिन्हें सोचने के लिए बहुत अधिक बिजली और प्रोसेसिंग पावर की आवश्यकता होती है।
समस्या: "बैटरी बनाम दिमाग" की दुविधा
यहाँ पेच यह है: ये रोबोट छोटे हैं, उनकी बैटरी सीमित है, और वे अक्सर क्लाउड (इंटरनेट) से कनेक्ट नहीं हो पाते क्योंकि आपदा क्षेत्र में कोई वाई-फाई नहीं होता है।
- यदि कोई रोबोट इन "विशाल दिमागों" को पूरी तरह से अपने आप चलाने की कोशिश करता है, तो यह उसकी बैटरी को मिनटों में खत्म कर देता है और मिशन पूरा होने से पहले ही वह काम करना बंद कर सकता है।
- यदि वे डेटा को किसी केंद्रीय सर्वर पर भेजने की कोशिश करते हैं, तो वहाँ कोई सर्वर नहीं होता जिसे वे भेज सकें।
- यदि वे केवल अनुमान लगाते हैं कि किसे काम करना चाहिए, तो वे एक भारी कार्य को ऐसे रोबोट को भेज सकते हैं जो पहले से ही कमजोर है, जिससे पूरी टीम विफल हो सकती है।
समाधान: COHORT (एक स्मार्ट टीम कैप्टन)
शोधकर्ताओं ने COHORT नामक एक प्रणाली बनाई है। COHORT को एक सुपर-स्मार्ट, अदृश्य टीम कैप्टन के रूप में समझें जो हर रोबोट के भीतर रहता है। इसका एकमात्र काम यह तय करना है: "क्या मुझे यह काम खुद करना चाहिए, या मुझे अपने साथी से इसके लिए पूछना चाहिए?"
लेकिन COHORT केवल एक साधारण नियम पुस्तिका नहीं है। यह एक सीखने वाली मशीन है जो हर बार काम करने पर और स्मार्ट होती जाती है।
COHORT कैसे सीखता है: "अभ्यास" और "गेम डे" रणनीति
पेपर एक चतुर दो-चरणीय प्रशिक्षण प्रक्रिया का वर्णन करता है, जिसे हम एक स्पोर्ट्स टीम को प्रशिक्षित करने से तुलना कर सकते हैं:
1. "अभ्यास" चरण (ऑफलाइन लर्निंग)
इससे पहले कि रोबोट वास्तव में आपदा क्षेत्र में जाएं, वे कंप्यूटर में हजारों सिमुलेशन चलाते हैं।
- उपमा: कल्पना करें कि एक कोच घंटों तक गेम टेप देख रहा है। कोच एक सरल नियम (जैसे नीलामी) का उपयोग करता है यह देखने के लिए कि किसे क्या करना चाहिए था। "रोबोट A की बैटरी फुल है, इसलिए उसे भारी काम उठाना चाहिए।"
- जादू: सिस्टम इन सभी निर्णयों को रिकॉर्ड करता है। फिर, यह Advantage-Weighted Regression (AWR) नामक एक तकनीक का उपयोग करता है। यह एक कोच की तरह है जो कहता है, "देखो हमने कितनी बार जीत हासिल की। आइए ठीक से याद रखें कि जीतने वाली टीम ने क्या किया था और उन समयों को भूल जाएं जब हम हार गए थे।" यह रोबोटों को एक ठोस शुरुआती रणनीति देता है ताकि उन्हें वास्तविक दुनिया में जाने से पहले खतरनाक गलतियाँ न करनी पड़ें।
2. "गेम डे" चरण (ऑनलाइन लर्निंग)
अब, रोबोट वास्तविक दुनिया में हैं। वे अभ्यास में सीखी गई रणनीति का उपयोग करते हैं, लेकिन वे वहीं नहीं रुकते।
- उपमा: यह एक फुटबॉल टीम द्वारा वास्तविक मैच खेलने जैसा है। वे कोच की प्लेबुक के साथ शुरू करते हैं, लेकिन जैसे-जैसे खेल आगे बढ़ता है, वे अनुकूलित होते हैं। यदि हवा बदलती है, या कोई खिलाड़ी थक जाता है, तो वे तुरंत अपनी फॉर्मेशन को समायोजित करते हैं।
- जादू: रोबोट Multi-Agent PPO (MAPIO) का उपयोग करते हैं। यह उन्हें एक-दूसरे से बात करने (बहुत कम समय के लिए) की अनुमति देता है और कहना, "हे, मेरी बैटरी कम है, तुम अगला काम संभाल लो," या "मैं अभी तेज़ हूँ, मुझे वह काम दे दो।" वे वास्तविक समय में सीखते हैं, मिशन के दौरान काम को संतुलित करने में बेहतर होते जाते हैं।
"नीलामी" प्रणाली
वे कैसे तय करते हैं कि कौन क्या करेगा? वे एक डिजिटल नीलामी (auction) का उपयोग करते हैं।
- हर बार जब कोई कार्य सामने आता है (जैसे "इस क्षेत्र को स्कैन करें"), प्रत्येक रोबोट इस बात पर बोली लगाता है कि उन्हें इसे करने में कितना "लागत" लगेगी।
- "लागत" पैसा नहीं है; यह बैटरी लाइफ, वर्तमान वर्कलोड और गति है।
- जिस रोबोट की "लागत" सबसे कम होती है (जिसके पास सबसे अधिक ऊर्जा और खाली समय है) वह बोली जीत जाता है और कार्य करता है।
- COHORT की सुपरपावर: पुराने सिस्टमों के विपरीत जो केवल वर्तमान क्षण को देखते हैं, COHORT भविष्य की भविष्यवाणी करना सीखता है। यह कह सकता है, "मेरे पास अभी ऊर्जा है, लेकिन अगर मैं यह कार्य लेता हूँ, तो मैं अगले कार्य के लिए बहुत थक जाऊँगा। मैं रोबोट B को यह लेने दूँगा।"
परिणाम: यह क्यों मायने रखता है
शोधकर्ताओं ने तीन बहुत अलग रोबोटों पर इसका परीक्षण किया:
- Husky: एक बड़ा, मजबूत, पहियों वाला रोबोट जिसके पास एक शक्तिशाली कंप्यूटर है।
- Jackal: एक मध्यम आकार का, फुर्तीला रोबोट।
- Spot: एक कुत्ते जैसा दिखने वाला रोबोट जो सीढ़ियाँ चढ़ सकता है लेकिन जिसका कंप्यूटर छोटा है।
परिणाम:
- बैटरी लाइफ: टीम ने अन्य तरीकों की तुलना में लगभग 15% अधिक बैटरी बचाई। बचाव मिशन में, वह अतिरिक्त 15% जीवित बचे व्यक्ति को खोजने या न खोजने के बीच का अंतर हो सकता है।
- गति: वे अपने कंप्यूटर चिप्स (GPUs) का उपयोग करने में 51% बेहतर थे, जिसका अर्थ है कि उन्होंने खाली प्रतीक्षा करने में ऊर्जा बर्बाद नहीं की।
- विश्वसनीयता: उन्होंने अन्य तरीकों की तुलना में 2.5 गुना अधिक बार अपने गति और समय के लक्ष्यों को पूरा किया।
निचोड़
COHORT एक टीम को एक साझा मस्तिष्क देने जैसा है जो जानता है कि काम के बोझ को ठीक से कैसे साझा करना है। यह सुनिश्चित करता है कि मजबूत रोबोट कमजोरों की मदद करें, तेज़ रोबोट धीमे रोबोटों की मदद करें, और कोई भी काम पूरा होने से पहले ऊर्जा खत्म न करे। यह व्यक्तिगत रोबोटों के समूह को एक वास्तव में सहयोगात्मक, लचीली टीम में बदल देता है जो वास्तविक दुनिया की आपदाओं के शोर-शराबे को संभाल सकती है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।