Modular Reinforcement Learning For Cooperative Swarms
यह शोध पत्र एक मॉड्यूलर सुदृढीकरण शिक्षण (रिनफोर्समेंट लर्निंग) दृष्टिकोण प्रस्तावित करता है जो कम्प्यूटेशनल रूप से सीमित रोबोट झुंडों की स्मृति सीमाओं को दूर करने के लिए स्थानिक अंतःक्रिया अवस्थाओं को अलग-अलग शिक्षण प्रक्रियाओं में विभाजित करता है, और सहयोगात्मक खोज कार्यों में इसकी प्रभावशीलता को प्रदर्शित करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि नन्हे, बहुत ही साधारण रोबोटों का एक विशाल समूह मछलियों के झुंड या चींटियों की कॉलोनी की तरह मिलकर काम कर रहा है। उनका लक्ष्य बिखरी हुई वस्तुओं (जैसे भोजन) को खोजना और उन्हें वापस एक केंद्रीय होम बेस (घर) तक लाना है। इसे "स्वार्म फोरेजिंग" (swarm foraging) कहा जाता है।
समस्या यह है कि इन रोबोटों की क्षमताएं बहुत सीमित हैं। उनके पास बहुत कम मेमोरी (एक छोटे स्मार्टफोन ऐप से भी कम) और बहुत कम दिमागी शक्ति है। वे अपने आसपास केवल कुछ इंच तक ही देख सकते हैं और पूरे समूह से एक साथ बात नहीं कर सकते।
बड़ी समस्या: "स्टेट एक्सप्लोजन" (State Explosion)
एक साथ मिलकर काम करने का तरीका सीखने के लिए, इन रोबोटों को "रीइन्फोर्समेंट लर्निंग" (Reinforcement Learning) नामक एक प्रकार की सीखने की प्रक्रिया की आवश्यकता होगी। इसे ऐसे समझें जैसे एक रोबोट अलग-अलग चालें आज़माता है और याद रखता है कि कौन सी चालें सबसे अच्छा काम करती हैं।
हालाँकि, एक पेंच है। यदि एक रोबोट उन सभी संभावित स्थितियों को याद रखने की कोशिश करता है जिनका वह सामना कर सकता है, तो स्थितियों की संख्या इतनी तेज़ी से बढ़ती है कि उसे स्टोर करना असंभव हो जाता है।
- उपमा: कल्पना कीजिए कि आप एक शहर का नक्शा याद करने की कोशिश कर रहे हैं। यदि आप हर सड़क के कोने, हर ट्रैफिक लाइट और हर पैदल यात्री की स्थिति को एक साथ याद करने की कोशिश करते हैं, तो आपका दिमाग फट जाएगा। रोबोट की दुनिया में, इसे "स्टेट एक्सप्लोजन" कहा जाता है। एक मानक रोबोट जो सभी संयोजनों को याद रखने की कोशिश करेगा, उसे एक ऐसी हार्ड ड्राइव की आवश्यकता होगी जो एक इमारत जितनी बड़ी हो, लेकिन उसके पास केवल चावल के दाने के आकार की एक मेमोरी चिप है।
समाधान: "मॉड्यूलर" (Modular) दृष्टिकोण
इस शोध पत्र के लेखक एक चतुर समाधान प्रस्तावित करते हैं। एक विशाल मस्तिष्क देने के बजाय जो सब कुछ याद रख सके, वे रोबोट को आठ छोटे, विशिष्ट मस्तिष्क (इसके आठ सेंसरों में से प्रत्येक के लिए एक) देते हैं।
- उपमा: कल्पना कीजिए कि आठ लोगों की एक टीम एक भीड़ भरे कमरे में रास्ता खोजने की कोशिश कर रही है।
- पुराना तरीका (फुल स्टेट): एक व्यक्ति कमरे में मौजूद हर किसी के स्थान को एक साथ याद करने की कोशिश करता है। वह अभिभूत हो जाता है और चीजें भूल जाता है।
- नया तरीका (मॉड्यूलर): प्रत्येक व्यक्ति केवल एक विशिष्ट दिशा को देखता है। व्यक्ति #1 केवल सामने देखता है। व्यक्ति #2 केवल बाईं ओर देखता है। वे पूरे कमरे की चिंता नहीं करते; वे केवल अपने विशिष्ट हिस्से की चिंता करते हैं।
इनमें से प्रत्येक "मिनी-ब्रेन" एक सरल नियम सीखता है: "यदि मैं अपनी दिशा में एक रोबोट देखता हूँ, तो दूर हट जाओ। यदि रास्ता साफ़ है, तो चलते रहो।"
"द काउंसिल" (The Council)
एक बार जब आठों मिनी-ब्रेन ने अपने सुझाव दे दिए, तो उन्हें रोबोट के लिए एक एकल निर्णय लेने की आवश्यकता होती है। यह शोध पत्र इस निर्णय लेने वाले समूह को "द काउंसिल" कहता है।
- उपमा: द काउंसिल एक समिति की बैठक की तरह है।
- "सामने वाला" मस्तिष्क कहता है, "आगे बढ़ो!"
- "बायां" मस्तिष्क कहता, "उस व्यक्ति से बचने के लिए दाईं ओर मुड़ो!"
- "दायां" मस्तिष्क कहता, "बाईं ओर मुड़ो!"
- काउंसिल इन विरोधाभासी मतों को लेती है, उन्हें एक गणितीय सूत्र (जैसे विचारों का औसत निकालना) का उपयोग करके मिलाती है, और सबसे अच्छे समझौते की दिशा चुनती है।
उन्होंने क्या पाया
शोधकर्ताओं ने इसे विभिन्न कमरों के लेआउट में 36 रोबोटों के साथ एक कंप्यूटर सिमुलेशन में परखा।
- यह काम करता है: मॉड्यूलर दृष्टिकोण (आठ मिनी-ब्रेन) उन जटिल तरीकों के समान या कभी-कभी उनसे बेहतर प्रदर्शन करता है जो एक साथ सब कुछ याद रखने की कोशिश करते हैं।
- यह कुशल है: इसने मेमोरी का एक बहुत छोटा हिस्सा उपयोग किया। लाखों परिदृश्यों को याद करने के बजाय, रोबोटों को केवल कुछ दर्जन सरल नियमों की आवश्यकता थी। यह उनकी छोटी माइक्रोचिप्स पर पूरी तरह फिट बैठता है।
- यह मजबूत (Robust) है: यहाँ तक कि जब शोधकर्ताओं ने "रिवॉर्ड सिस्टम" (वह तरीका जिससे रोबोटों को बताया जाता है कि उन्होंने अच्छा काम किया है) को बदल दिया, तब भी मॉड्यूलर दृष्टिकोण काम करता रहा, जबकि जटिल तरीके अक्सर विफल हो गए या क्रैश हो गए।
- सरल चालें बेहतर हैं: उन्होंने पाया कि रोबोटों को सरल दिशाओं (वेक्टर्स) में चलने के लिए कहना, जटिल और पूर्व-निर्धारित बचाव युद्धाभ्यास सिखाने की तुलना में बेहतर काम करता है।
निचोड़
यह शोध पत्र दिखाता है कि एक समूह के रोबोटों को एक साथ काम करने के लिए आपको सुपरकंप्यूटर की आवश्यकता नहीं है। एक विशाल, असंभव समस्या को कई छोटे, सरल समस्याओं में तोड़कर और एक "काउंसिल" को अंतिम उत्तर के लिए मतदान करने देकर, आप एक ऐसा स्वार्म बना सकते हैं जो स्मार्ट, सहकारी है और एक बहुत ही छोटे, सस्ते रोबोट पर फिट बैठता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।