ECo-MoE: Embodiment-Conditioned Mixture of Experts Increases the Evolvability of Robots
यह शोध पत्र ECo-MoE को प्रस्तुत करता है, जो एक स्केलेबल फ्रेमवर्क है जो रोबोटिक मॉर्फोलॉजी और कंट्रोल एक्सपर्ट्स के एक गेटेड मिक्सचर को सह-अनुकूलित (co-optimize) करता है ताकि कुशल, मॉड्यूलर विकास सक्षम किया जा सके जहाँ पूर्वज ज्ञान सुरक्षित रहता है और नए डिजाइनों को "इवो बाय डेमो" प्रक्रिया के माध्यम से प्रीट्रेन की गई पॉलिसियों द्वारा निर्देशित किया जा सकता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप रोबोटों के एक पूरे परिवार को चलना सिखाने की कोशिश कर रहे हैं, लेकिन परिवार के हर रोबोट का शरीर थोड़ा अलग आकार का है। कुछ लंबे और पतले हैं, कुछ छोटे और चौड़े हैं, और कुछ के पास अतिरिक्त पैर हैं।
अतीत में, वैज्ञानिकों के सामने एक कठिन विकल्प था:
- "एक ही आकार सबके लिए" (One-Size-Fits-All) दृष्टिकोण: हर रोबोट को नियंत्रित करने के लिए एक ही विशाल, अत्यंत जटिल मस्तिष्क को प्रशिक्षित करना। समस्या यह है कि यह मस्तिष्क "रूढ़िवादी" हो जाता है। यह सुरक्षित खेलने की कोशिश करता है, जिससे रोबोट धीरे और अजीब तरह से चलते हैं क्योंकि यह एक ऐसे बीच के रास्ते को खोजने की कोशिश कर रहा है जो सभी के लिए काम करे लेकिन किसी एक में भी सर्वश्रेष्ठ न हो।
- "कस्टम ब्रेन" (Custom Brain) दृष्टिकोण: हर एक रोबट के लिए एक नया, कस्टम मस्तिष्क प्रशिक्षित करना। समस्या यह है कि यह अविश्वसनीय रूप से धीमा और महंगा है, जैसे एक विशाल स्कूल के हर छात्र के लिए व्यक्तिगत ट्यूटर रखना।
यह शोध पत्र एक चतुर मध्य मार्ग पेश करता है जिसे ECo-MoE (एम्बॉडिमेंट-कंडीशन्ड मिक्सचर ऑफ एक्सपर्ट्स) कहा जाता है। इसे एक विशेषज्ञ कोचों की विशेष टीम के रूप में समझें।
"कोच की टीम" का रूपक (Analogy)
एक विशाल मस्तिष्क या हज़ारों कस्टम मस्तिष्क के बजाय, रोबोट के पास चार "विशेषज्ञ" न्यूरल नेटवर्क (कोच) की एक छोटी टीम होती है।
- विशेषज्ञ 1 सांप जैसे लंबे शरीरों को नियंत्रित करने में माहिर है।
- विशेषज्ञ 2 छोटे और ठिगने शरीरों को नियंत्रित करने में माहिर है।
- विशेषज्ञ 3 और विशेषज्ञ 4 के अपने विशिष्ट क्षेत्र हैं।
लेकिन यहाँ जादू यह है: रोबोट केवल एक कोच को नहीं चुनता है। इसके पास एक स्मार्ट मैनेजर (जिसे "गेटिंग नेटवर्क" कहा जाता है) होता है। यह मैनेजर रोबोट के शरीर के आकार (इसके "जीनोटाइप" या ब्लूप्रिंट) को देखता है और तय करता है कि प्रत्येक कोच की कितनी बात माननी है।
- यदि रोबोट लंबा और पतला है, तो मैनेजर कहता है, "विशेषज्ञ 1 को 90% और विशेषज्ञ 2 को 10% सुनो।"
- यदि रोबोट छोटा और चौड़ा है, तो मैनेजर कहता है, "विशेषज्ञ 3 को 80% सुनो।"
यह सिस्टम शरीर के नए आकार विकसित करने की अनुमति देता है बिना मस्तिष्क को खराब किए। यदि कोई नया, अजीब शरीर का आकार विकसित होता है, तो मैनेजर कोचों के मिश्रण को बस थोड़ा सा बदलकर उसे संभाल सकता है, बिना उस ज्ञान को फेंके जो कोचों ने पहले से सीखा है।
"इवो बाय डेमो" (Evo by Demo): एक ब्लूप्रिंट से सीखना
यह शोध पत्र एक और विशेषता पेश करता है जिसे "इवो बाय डेमो" (डेमोंस्ट्रेशन द्वारा विकास) कहा जाता है।
कल्पना कीजिए कि आपके पास एक विशिष्ट रोबोट डिज़ाइन है जिसे आप वास्तव में पसंद करते हैं (एक "डेमो"), जैसे कि एक आदर्श चार पैरों वाला चलने वाला यंत्र। आमतौर पर, विकास यादृच्छिक (random) होता है; यह अंधेरे में तीर चलाने जैसा है इस उम्मीद में कि शायद कभी निशाना लग जाए।
- पुराना तरीका: आप विकास के दौरान उस आदर्श आकार तक संयोग से पहुँचने का इंतज़ार कर सकते थे।
- ECo-MoE का तरीका: आप उस आदर्श डिज़ाइन को ले सकते हैं, विशेष रूप से उस पर एक "विशेषज्ञ कोच" को प्रशिक्षित कर सकते हैं, और फिर उस कोच के मस्तिष्क को फ्रीज (स्थिर) कर सकते हैं। फिर आप विकास प्रक्रिया को बताते हैं: "हे, अगर कोई नया रोबोट हमारे आदर्श डेमो जैसा दिखता है, तो इस विशेषज्ञ की बात अधिक सुनें।"
यह एक चुंबक की तरह काम करता है। यह यादृच्छिक विकास को धीरे से उस आकार की ओर खींचता है जो आप चाहते हैं, जिससे रोबोट उन विशिष्ट, वांछित रूपों में विकसित होने के लिए निर्देशित होते हैं जिन्हें आपने मन में रखा है, न कि केवल यादृच्छिक आकारों में।
उन्होंने क्या पाया?
शोधकर्ताओं ने एक सिम्युलेटेड दुनिया में तीन चुनौतियों के साथ इसका परीक्षण किया:
- समतल ज़मीन: एक चिकने फर्श पर चलना। (यहाँ, यह नया तरीका पुराने "एक ही आकार सबके लिए" वाले तरीके जितना ही अच्छा था। सरल कार्यों के लिए जटिल कोचों की टीम की आवश्यकता नहीं होती।)
- सीधा खड़ा होकर चलना: सीधा चलते हुए संतुलन बनाए रखना (जैसे इंसान)। (नया तरीका कहीं बेहतर था। इसने ऐसे रोबोट विकसित किए जो बहुत प्रभावी ढंग से खड़े हो सके और चल सके।)
- गड्ढे: ऊबड़-खाबड़, टूटी हुई ज़मीन पर चलना। (फिर से, नया तरीका कहीं बेहतर था। कोचों की टीम, एकल विशाल मस्तिष्क की तुलना में, ऊबड़-खाबड़ इलाके के अनुकूल बहुत तेज़ी से ढल सकती थी।)
बड़ी तस्वीर (The Big Picture)
मुख्य निष्कर्ष यह है कि रोबोट के शरीर के अनुकूल होने वाली विशेषज्ञों की एक मॉड्यूलर टीम का उपयोग करके, रोबोट तेज़ी से विकसित हो सकते हैं और बेहतर व्यवहार सीख सकते हैं, खासकर जब कार्य कठिन हों या वातावरण अव्यवस्थित हो। यह एक अकेले, अत्यधिक काम करने वाले जनरल से बदलकर एक लचीले, विशिष्ट कमांड सेंटर में अपग्रेड करने जैसा है जो किसी भी शरीर के प्रकार को संभाल सकता है जो प्रकृति (या विकास) उसके सामने लाती है।
शोध पत्र यह भी नोट करता है कि हालांकि यह कंप्यूटर सिमुलेशन में बहुत अच्छा काम करता है, लेकिन रोबोट अभी वास्तविक जीवन में बनाए जाने शुरू ही हुए हैं, और अगला कदम यह देखना है कि क्या यह भौतिक मशीनों पर काम करता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।