MoRI: Mixture of RL and IL Experts for Long-Horizon Manipulation Tasks
MoRI एक नवीन रोबोटिक मैनिपुलेशन फ्रेमवर्क है जो जटिल लॉन्ग-होराइजन कार्यों में उच्च सफलता दर, तीव्र अभिसरण (कन्वर्जेंस) और मानव हस्तक्षेप में महत्वपूर्ण कमी प्राप्त करने के लिए इमिटेशन लर्निंग और रिइन्फोर्समेंट लर्निंग विशेषज्ञों को गतिशील रूप से संयोजित करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को कोई जटिल कार्य करना सिखा रहे हैं, जैसे तौलिया मोड़ना या किसी ब्लॉक को दराज में रखना। आपके पास इसे सिखाने के दो मुख्य तरीके हैं:
"नकलची" (इमिटेशन लर्निंग - Imitation Learning): आप रोबोट को एक वीडियो दिखाते हैं जिसमें एक इंसान उस काम को पूरी तरह से कर रहा है और रोबोट उस काम की नकल करने की कोशिश करता है।
- फायदे: यह जल्दी सीख जाता है।
- नुकसान: यदि रोबोट शुरुआत में एक छोटी सी गलती कर देता है, तो वह भ्रमित हो जाता है और बड़ी गलतियाँ करता चला जाता है। यह उस छात्र की तरह है जिसने गणित के उत्तर तो रट लिए लेकिन उसे गणित समझ नहीं आया; अगर परीक्षा का सवाल थोड़ा सा भी बदल जाए, तो वह फेल हो जाता है।
"खोजी" (रीइन्फोर्समेंट लर्निंग - Reinforcement Learning): आप रोबोट को कोशिश करने, असफल होने और बार-बार प्रयास करने देते हैं, और जब वह सफल होता है तो उसे एक "गोल्ड स्टार" (इनाम) देते हैं।
- फायदे: यह आश्चर्यों को संभालना सीख जाता है और काम करने के नए तरीके खोज सकता है।
- नुकसान: इसमें बहुत लंबा समय लगता है। सही चाल सीखने से पहले यह शायद एक हज़ार बार चीजों से टकरा जाए। यह एक बच्चे की तरह है जो बार-बार गिरकर चलना सीख रहा है।
समस्या
अधिकांश वास्तविक दुनिया के कार्यों के लिए दोनों की आवश्यकता होती है। आपको "नकलची" की आवश्यकता होती है आसान और अनुमानित हिस्सों को संभालने के लिए (जैसे अपने हाथ को बिंदु A से बिंदु B तक ले जाना), और आपको "खोजी" की आवश्यकता होती है कठिन और पेचीदा हिस्सों को संभालने के लिए (जैसे यह समझना कि फिसलन भरे तौलिए को ठीक से कैसे पकड़ें या प्लग को तंग सॉकेट में कैसे डालें)।
मौजूदा तरीकों ने इन दोनों को मिलाने की कोशिश की, लेकिन वे अक्सर इस बात को लेकर भ्रमित हो जाते थे कि कब किस रणनीति का उपयोग किया जाए, जिससे सीखने की गति धीमी हो जाती थी या रोबोट को लगातार हस्तक्षेप करने के लिए इंसान की मदद की जरूरत पड़ती थी।
समाधान: MoRI (Mixture of RL and IL Experts)
इस शोध पत्र के लेखकों ने एक सिस्टम बनाया जिसे MoRI कहा जाता है। MoRI को केवल एक रोबोटिक मस्तिष्क के रूप में नहीं, बल्कि दो विशेषज्ञों और एक स्मार्ट मैनेजर की एक टीम के रूप में समझें जो मिलकर काम करते हैं।
टीम के सदस्य
- अनुभवी (IL एक्सपर्ट): यह "नकलची" है। यह सुचारू और नियमित गतिविधियों के लिए बेहतरीन है। इसे पता है कि दराज कैसे खोलनी है या ब्लॉक को कैसे हिलाना है क्योंकि इसने इंसानों को ऐसा करते देखा है।
- साहसी (RL एक्सपर्ट): यह "खोजी" है। यह उन कठिन और उच्च-सटीक कार्यों को सुलझाने में अच्छा है जहाँ चीजें गलत हो सकती हैं। यह फिसलन भरी वस्तु को पकड़ने का सही तरीका खोजने के लिए जोखिम उठाने को तैयार रहता है।
मैनेजर (द गेटिंग नेटवर्क - The Gating Network)
यही असली जादू है। MoRI के पास एक स्मार्ट मैनेजर है जो दोनों विशेषज्ञों पर नज़र रखता है। वह पूछता है: "अगली चाल के बारे में हम कितने आश्वस्त हैं?"
- यदि विशेषज्ञ सहमत हैं (कम विचलन/low variance): मैनेजर कहता है, "यह आसान है। अनुभवी को करने दें।" (जैसे, "बस हाथ को दराज की ओर ले जाएं।")
- यदि विशेषज्ञों के बीच असहमति या अनिश्चितता है (उच्च विचलन/high variance): मैनेजर कहता है, "यह पेचीदा है। साहसी को कमान संभालने दें और इसे सुलझाने दें।" (जैसे, "मैं तौलिए को बिना फिसले कैसे पकड़ूँ?")
यह बदलाव तुरंत होता है, जैसे एक रिले रेस में जहाँ बैटन (baton) को ठीक उसी समय पास किया जाता है जब धावक को दौड़ने की ज़रूरत होती है।
उन्होंने इसे कैसे प्रशिक्षित किया (दो-चरणीय योजना)
यह सुनिश्चित करने के लिए कि टीम बिना रोबोट को नुकसान पहुँचाए अच्छी तरह काम करे, उन्होंने दो-चरणीय प्रशिक्षण प्रक्रिया का उपयोग किया:
चरण 1: क्लासरूम (ऑफलाइन प्री-ट्रेनिंग):
रोबोट द्वारा किसी वास्तविक वस्तु को छूने से पहले, उन्हें इसमें इंसानों द्वारा कार्य किए जाने के 20 वीडियो डाले गए।- अनुभवी ने इन वीडियो को याद कर लिया।
- साहसी ने भी इनका अध्ययन किया ताकि उसे शून्य से शुरुआत न करनी पड़े।
- उपमा: यह ड्राइविंग टेस्ट देने से पहले किताब पढ़ने जैसा है।
चरण 2: ड्राइविंग रेंज (ऑनलाइन फाइन-ट्यूनिंग):
अब रोबोट वास्तविक दुनिया में जाता है।- मैनेजर यातायात का संचालन करता है।
- यदि रोबोट कहीं फंस जाता है, तो एक इंसान उसे हल्का सा सहारा (हस्तक्षेप) देता है।
- महत्वपूर्ण बात यह है कि सिस्टम एक "सुरक्षा जाल" (रेगुलराइजेशन) का उपयोग करता है। यह साहसी को बताता है: "तुम प्रयोग कर सकते हो, लेकिन अनुभवी ने जो रास्ता दिखाया है उससे बहुत दूर मत जाओ।" यह रोबोट को सुरक्षित रखता है और सीखने के दौरान दुर्घटनाग्रस्त होने से बचाता है।
परिणाम: यह एक बड़ी उपलब्धि क्यों है?
टीम ने चार कठिन वास्तविक कार्यों (ब्लॉक को दराज में रखना, तौलिए मोड़ना, प्लग लगाना आदि) पर इसका परीक्षण किया। यहाँ क्या हुआ:
- गति: रोबोट ने 2 से 5 घंटे में सीख लिया। अन्य तरीकों को बहुत अधिक समय लगा।
- सफलता दर: इसकी सफलता दर 97.5% रही।
- मानवीय सहायता: इसे अन्य तरीकों की तुलना में 85% कम मानवीय मदद की आवश्यकता पड़ी। रोबोट ने अधिकांश समस्याओं को खुद ही सुलझा लिया।
- सुचारूता (Smoothness): क्योंकि मैनेजर विशेषज्ञों को बहुत सहजता से बदलता है, इसलिए रोबोट की गतिविधियाँ झटकेदार या उछलती हुई नहीं थीं।
निष्कर्ष
MoRI एक शतरंज के ग्रैंडमास्टर (अनुभवी) और एक जुआरी (साहसी) को काम पर रखने और उनके बीच एक रेफरी (मैनेजर) रखने जैसा है। ग्रैंडमास्टर मानक चालें चलता है, जुआरी अनपेक्षित स्थितियों को संभालता है, और रेफरी यह सुनिश्चित करता है कि वे सही समय पर अपनी भूमिकाएँ बदलें।
यह रोबोट को जटिल, लंबे कार्यों को तेज़ी से, सुरक्षित रूप से और बहुत कम मानवीय देखरेख के साथ सीखने में सक्षम बनाता है, जो हमें ऐसे रोबोटों के करीब लाता है जो वास्तव में हमारे घरों या कारखानों में हमारी मदद कर सकें।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।