Decompose and Reorganize: Planning with Primitives and Visuomotor Policies Learned from Demonstrations
यह शोध पत्र DR-LfD का प्रस्ताव करता है, जो प्रदर्शनों (demonstrations) को परमाणु कौशलों (atomic skills) में विभाजित करके विज़ुओमोटर नीतियों को टास्क एंड मोशन प्लानिंग (TAMP) के साथ एकीकृत करता है, जिससे रोबोटिक हेरफेर के लिए एक सुदृढ़ और डेटा-कुशल दीर्घ-क्षितिज (long-horizon) क्षमता सक्षम होती है जो पारंपरिक नियोजन की भंगुरता और शुद्ध अनुकरण शिक्षण (imitation learning) की सामान्यीकरण सीमाओं पर विजय प्राप्त करती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को एक जटिल जादू का खेल सिखाने की कोशिश कर रहे हैं, जैसे कि रस्सी पर चलते हुए करतब दिखाना। लंबे समय से, वैज्ञानिक रोबोटों को सिखाने के दो मुख्य तरीकों को आज़मा रहे हैं। पहला तरीका एक रोबोट को इंसान द्वारा लिखी गई सख्त, चरण-दर-चरण रेसिपी देने जैसा है। यह तर्क (logic) के लिए तो बहुत अच्छा है, लेकिन अगर रोबोट का चम्मच गिर जाए या मेज थोड़ी सी हिल जाए, तो रेसिपी टूट जाती है और रोबोट जम जाता है। दूसरा तरीका एक इंसान को वह करतब करते हुए वीडियो दिखाने जैसा है और इस उम्मीद में है कि रोबोट देखकर सीख जाएगा। यह नकल करने के लिए तो बढ़िया है, लेकिन अगर रोबोट ने वीडियो में चम्मच को थोड़ा अलग स्थान पर देखा, तो वह भ्रमित हो जाता है और असफल हो जाता है। बड़ा सवाल रोबोटिक्स में यह है: हम दोनों का सर्वश्रेष्ठ कैसे प्राप्त करें? हम एक ऐसा रोबोट कैसे बनाएं जो आगे की योजना बनाने के लिए पर्याप्त स्मार्ट हो लेकिन हर एक संभावना के लिए लाखों वीडियो देखने की आवश्यकता के बिना, वास्तविक दुनिया की अव्यवस्था को संभालने के लिए पर्याप्त लचीला भी हो?
यह शोध पत्र DR-LfD (Demonstrations से सीखे गए Decomposed और Reorganized Skills) नामक एक नई प्रणाली पेश करता है जो इस पहेली को सुलझाने की कोशिश करती है। इसे एक मास्टर शेफ के रूप में सोचें जो केवल सात-कोर्स के भोजन की एक विशाल रेसिपी याद नहीं करता है। इसके बजाय, शेफ भोजन को प्याज काटने, स्टेक को भूनने या अंडे फेंटने जैसे छोटे, सटीक "कौशलों" (skills) में तोड़ देता है। शेफ प्रत्येक छोटे कौशल का कुछ बार अभ्यास करता है जब तक कि वे एकदम सही न हो जाएं। फिर, जब कोई ग्राहक एक नया, अजीब व्यंजन ऑर्डर करता है, तो शेफ घबराता नहीं है। वे बस ऑर्डर देखते हैं, अपनी मानसिक सूची से सही पूर्व-अभ्यास किए गए कौशल चुनते हैं, और नया भोजन पकाने के लिए उन्हें एक नए क्रम में व्यवस्थित करते हैं।
शोध पत्र सुझाव देता है कि लंबे, जटिल कार्यों को इन छोटे, पुन: प्रयोज्य (reusable) "कौशलों" में तोड़कर, एक रोबोट बहुत तेज़ी से सीख सकता है और नई स्थितियों को बेहतर ढंग से संभाल सकता है। एक 20-चरणीय कार्य के हर संभावित संयोजन को सीखने के बजाय (जिसमें बहुत समय लगेगा), रोबोट को केवल उन 20 व्यक्तिगत चरणों को एक बार सीखना होगा। फिर, एक स्मार्ट "प्लानर" (शेफ का मस्तिष्क) उन चरणों को किसी भी नए काम के लिए जोड़ने का तरीका निकाल लेता है।
यहाँ बताया गया है कि DR-LfD कैसे काम करता है, एक जटिल वीडियो गेम खेलने वाले रोबोट के उदाहरण का उपयोग करते हुए:
1. गेम को स्तरों में तोड़ना (Decomposition)
जब एक इंसान रोबोट को कोई कार्य दिखाता है (जैसे पेचकस पैक करना या दोस्त को कप थमाना), तो सिस्टम पूरे कार्य को एक लंबे वीडियो के रूप में रिकॉर्ड नहीं करता है। यह देखने के लिए कि रोबोट का हाथ किसी वस्तु को कब छूता है या छोड़ता है, यह एक विशेष "कॉन्टैक्ट डिटेक्टर" का उपयोग करता है। यह वीडियो को इन स्पर्शों के आधार पर छोटे टुकड़ों में काट देता है।
- "सरल चालें" (Simple Moves): आसान हिस्सों के लिए, जैसे कप उठाना या उसे नीचे रखना, रोबोट एक "प्रिमिटिव" (primitive) सीखता है। यह एक पूर्व-निर्धारित मांसपेशी स्मृति (muscle memory) की तरह है जो जानती है कि मेज पर वस्तु कहीं भी हो, हाथ को पकड़ने के लिए कैसे घुमाना है।
- "कठिन चालें" (Hard Moves): कठिन हिस्सों के लिए, जैसे कप को पोंछना या एक हाथ से दूसरे हाथ में वस्तु देना, रोबोट एक "विजुओमोटर पॉलिसी" (visuomotor policy) सीखता है। यह एक रिफ्लेक्स की तरह है जो कैमरे को देखता है और वस्तु को स्थिर रखने के लिए अपने हाथों को वास्तविक समय में समायोजित करता है।
- "ब्रिज मूव्स" (Bridge Moves): खाली स्थान में चलने के लिए, यह केवल एक पथ (path) की योजना बनाने के लिए मानक गणित का उपयोग करता है।
2. स्मार्ट प्लानर (Reorganization)
एक बार जब रोब सहित इन कौशलों का एक "टूलबॉक्स" बन जाता है, तो यह उन्हें आँख मूंदकर एक के बाद एक नहीं चलाता है। यह एक टास्क एंड मोशन प्लानर (TAMP) का उपयोग करता है। इस प्लानर को रोबोट के मस्तिष्क के लिए एक GPS समझें।
- यदि रोबोट को किसी व्यक्ति को कप थमाना है, तो प्लानर जाँच करता है: "क्या कप तक पहुँचा जा सकता है? क्या व्यक्ति का हाथ सही जगह पर है? क्या कोई कुर्सी रास्ता रोक रही है?"
- यदि कप बहुत दूर है, तो प्लानर केवल यह नहीं कहता "असफल"। वह कहता है, "ठीक है, पहले कुर्सी हटाओ, फिर कप उठाओ, फिर उसे थमाओ।"
- यदि रोबोट कप पकड़ने की कोशिश करता है और कप हिल जाने के कारण चूक जाता है, तो प्लानर इसे नोटिस करता है, क्रिया को रोकता है, और एक नया पथ पुनर्गणना (recalculate) करता है। यह बिल्कुल वैसा ही है जैसे ट्रैफिक होने पर आपका GPS आपको नया रास्ता बताता है।
3. सिस्टम का परीक्षण
लेखकों ने कंप्यूटर सिमुलेशन और वास्तविक रोबोटों (ALOHA नामक एक ड्यूल-आर्म रोबोट का उपयोग करके) में इस प्रणाली का परीक्षण किया। उन्होंने रोबोट को बहुत कम प्रशिक्षण डेटा दिया—प्रत्येक कौशल के लिए केवल 20 प्रदर्शन (demonstrations)।
- परिणाम: जब उन्होंने रोबोट का परीक्षण नई, अजीब जगहों पर वस्तुओं के साथ किया (ऐसी जगहें जहाँ उसने पहले कभी नहीं देखा था), तो पुराने तरीके (जैसे केवल वीडियो देखना) अक्सर विफल रहे। लेकिन DR-LfD सफल रहा। उदाहरण के लिए, एक "पेग-इन-होल" कार्य में, जबकि अन्य तरीके छेद हिल जाने पर लगभग आधे समय विफल रहे, DR-LfD ने मानक परीक्षणों में 100% सफलता प्राप्त की और बहुत कठिन, रैंडम परीक्षणों में 88%।
- बाधाओं को संभालना: एक परीक्षण में, उन्होंने एक पोल (खंभा) बीच में रख दिया जिसने रोबोट के हाथ को रोक दिया। रोबोट ने महसूस किया कि वह लक्ष्य तक नहीं पहुँच सकता, इसलिए प्लानर ने उसे पहले पोल को हटाने के लिए कहा, फिर लक्ष्य तक पहुँचने के लिए कहा। इसने सफलतापूर्वक बाधा को हटाया और काम पूरा किया।
- लंबे कार्य: उन्होंने रोबोट से लंबे, बहु-चरणीय कार्य भी करवाए, जैसे तीन अलग-अलग टेप को टोकरी में थमाना, या कप को पोंछते हुए पेचकस पैक करना। इन विशिष्ट प्रयोगों में, रोबोट ने 19 से 21 अलग-अलग चरणों को सफलतापूर्वक जोड़ा, जो एक ऐसा कार्य है जिसमें आमतौर पर रोबट भ्रमित हो जाते हैं और विफल हो जाते हैं। हालाँकि, शोध पत्र नोट करता है कि यह सफलता प्लानर की कम्प्यूटेशनल सीमाओं के भीतर है और परीक्षण किए गए कार्यों के लिए विशिष्ट है।
जो यह पेपर नहीं कर सकता (अभी तक)
लेखक सावधानी बरतते हुए उल्लेख करते हैं कि यह कोई जादू नहीं है। सिस्टम को अभी भी लक्ष्यों को निर्दिष्ट करने या प्राथमिकताएं प्रदान करने के लिए इंसानों की आवश्यकता होती है; यह बिना उस इनपुट के स्वायत्त रूप से यह नहीं जान सकता कि "क्या करने की आवश्यकता है।" साथ ही, क्योंकि रोबोट वस्तुओं को देखने के लिए 3D डेप्थ कैमरों पर निर्भर करता है, यदि कैमरा गंदा है या रोशनी खराब है, तो रोबोट भ्रमित हो सकता है। शोध पत्र यह भी उल्लेख करता है कि यदि कार्य बहुत अधिक वस्तुओं के साथ बहुत जटिल हो जाता है, तो प्लानिंग वाले हिस्से को सोचने में अधिक समय लगता है, ठीक वैसे ही जैसे बहुत सारे विकल्पों से इंसान घबरा जाता है।
निष्कर्ष
शोध पत्र सुझाव देता है कि रोबोटों को छोटे, पुन: प्रयोज्य कौशल सीखने के लिए सिखाकर और फिर उन्हें मिलाने के लिए एक स्मार्ट प्लानर का उपयोग करके, हम अधिक लचीले रोबोट बना सकते हैं जिन्हें पहले की तुलना में बहुत कम प्रशिक्षण डेटा की आवश्यकता होती है। यह रोबोटों को एक अस्त-व्यस्त कमरे में जाने, यह समझने (एक बार जब इंसान उन्हें लक्ष्य बता दे) कि क्या करने की आवश्यकता है, और बिना हर संभव परिदृश्य के लिए लाखों अभ्यास वीडियो की आवश्यकता के बिना काम करने के योग्य बनाने की दिशा में एक कदम है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।