SUN: Persistent Programs For Language-Grounded Control-to-Learning-to-Real Policies
यह शोध पत्र SUN (सेमेंटिकली यूनिफाइड) प्रोग्राम्स और कुआफू (Kuafu) सिस्टम का परिचय देता है, जो टाइप किए गए, भाषा-आधारित निष्पादन योग्य (executables) प्रोग्राम्स को स्वचालित रूप से संश्लेषित करके मॉडल-आधारित नियंत्रण और सीखे गए नीतियों के बीच के अंतर को पाटते हैं, जो MPC सत्यापन और RL प्रशिक्षण को एकीकृत करते हैं, जिससे बिना किसी मैनुअल डेंस रिवार्ड्स या मानव प्रदर्शनों के सुदृढ़ लॉन्ग-होरिज़न मैनिपुलेशन सक्षम होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
रोबोट लंबे समय से कारखाने के फर्श के विशेषज्ञ रहे हैं, जो बिना किसी त्रुटि के हजारों बार एक ही सटीक गति को दोहराते हैं। लेकिन जब उन्हें एक जटिल, बहु-चरणीय कार्य करने के लिए कहा जाता है—जैसे कि एक दराज खोलना, उसमें से एक बोतल निकालना और उसे मेज पर रखना—तो वे अक्सर लड़खड़ा जाते हैं। कठिनाई दो अलग-अलग तरह की सोच के बीच के अंतर को पाटने में निहित है। एक दृष्टिकोण हर जोड़ के कोण और बल की गणना करने के लिए कठोर गणितीय नियमों पर निर्भर करता है, जिससे यह सुनिश्चित होता है कि रोबोट टकराए नहीं, लेकिन यह तरीका नाजुक है और यदि दुनिया थोड़ी भी बदल जाए तो विफल हो जाता है। दूसरा दृष्टिकोण प्रयास-और-त्रुटि (trial-and-error) सीखने का उपयोग करता है, जहाँ एक रोबोट तब तक अभ्यास करता है जब तक कि वह कार्य को समझ न ले, लेकिन इसके लिए अक्सर हजारों घंटों के मानव प्रदर्शन या सावधानीपूर्वक तैयार किए गए पुरस्कारों की आवश्यकता होती है जिन्हें डिजाइन करना कठिन होता है। वर्षों तक, ये दोनों विधियाँ अलग-अलग साइलो में काम करती रही हैं, जहाँ कठोर योजनाकार (planners) अनुकूल होने में असमर्थ थे और सीखने वाले (learners) कार्य के गहरे तर्क को समझने में असमर्थ थे।
कैलिफोर्निया विश्वविद्यालय, लॉस एंजिल्स के शोधकर्ताओं और उनके सहयोगियों ने 'कुआफू' (Kuafu) नामक एक नई प्रणाली पेश की है जो इन दोनों दृष्टिकोणों को आपस में बुनने का प्रयास करती है। रोबोट के निर्देशों को क्षणिक लक्ष्यों या एक कठोर स्क्रिप्ट के रूप में मानने के बजाय, उन्होंने एक निरंतर, 'टाइप्ड प्रोग्राम' बनाया है जो पूरी प्रक्रिया के लिए सत्य के एकल स्रोत के रूप में कार्य करता है। यह प्रोग्राम, जिसे वे "सेमेंटिकली यूनिफाइड" (Semantically Unified) या SUN प्रोग्राम कहते हैं, इस तरह लिखा गया है कि कंप्यूटर वस्तुओं के बीच के भौतिक संबंधों को समझ सके, जैसे कि दराज का हैंडल किस दिशा में है या बोतल को कितनी दूर ऊपर उठाना होगा। महत्वपूर्ण रूप से, इसी प्रोग्राम का उपयोग रोबोट के कार्यों को सत्यापित करने, उसे हिलना-डुलना सिखाने और शून्य से सीखने के लिए आवश्यक डेटा उत्पन्न करने के लिए किया जाता है। प्रारंभिक योजना चरण से लेकर अंतिम सीखने के चरण तक कार्य के मूल अर्थ को स्थिर रखकर, यह प्रणाली रोबोट को उस पथ से भटकने से रोकती है जो उसे वास्तव में करने के लिए कहा गया था।
यह प्रणाली एक सरल भाषा निर्देश से शुरू होती है, जैसे कि "दराज खोलो और कप को अंदर रख दो।" एक आर्टिफिशियल इंटेलिजेंस एजेंट इस निर्देश को पढ़ता है और भौतिक क्रियाओं और बाधाओं का वर्णन करने वाले पूर्व-निर्धारित बिल्डिंग ब्लॉक्स का चयन करके SUN प्रोग्राम का निर्माण करता है। फिर यह एक उच्च-सटीक सिमुलेशन (high-fidelity simulation) में इस प्रोग्राम का परीक्षण करता है, यह देखने के लिए कि क्या कार्य शारीरिक रूप से संभव है। यदि सिमुलेशन यह प्रकट करता है कि निर्देश त्रुटिपूर्ण हैं या निष्पादित करने के लिए असंभव हैं, तो सिस्टम सीखने की शुरुआत से पहले ही प्रोग्राम की मरम्मत कर देता है। यह स्क्रीनिंग प्रक्रिया महत्वपूर्ण है क्योंकि यह सुनिश्चित करती है कि रोबलेट को कभी भी ऐसा कार्य सीखने के लिए न कहा जाए जो किया नहीं जा सकता, जिससे खराब विचारों को समय और कंप्यूटिंग शक्ति बर्बाद करने से पहले ही फ़िल्टर किया जा सके।
एक बार प्रोग्राम मान्य हो जाने के बाद, प्रणाली इसका उपयोग कार्य के हजारों सफल उदाहरण उत्पन्न करने के लिए करती है। ये उदाहरण केवल यादृच्छिक (random) गतिविधियाँ नहीं हैं; वे निरंतर प्रोग्राम द्वारा निर्देशित होते हैं, जो कार्य के प्रत्येक चरण का पता रखता है, हैंडल को छूने के क्षण से लेकर दराज के पूरी तरह से खुलने तक। रोबोट फिर इन उदाहरणों से सीखता है, पहले सफल गतिविधियों की नकल करके और फिर प्रयास-और-त्रुटि की एक प्रक्रिया के माध्यम से उन्हें परिष्कृत करके जो मूल प्रोग्राम द्वारा सख्ती से सीमित है। यह सुनिश्चित करता है कि जबकि रोबोट लचीला और प्रतिक्रियाशील बनना सीखता है, वह अंतिम लक्ष्य से अपनी दृष्टि नहीं खोता है। परिणाम एक ऐसी 'पॉलिसी' (policy) है जो जटिल, बहु-चरणीय कार्यों को उस स्तर की विश्वसनीयता के साथ निष्पादित कर सकती है जो पिछले तरीकों में संभव नहीं थी।
नौ विभिन्न हेरफेर कार्यों (manipulation tasks) के परीक्षणों की एक श्रृंखला में, जिसमें क्यूब्स को स्टैक करना से लेकर बोतलों को पुनर्व्यवस्थित करना और दराज खोलना शामिल है, इस प्रणाली ने मौजूदा तरीकों की तुलना में महत्वपूर्ण सुधार प्रदर्शित किया। जबकि अन्य दृष्टिकोण जो विरल पुरस्कारों (sparse rewards) या ऑनलाइन प्लानिंग पर निर्भर करते हैं, एक तिहाई से अधिक बार सफल होने में संघर्ष करते हैं, इस नई प्रणाली ने 82 प्रतिशत से अधिक की सफलता दर हासिल की। शोधकर्ताओं ने पाया कि यह प्रणाली उन कार्यों को संभालने में विशेष रूप से प्रभावी थी जिनमें कई चरणों की आवश्यकता होती है, और इसने जटिल अनुक्रमों की जटिलता बढ़ने पर भी अपना प्रदर्शन बनाए रखा। इसके अलावा, इस प्रणाली द्वारा उत्पन्न डेटा इतना उच्च गुणवत्ता वाला था कि इसने एक विजुअल लर्निंग मॉडल को 46 प्रतिशत परीक्षणों में सफल होने की अनुमति दी, जो अन्य पीढ़ी विधियों से प्रशिक्षित मॉडलों की सफलता दर के दोगुने से भी अधिक है।
किसी भी रोबोटिक प्रणाली की असली परीक्षा यह है कि क्या वह कंप्यूटर सिमुलेशन की सुरक्षा से निकलकर वास्तविक दुनिया में जा सकती है। इसकी पुष्टि करने के लिए, शोधकर्ताओं ने फ्रंका (Franka) और किनोवा (Kinova) द्वारा बनाए गए भौतिक रोबोटों पर प्रशिक्षित पॉलिसियों को तैनात किया, और विशिष्ट कार्य संरचना के बिना रोबोट के कार्यों को निर्देशित करने के लिए कैमरों का उपयोग किया। बिना किसी अतिरिक्त ट्यूनिंग या वास्तविक दुनिया के अभ्यास के, रोबोटों ने विभिन्न कॉन्फ़िगरेशन में 34.7 प्रतिशत भौतिक परीक्षणों को सफलतापूर्वक पूरा किया। यह 'जीरो-शॉट ट्रांसफर', जहाँ सिमुलेशन में पूरी तरह से प्रशिक्षित रोबोट तुरंत एक वास्तविक मशीन पर काम करता है, यह सुझाव देता है कि निरंतर प्रोग्राम ने कार्य के आवश्यक तर्क को सफलतापूर्वक पकड़ लिया है, जिससे सीखा गया व्यवहार भौतिक दुनिया में सामान्य हो सका।
शोधकर्ता स्वीकार करते हैं कि इस दृष्टिकोण की सीमाएँ हैं। यह वर्तमान में भौतिक क्रियाओं के एक पूर्व-निर्धारित पुस्तकालय (library) पर निर्भर करता है और दृश्य में वस्तुओं की स्पष्ट समझ की आवश्यकता होती है, जिसका अर्थ है कि यह महत्वपूर्ण नए प्रोग्रामिंग के बिना कपड़े या तरल पदार्थ जैसी विकृत वस्तुओं (deformable objects) को अभी नहीं संभाल सकता है। इसके अतिरिक्त, प्रणाली कार्यों में एक ही दिशा में आगे बढ़ती है और यदि कोई भौतिक त्रुटि होती है तो पीछे नहीं हट सकती, जो कुछ प्रकार की गलतियों से उबरने की इसकी क्षमता को सीमित करता है। हालाँकि, परिणाम रोबोट लर्निंग के लिए एक नया सिद्धांत स्थापित करते हैं: कि योजना, सत्यापन और सीखने के दौरान कार्य के अर्थ को सुसंगत रखना स्वचालन के लिए एक मजबूत आधार बनाता है। यह सुनिश्चित करके कि रोबोट की कार्य की समझ नहीं भटकती है, यह प्रणाली कठोर नियंत्रण और लचीले शिक्षण के बीच के अंतर को पाटती है, जो वास्तविक दुनिया में जटिल कार्यों को विश्वसनीय रूप से करने वाले रोबोटों की ओर एक मार्ग प्रदान करती है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।