REFACTOR-VLA: Unsupervised Library Learning of Typed Motor Programs
REFACTOR-VLA एक वेक/स्लीप (wake/sleep) फ्रेमवर्क है जो एक व्यवहारिक-तुल्यता कर्नेल (behavioral-equivalence kernel) और एक लेटेंट वर्ल्ड मॉडल के माध्यम से एक्शन फ्रैगमेंट को क्लस्टर करके पुन: प्रयोज्य, टाइप किए गए मोटर प्रोग्राम सीखता है, जो एक लाइब्रेरी-कंडीशन्ड डिकोडर और एक ऐसे प्रशिक्षण उद्देश्य के माध्यम से लॉन्ग-होराइजन LIBERO कार्यों पर अत्याधुनिक प्रदर्शन प्राप्त करता है जो मॉडल क्षमता के बजाय क्लस्टरिंग गुणवत्ता को प्राथमिकता देता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
रोबोट दुनिया को देखने और उसमें चलने-फिरने में बेहतर हो रहे हैं, लेकिन वे अभी भी उस तरह के जटिल, बहु-चरणीय कार्यों में संघर्ष करते हैं जिन्हें इंसान सहजता से संभाल लेते हैं। जब एक व्यक्ति सैंडविच बनाता है, तो वह ब्रेड पकड़ने, मक्खन लगाने या टमाटर काटने के लिए आवश्यक हर एक मांसपेशी की हरकत के बारे में नहीं सोचता। इसके बजाय, वे परिचित क्रियाओं—पकड़ने, फैलाने, काटने—के एक मानसिक पुस्तकालय (मेंटल लाइब्रेरी) पर भरोसा करते हैं जिन्हें वे अलग-अलग क्रमों में जोड़ सकते हैं। वर्तमान आर्टिफिशियल इंटेलिजेंस मॉडल रोबोटों के लिए अक्सर इस क्षमता का अभाव रखते हैं कि वे व्यवहार को व्यवस्थित कर सकें। वे अक्सर कच्चे, क्षण-दर-क्षण कमांड उत्पन्न करते हैं बिना उन्हें पुन: प्रयोज्य (reusable), अच्छी तरह से परिभाषित कौशलों में समूहित किए। यह उन्हें लंबे कार्यों के लिए योजना बनाने या जो उन्होंने सीखा है उसे समझाने में कठिन बनाता है। शोधकर्ता अब मशीनों को अपने स्वयं के कौशल का आंतरिक पुस्तकालय बनाने के लिए प्रशिक्षित करने की कोशिश कर रहे हैं, जिससे वे जटिल कार्यों को छोटे, प्रबंधनीय टुकड़ों में तोड़ सकें जिन्हें पुन: उपयोग और संयोजित किया जा सके।
एप्पल के शोधकर्ताओं की एक टीम ने REFACTOR-VLA नामक एक नई प्रणाली विकसित की है जो इस समस्या को हल करने का प्रयास करती है, जिसमें रोबोट को बिना मानवीय लेबल के अपने स्वयं के कौशल खोजने के लिए प्रशिक्षित किया जाता है। यह प्रणाली दो वैकल्पिक चरणों में काम करती है, ठीक वैसे ही जैसे एक इंसान किसी नए मूवमेंट का अभ्यास करता है और फिर याददाश्त को व्यवस्थित करने के लिए आराम करता है। पहले चरण में, रोबोट यह सीखता है कि यदि वह कुछ गतिविधियों के एक क्रम को निष्पादित करता है तो आगे क्या होगा। यह दुनिया का एक मानसिक मॉडल बनाता है, यह समझते हुए कि उसकी क्रियाएं पर्यावरण को कैसे बदलती हैं। दूसरे चरण में, सिस्टम द्वारा एकत्र किए गए मूवमेंट डेटा के विशाल भंडार को देखता है और पैटर्न खोजने की कोशिश करता है। यह एक सरल लेकिन कठिन प्रश्न पूछता है: क्या गतिविधियों के दो अलग-अलग क्रम एक ही परिणाम उत्पन्न करते हैं? यदि एक रोबोट कप उठाने के लिए अपने हाथ को एक घेरे में घुमाता है, या ऐसा करने के लिए अपने हाथ को एक सीधी रेखा में ले जाता है, तो सिस्टम को यह पहचानना होगा कि दोनों पथ एक ही लक्ष्य प्राप्त करते हैं।
इसका उत्तर देने के लिए, शोधकर्ताओं ने एक विशेष उपकरण बनाया जो केवल दिखावट के बजाय क्रियाओं के परिणाम को मापता है। रोबोट के हिलने-डुलने के कच्चे वीडियो को देखने के बजाय, सिस्टम क्रिया का अनुकरण (सिमुलेट) करता है ताकि यह देख सके कि रोबोट कहाँ समाप्त होता है और उसे क्या इनाम मिलता है। यदि दो अलग-अलग मूवमेंट पथ एक ही अंतिम स्थिति और एक ही इनाम की ओर ले जाते हैं, तो सिस्टम उन्हें समान मानता है। इसके बाद, यह समान पथों को एक एकल, पुन: प्रयोज्य कौशल में समूहित करता है। एक बार समूह बन जाने के बाद, सिस्टम उस कौशल के सामान्य पैटर्न का वर्णन करने के लिए एक सरल, संरचित प्रोग्राम लिखने का प्रयास करता है। इस प्रोग्राम को फिर एक लाइब्रेरी में जोड़ा जाता है। रोबोट बाद में इस लाइब्रेरी का उपयोग नए कार्यों की योजना बनाने के लिए कर सकता है, हर छोटी हरकत की गणना शून्य से करने के बजाय इन पूर्व-पैकेज किए गए कौशलों का उपयोग करता है।
शोधकर्ताओं ने एक सिम्युलेटेड वातावरण में वस्तुओं को हिलाने वाले रोबोट कार्यों के एक मानक सेट पर इस दृष्टिकोण का परीक्षण किया। उन्होंने पाया कि इस तरह के सिस्टम कैसे सीखते हैं, इसके बारे में कुछ आश्चर्यजनक बातें। आर्टिफिशियल इंटेलिजेंस में एक आम धारणा है कि मॉडल को बड़ा और अधिक जटिल बनाने से हमेशा बेहतर प्रदर्शन होता है। हालाँकि, जब शोधकर्ताओं ने अपने वर्ल्ड मॉडल का आकार लगभग 188 मिलियन पैरामीटर से बढ़ाकर 430 मिलियन कर दिया, तो सिस्टम ने प्रत्येक टेस्ट सूट पर खराब प्रदर्शन किया। बड़े मॉडल ने कौशलों को सही ढंग से व्यवस्थित करने में विफल रहा, जो बताता है कि केवल अधिक कंप्यूटिंग पावर जोड़ना समाधान नहीं है।
इसके बजाय, सफलता की कुंजी इस बात में थी कि मॉडल को कैसे प्रशिक्षित किया गया था। शोधकर्ताओं ने पाया कि प्रारंभिक प्रशिक्षण चरण के दौरान एक विशिष्ट प्रकार का लर्निंग ऑब्जेक्टिव जोड़ने से परिणामों में नाटकीय रूप रूप से सुधार हुआ। इस ऑब्जेक्टिव ने सिस्टम को विभिन्न कार्यों के बीच स्पष्ट रूप से अंतर करने में मदद की, जिससे इसे समान गतिविधियों को बहुत अधिक प्रभावी ढंग से समूहित करने में सक्षम बनाया। इस बदलाव के साथ, सिस्टम ने चार प्रमुख टेस्ट सूट्स पर सबसे मजबूत मौजूदा तरीकों को पछाड़ दिया, और अपने औसत स्कोर में महत्वपूर्ण अंतर से सुधार किया। सिस्टम ने एक विशिष्ट कार्य के लिए तीन अलग-अलग, पुन: प्रयोज्य कौशलों का पुस्तकालय सफलतापूर्वक बनाया, और इस लाइब्रेरी का उपयोग करने वाला रोबोट उन सभी प्रदर्शनों को इन नए कौशलों का उपयोग करके फिर से लिख सका जिन्हें उसने देखा था।
अध्ययन ने यह भी खुलासा किया कि कौशलों को खोजने की सिस्टम की क्षमता इस बात पर बहुत निर्भर करती है कि वह किस प्रकार के डेटा का विश्लेषण करता है। जबकि सिस्टम ने भाषा-आधारित निर्देशों, जैसे कि "वस्तु को उठाएं और टोकरी में रखें," का सफलतापूर्वक निर्माण किया, वह कच्चे मोटर कमांड्स में पुन: प्रयोज्य पैटर्न खोजने में विफल रहा। यह सुझाव देता है कि सिस्टम किसी कार्य के उच्च-स्तरीय लक्ष्यों को समझने में निम्न-स्तरीय भौतिक विवरणों की तुलना में बेहतर है। शोधकर्ताओं ने कई प्रशिक्षण दौरों में अपने परिणामों की निरंतरता को मापा और पाया कि सिस्टम विश्वसनीय रूप से समान कौशल समूहन की खोज करता है, जिसमें मॉडल के विभिन्न संस्करणों के बीच उच्च स्तर की सहमति देखी गई।
यह कार्य प्रदर्शित करता है कि रोबोट के अपने अनुभवों को व्यवस्थित करने का तरीका उसके मस्तिष्क के आकार से अधिक महत्वपूर्ण है। क्रियाओं के परिणामों पर ध्यान केंद्रित करके और उन्हें समूहित करने के लिए एक संरचित पद्धति का उपयोग करके, सिस्टम कौशलों का एक पुस्तकालय बना सकता है जो उसे जटिल, दीर्घकालिक कार्यों से निपटने में मदद करता है। निष्कर्ष इस विचार को चुनौती देते हैं कि बड़ा होना हमेशा बेहतर होता है और एक ऐसे भविष्य की ओर संकेत करते हैं जहाँ रोबोट पुन: प्रयोज्य क्रियाओं के संदर्भ में सोचना सीख सकते हैं, ठीक वैसे ही जैसे इंसान करते हैं। शोधकर्ताओं ने अपने कोड और डेटा को उपलब्ध कराया है, जिससे अन्य लोग इन परिणामों को सत्यापित कर सकें और इस नए दृष्टिकोण को आगे बढ़ा सकें।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।