GE-Act 2.0: Pretraining and Scaling a World-Action Model for Robotic Manipulation
GE-Act 2.0 एक नवीन वर्ल्ड-एक्शन मॉडल है जिसे मैनिपुलेशन डेटा पर स्क्रैच से प्रशिक्षित किया गया है जो एक कंट्रोल-ओरिएंटेड ऑटोएनकोडर, एक सिंगल-स्टेप विजुअल प्लानर और नॉलेज-अलाइन्ड सिलेक्टिव ऑप्टिमाइजेशन के साथ एक इनवर्स डायनेमिक्स मॉडल को एकीकृत करता है, जो व्यापक स्केलिंग और क्रॉस-एम्बॉडिमेंटमेंट ट्रांसफर के माध्यम से विविध कार्यों और एम्बॉडिमेंट्स में महत्वपूर्ण ज़ीरो-शॉट सफलता प्राप्त करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
रोबोट लंबे समय से कारखानों के फर्श के उस्ताद रहे हैं, जो बिना किसी त्रुटि के हजारों बार एक ही सटीक गति को दोहराते हैं। लेकिन यदि उन्हें रसोई, लिविंग रूम या किसी अव्यवस्थित वर्कशॉप में रख दिया जाए, तो वे अक्सर ठिठक जाते हैं। चुनौती केवल हाथ हिलाने की नहीं है; बल्कि यह समझने की है कि जब वह हाथ किसी चीज़ को छूता है तो दुनिया कैसे बदलती है। इस राह पर चलने के लिए, आर्टिफिशियल इंटेलिजेंस की एक नई पीढ़ी भविष्य की कल्पना करना सीख रही है। केवल वर्तमान में जो दिख रहा है उस पर प्रतिक्रिया देने के बजाय, ये सिस्टम यह अनुमान लगाने की कोशिश करते हैं कि यदि वे कोई विशिष्ट क्रिया करते हैं तो आगे क्या होगा। यह दृष्टिकोण, जिसे 'वर्ल्ड-एक्शन मॉडल' (world-action model) कहा जाता है, रोबोट को अपनी मांसपेशी हिलाने से पहले अपने मन में घटनाओं के एक क्रम का अनुकरण करने की अनुमति देता है, ताकि यह जांचा जा सके कि परिणाम लक्ष्य के अनुरूप है या नहीं। वर्षों से, शोधकर्ताओं ने मौजूदा वीडियो जनरेटर्स—ऐसे प्रोग्राम जिन्हें नकली फिल्में बनाने के लिए प्रशिक्षित किया गया है—को लेकर और उन्हें रोबोटिक गतिविधियों को समझने के लिए मजबूर करके इन सिस्टमों को बनाने का प्रयास किया है। हालांकि, इस पद्धति से अक्सर रोबोट को भौतिकी (physics) की एक अस्पष्ट समझ मिलती है, क्योंकि वीडियो जनरेटर को वास्तव में एक भौतिक शरीर को नियंत्रित करने के लिए डिज़ाइन नहीं किया गया था।
AgiBot की एक टीम ने अब एक अलग दृष्टिकोण पेश किया है, जो केवल वास्तविक दुनिया के इंटरैक्शन डेटा का उपयोग करके रोबोट की कल्पना को बुनियादी स्तर से निर्मित करता है। उन्होंने GE-Act 2.0 नामक एक सिस्टम बनाया है, जो भविष्य की भविष्यवाणी करना और क्रियाओं का निर्णय लेना एक साथ सीखता है, लेकिन एक महत्वपूर्ण मोड़ के साथ: सिस्टम का प्रत्येक भाग रोबोटों और मनुष्यों द्वारा वस्तुओं के हेरफेर से एकत्र किए गए डेटा पर शून्य से प्रशिक्षित किया गया है। शोधकर्ताओं ने पूर्व-निर्मित वीडियो मॉडल पर भरोसा नहीं किया। इसके बजाय, उन्होंने सिस्टम को गति की एक संकुचित भाषा सिखाई, दुनिया को देखने का एक ऐसा तरीका जो नियंत्रण के लिए महत्वपूर्ण चीजों पर ध्यान केंद्रित करने हेतु अनावश्यक विवरणों को हटा देता है। इसने रोबोट को डेटा के एक विशाल और विविध पुस्तकालय से सीखने की अनुमति दी, जिसमें सफल प्रदर्शनों, असफल प्रयासों और यहाँ तक कि बिना किसी रिकॉर्ड किए गए निर्देश के काम करने वाले मनुष्यों के वीडियो भी शामिल थे। इस विभिन्न प्रकार के शिक्षण को जोड़कर, सिस्टम ने सामान्यीकरण (generalize) करना सीखा, जिसका अर्थ है कि वह सीखी गई बातों को एक पूरी तरह से नई स्थिति में लागू कर सकता था जिसे उसने पहले कभी नहीं देखा था।
इस उपलब्धि का मूल आधार यह है कि शोधकर्ताओं ने भौतिक दुनिया की अव्यवस्थित वास्तविकता को कैसे संभाला। जब एक रोबोट सीखने की कोशिश करता है, तो उसे अक्सर एक भ्रमित करने वाली समस्या का सामना करना पड़ता है: एक ही निर्देश को कई अलग-अलग तरीकों से पूरा किया जा सकता है। एक रोबोट को "लाल कप उठाओ" कहा जा सकता है, और वह बाईं ओर से, दाईं ओर से, या हैंडल या रिम से पकड़कर आगे बढ़ सकता है। यदि प्रशिक्षण डेटा केवल एक ही तरीका दिखाता है, लेकिन रोबोट की कल्पना कुछ और बताती है, तो सिस्टम के दोनों हिस्से तालमेल से बाहर हो सकते हैं। शोधकर्ताओं ने इस बेमेल को एक "वैलिडिटी गैप" (validity gap) के रूप में पहचाना, जहाँ रोबोट का भविष्य का अनुमान उस क्रिया के साथ मेल नहीं खाता जो उसे करनी चाहिए। इसे ठीक करने के लिए, उन्होंने एक चयन प्रक्रिया विकसित की जो एक फिल्टर की तरह कार्य करती है। भविष्य के अनुमान से सीखने से पहले, रोबोट यह जाँचता है कि क्या वह भविष्य उस क्रिया के अनुकूल है जिसे उसे करना है। वह कई संभावित भविष्य उत्पन्न करता है, उन्हें आवश्यक क्रिया के विरुद्ध परीक्षण करता है, और केवल उन्हीं से सीखता है जो एक साथ तर्कसंगत लगते हैं। यह सुनिश्चित करता है कि रोबोट यह न समझ ले कि विभिन्न क्रियाएं विभिन्न परिणामों की ओर कैसे ले जाती हैं।
इस प्रशिक्षण के परिणाम आश्चर्यजनक हैं, विशेष रूप से उन कार्यों पर परीक्षण किए जाने पर जिनका अभ्यास रोबोट ने पहले कभी नहीं किया है। शोधकर्ताओं ने सौ अलग-अलग मैनिपुलेशन कार्यों पर सिस्टम का मूल्यांकन किया, जिनमें ब्लॉक को स्टैक करना और तरल पदार्थ डालना से लेकर तौलिये को मोड़ना और प्लग लगाना शामिल है। ये परीक्षण वास्तविक रोबोटों पर अलग-अलग लाइटिंग, बैकग्राउंड और वस्तुओं की व्यवस्था वाले वातावरण में किए गए थे। जब सिस्टम को 300 घंटों के छोटे डेटासेट पर प्रशिक्षित किया गया, तो इसने एक रोबोट मॉडल पर केवल 17.1% कार्यों में सफलता प्राप्त की। हालांकि, जैसे-जैसे शोधकर्ताओं ने प्रशिक्षण डेटा को बढ़ाकर 30,000 घंटे किया, सफलता दर लगातार बढ़कर 44.1% हो गई। यह सुधार व्यक्तिगत कार्यों के लिए किसी विशिष्ट फाइन-ट्यूनिंग के बिना हुआ; रोबोट ने बस सीखी गई सामान्य कौशलों को नए चुनौतियों पर लागू किया। इससे भी अधिक आश्चर्यजनक रूप से, सिस्टम ने दूसरे, अलग रोबोट मॉडल पर मजबूत क्षमता दिखाई, जिसमें प्रशिक्षण डेटा का 2% से भी कम हिस्सा था, जो बताता है कि बड़े डेटासेट से सीखे गए कौशल एक नए भौतिक रूप में प्रभावी ढंग से स्थानांतरित हुए।
निर्देशों का पालन करने की सिस्टम की क्षमता का परीक्षण कठिन परिस्थितियों में भी किया गया। कई परीक्षणों में, रोबोट को एक ऐसा कार्य करने के लिए कहा गया जो दृश्य या पिछले स्वभाव के आधार पर उसके अपेक्षित व्यवहार के विपरीत था। उदाहरण के लिए, यदि रोबोट किसी गति के बीच में था, तो वह फिर भी रुक सकता था और अपना रास्ता बदलने के लिए एक नए, स्पष्ट कमांड का पालन कर सकता था। 90% से अधिक परीक्षणों में, रोबोट ने निर्देश में बताए गए विशिष्ट वस्तु, रंग, आकार या स्थिति की सही पहचान की, भले ही वे विवरण सूक्ष्म हों या संदर्भ भ्रमित करने वाला हो। शोधकर्ताओं ने रोबोट द्वारा सीखे गए कौशल की विविधता और नए कार्यों पर उसकी सफलता की क्षमता के बीच एक मजबूत संबंध पाया। प्रशिक्षण के दौरान डेटा जितना अधिक विविध था, रोबोट के किसी नई स्थिति को संभालने की संभावना उतनी ही अधिक थी। यह सुझाव देता है कि अधिक सक्षम रोबोटों का मार्ग केवल बेहतर एल्गोरिदम में नहीं, बल्कि उस डेटा की मात्रा और विविधता में निहित है जिसका वे उपभोग करते हैं।
यह कार्य ऐसे रोबोटों की दिशा में एक महत्वपूर्ण कदम है जो दुनिया को समझने के लिए उसी समृद्ध, असंरचित डेटा से सीख सकते हैं जिसका उपयोग मनुष्य करते हैं। भविष्य की भविष्यवाणी करने और क्रियाओं की योजना बनाने वाले एक एकीकृत सिस्टम बनाकर, और कई संभावनाओं में से सही भविष्यवाणियों को चुनने के लिए इसे प्रशिक्षित करके, शोधकर्ताओं ने एक ऐसा मॉडल तैयार किया है जो मजबूत और अनुकूलनीय है। निष्कर्ष बताते हैं कि पर्याप्त विविध अनुभव के साथ, एक रोबोट वस्तुओं के व्यवहार और उनके साथ बातचीत करने के तरीके की गहरी, सहज समझ विकसित कर सकता है, जो कठोर प्रोग्रामिंग से हटकर एक अधिक लचीले रूप की ओर बढ़ता है। वास्तविक हार्डवेयर पर इस दृष्टिकोण की सफलता, बिना हर नए काम के लिए पुन: प्रशिक्षित किए, एक ऐसे भविष्य की ओर संकेत करती है जहाँ रोबनों को गतिशील, अप्रत्याशित वातावरण में तैनात किया जा सकता है और वहां फलने-फूलने के लिए सीखा जा सकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।