LaGEA: Language Guided Embodied Agents for Robotic Manipulation
LaGEA एक ऐसा फ्रेमवर्क है जो विजन-लैंग्वेज मॉडल्स से संरचित, टेम्पोरल रूप से ग्राउंडेड भाषाई फीडबैक का लाभ उठाकर एडेप्टिव शेपिंग रिवार्ड्स उत्पन्न करता है, जिससे रोबोटिक एजेंट्स को अपनी गलतियों पर प्रभावी ढंग से आत्म-चिंतन करने में सक्षम बनाया जाता है और मैनिपुलेशन कार्यों में अत्याधुनिक तरीकों से काफी बेहतर प्रदर्शन करने में मदद मिलती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
रोबोट लंबे समय से पुनरावृत्ति के उस्ताद रहे हैं, जो बिना किसी त्रुटि के एक ही सटीक गति को हजारों बार करने में सक्षम हैं। फिर भी, जब वे किसी नई स्थिति या ऐसी गलती का सामना करते हैं जो उन्होंने पहले कभी नहीं देखी हो, तो वे अक्सर लड़खड़ा जाते हैं, क्योंकि वे यह समझने में असमर्थ होते हैं कि वे क्यों विफल हुए या अपना मार्ग कैसे सुधारें। दशकों तक, एक रोबोट को उसकी अपनी गलतियों से सीखने के लिए सिखाने हेतु इंजीनियरों को हर संभावित परिदृश्य के लिए मैन्युअल रूप से जटिल नियम लिखने पड़ते थे, जो एक थकाऊ और नाजुक प्रक्रिया थी। रोबोटिक्स के क्षेत्र ने हाल ही में "फाउंडेशन मॉडल्स" का उपयोग करना शुरू किया है, जो शक्तिशाली कंप्यूटर सिस्टम हैं जिन्हें टेक्स्ट और छवियों की विशाल मात्रा पर प्रशिक्षित किया गया है जो प्राकृतिक भाषा और दृश्य दृश्यों को समझ सकते हैं। हालांकि ये सिस्टम यह वर्णन कर सकते हैं कि रोबोट क्या कर रहा है या एक लक्ष्य का सुझाव दे सकते हैं, लेकिन उन्होंने अभी तक रोबोट को वास्तविक समय में अपनी विफलताओं को पहचानने और अपने व्यवहार को समायोजित करने के लिए उस भाषा का उपयोग करने का एक विश्वसनीय तरीका प्रदान नहीं किया है। इस नए शोध को संचालित करने वाला केंद्रीय प्रश्न यह है कि क्या एक रोबोट को केवल साधारण अंग्रेजी में यह बताया जा सकता है कि क्या गलत हुआ, और फिर वह उस स्पष्टीकरण का उपयोग यह सीखने के लिए कर सकता है कि अगली बार बेहतर कैसे किया जाए।
शोधकर्ताओं की एक टीम ने LAGEA नामक एक नया ढांचा विकसित किया है, जिसका अर्थ है 'लैंग्वेज गाइडेड एम्बोडीड एजेंट्स' (Language Guided Embodied Agents), जो इस प्रश्न का उत्तर देने के लिए है। हर सफलता या विफलता के लिए मैन्युअल रूप से रिवॉर्ड्स (पुरस्कार/संकेत) कोड करने के लिए इंजीनियरों पर निर्भर रहने के बजाय, यह प्रणाली एक विजन-लैंग्वेज मॉडल का उपयोग करती है जो एक रोबोट को दरवाजा खोलने या किसी वस्तु को धकेलने जैसे कार्य करने का प्रयास करते हुए देखती है, और फिर जो हुआ उसका एक संरचित, प्राकृतिक-भाषा सारांश तैयार करती है। यदि रोबोट विफल होता है, तो सिस्टम केवल उस प्रयास को एक नुकसान के रूप में चिह्नित नहीं करता है; बल्कि यह प्रयास के वीडियो का विश्लेषण करता है, उस विशिष्ट क्षण की पहचान करता है जब त्रुटि हुई थी, और एक संक्षिप्त स्पष्टीकरण लिखता है, जैसे कि "ग्रिपर गलत कोण से पास आया" या "पकड़ पर्याप्त मजबूत नहीं थी।" इस स्पष्टीकरण को फिर एक संकेत में बदल दिया जाता है जो रोबोट की सीखने की प्रक्रिया को निर्देशित करता है, प्रभावी रूप से रोबोट को न केवल यह बताता है कि वह विफल हुआ, बल्कि यह भी कि बिल्कुल क्यों और इसे कैसे ठीक किया जाए।
शोधकर्ताओं ने इन सिमुलेशनों का परीक्षण कई सिम्युलेटेड वातावरणों में किया जहाँ रोबकों को विभिन्न हेरफेर कार्यों (manipulation tasks) को करना था, जिसमें बटन दबाने से लेकर मेज पर वस्तुओं को खिसकाना तक शामिल था। इन सिमुलेशनों में, रोबोटों को 'स्पार्स रिवार्ड्स' (sparse rewards) दिए गए थे, जिसका अर्थ है कि उन्हें प्रयास के अंत में केवल सफलता या विफलता का एक स्पष्ट संकेत मिलता था, बीच में कोई मार्गदर्शन नहीं मिलता था। भाषा मार्गदर्शन के बिना, रोबोटों को संघर्ष करना पड़ा, वे अक्सर बिना किसी दिशा के भटकते रहे या एक ही गलतियों को दोहराते रहे। हालाँकि, LAGEA से लैस होने पर, रोबोटों ने काफी तेजी से सीखना शुरू कर दिया। यह प्रणाली रोबोट के प्रयास को प्रमुख क्षणों में तोड़कर, भाषा मॉडल से उन विशिष्ट क्षणों की आलोचना करने के लिए कहकर, और फिर उस आलोचना को फीडबैक की एक सघन धारा में बदलकर काम करती थी जो उसके अगले कदमों का मार्गदर्शन करती थी। इसने रोबोट को एक विशिष्ट क्रिया और नकारात्मक परिणाम के बीच के कारण संबंध को समझने में मदद की, जिससे एक अस्पष्ट विफलता एक ठोस सबक में बदल गई।
इन सिमुलेशनों के परिणाम आश्चर्यजनक थे। दस रोबोटिक कार्यों के एक मानक सेट पर, LAGEA का उपयोग करने वाले रोबोटों ने तब 9.0 प्रतिशत अधिक सफलता दर हासिल की जब लक्ष्य यादृच्छिक (random) थे, और तब 5.3 प्रतिशत अधिक जब लक्ष्य निश्चित थे। वस्तुओं को लाने के लिए डिज़ाइन किए गए रोबोटिक आर्म वाले कार्यों के एक अलग सेट में, सुधार और भी अधिक स्पष्ट था, जिसमें पिछले अत्याधुनिक तरीकों की तुलना में सफलता दर में 17 प्रतिशत की वृद्धि हुई। केवल अधिक बार जीतने के अलावा, रोबोट बहुत तेजी से सीखे, और कम प्रयासों में उच्च स्तर की दक्षता प्राप्त की। शोधकर्ताओं ने पाया कि भाषा फीडबैक सबसे अधिक प्रभावी था जब वह संरचित था और समय के विशिष्ट क्षणों से जुड़ा था, न कि पूरे प्रयास पर एक सामान्य टिप्पणी के रूप में। फीडबैक को सटीक रूप से उन फ्रेमों पर केंद्रित करके जहाँ निर्णय लिया गया था, सिस्टम ने रोबोट को त्रुटि को सटीकता के साथ पहचानने में मदद की, जिससे उस भ्रम से बचाव हुआ जो अक्सर अस्पष्ट या अत्यधिक व्यापक निर्देशों से आता है।
महत्वपूर्ण रूप से, अध्ययन ने यह प्रदर्शित किया कि यह विधि दुनिया को देखने के तरीके में बदलाव के प्रति सुदृढ़ (robust) है। शोधकर्ताओं ने रोबोटों को एक विशिष्ट कैमरा एंगल से प्रशिक्षित किया और फिर उन्हें पूरी तरह से अलग दृष्टिकोणों से परीक्षण किया, जैसे कि ऊपर से सीधे नीचे देखना या पीछे से देखना। उसी परिप्रेक्ष्य से कार्य को देखे बिना जिसके लिए उन्हें प्रशिक्षित किया गया था, रोबोटों ने उच्च सफलता दर बनाए रखी, जो सुझाव देता है कि भाषा-आधारित तर्क ने उन्हें दृश्य पैटर्न को याद करने के बजाय कार्य के अंतर्निहित तर्क को समझने में मदद की। सिस्टम ने यह भी सिद्ध किया कि फीडबैक की गुणवत्ता मायने रखती थी; जब शोधकर्ताओं ने भाषा मॉडल को मुक्त-रूप (free-form), असंरचित पाठ लिखने की अनुमति दी, तो रोबोट कम प्रभावी ढंग से सीखे। संरचित प्रारूप, जिसने मॉडल को विशिष्ट त्रुटि कोड की पहचान करने और स्पष्ट तर्क प्रदान करने के लिए मजबूर किया, सीखने के सफल होने के लिए आवश्यक था।
हालाँकि यह अध्ययन पूरी तरह से सिमुलेशन में किया गया था, लेकिन इसके निष्कर्ष वास्तविक-दुनिया की रोबोटिक्स के लिए एक सम्मोहक मार्ग प्रदान करते हैं। शोधकर्ता स्वीकार करते हैं कि उपयोग किए जाने वाले भाषा मॉडल कभी-कभी गलत विवरण उत्पन्न कर सकते हैं, जिसे 'हैलुसिनेशन' (hallucinations) के रूप में जाना जाता है, लेकिन उनका संरचित दृष्टिकोण इन त्रुटियों को कम करने में मदद करता है। वे सुझाव देते हैं कि अगला कदम इन प्रणालियों को कंप्यूटर स्क्रीन से भौतिक रोबोटों तक ले जाना है, जो वर्चुअल प्रशिक्षण और वास्तविक दुनिया के अनुप्रयोग के बीच के अंतर को पाट सके। प्राकृतिक भाषा को न केवल कमांड देने के एक तरीके के रूप में, बल्कि आत्म-चिंतन और त्रुटि सुधार के एक उपकरण के रूप में उपयोग करके, यह कार्य बताता है कि भविष्य में रोबोट अपनी गलतियों से सीखने की क्षमता रखेंगे, जिससे उनमें अनुकूलन क्षमता का एक ऐसा स्तर आएगा जो लंबे समय से पहुंच से बाहर रहा है, जो उन्हें घरों, कारखानों और प्रयोगशालाओं में अधिक उपयोगी सहायक बना सकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।