Adapting Generalist Robot Policies with Semantic Reinforcement Learning
यह शोध पत्र सिमेंटिक एक्शन रीइन्फोर्समेंट लर्निंग (SARL) का प्रस्ताव करता है, जो एक ऐसी विधि है जो रॉ एक्शन्स के बजाय लैंग्वेज प्रॉम्प्ट्स को अनुकूलित करने के लिए रीइन्फोर्समेंट लर्निंग का उपयोग करके जनरलिटिस्ट रोबोट पॉलिसियों को बेहतर बनाती है, जिससे उन जटिल, लॉन्ग-होरिज़न कार्यों को हल करने के लिए प्री-ट्रेन्ड स्किल्स को कुशलतापूर्वक संयोजित किया जा सकता है जो पॉलिसी की ज़ीरो-शॉट क्षमताओं से बाहर हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक रोबोट है जिसने लाखों किताबें पढ़ी हैं और काम करने के अनगिनत वीडियो देखे हैं। यह एक "जनरलिस्ट" (generalist) रोबोट है; इसे पता है कि कप को कैसे पकड़ना है, दरवाजा कैसे खोलना है, या मेज कैसे पोंछना है। हालांकि, यदि आप इसे कोई जटिल, बहु-चरणीय कार्य करने के लिए कहते हैं जो इसने पहले नहीं देखा है—जैसे कि "हथौड़े को प्लेट पर रखें और फिर मशरूम उठाएं"—तो यह अक्सर भ्रमित हो जाता है। यह गलत वस्तु को पकड़ सकता है, चीजें गिरा सकता है, या बस रुक सकता है।
यह पेपर इस रोबोट को सिखाने का एक नया तरीका पेश करता है, जिसे SARL (सेमेंटिक एक्शन रीइन्फोर्समेंट लर्निंग) कहा जाता है। यह कैसे काम करता है, यहाँ कुछ सरल उपमाओं का उपयोग करके बताया गया है:
समस्या: "अति-आत्मविश्वासी शेफ" (The Overconfident Chef)
रोबोट के पूर्व-प्रशिक्षित मस्तिष्क को एक मास्टर शेफ के रूप में सोचें जो हजारों रेसिपी जानता है। यदि आप उससे "एक सलाद" मांगते हैं, तो शेफ को ठीक से पता होता है कि क्या करना है। लेकिन यदि आप उससे बहुत विशिष्ट, अजीब व्यंजन जैसे "हथौड़े और मशरूम वाला सलाद" मांगते हैं, तो शेफ घबरा सकता है। वह जानता है कि हथौड़ा क्या है, लेकिन वह यह नहीं जानता कि सलाद के साथ हथौड़े को इस तरह कैसे जोड़ा जाए जो समझ में आए।
इसे ठीक करने के मानक तरीकों में रोबोट के हाथों (रोबोट की शारीरिक गतिविधियों) को सीधे ट्यून करने की कोशिश करना शामिल है। यह शेफ को यह सिखाने जैसा है कि किसी विशिष्ट सब्जी को कैसे काटना है, उसके लिए उसकी कलाई को मिलीमीटर दर मिलीमीटर भौतिक रूप से हिलाकर। यह धीमा, कठिन है, और यदि शेफ की शुरुआती स्थिति गलत है, तो वह अपनी उंगली काट सकता है।
समाधान: "स्मार्ट सू-शेफ" (The Smart Sous-Chef)
लेखकों का बड़ा विचार रोबोट के हाथों को सीधे हिलाने की कोशिश करना बंद करना है। इसके बजाय, वे भाषा के निर्देशों को रोबोट के "एक्शन" (क्रियाओं) के रूप में देखते हैं।
कल्पना कीजिए कि मास्टर शेफ के बगल में एक सू-शेफ (एक नया AI सिस्टम) खड़ा है। सू-शेफ भोजन को नहीं छूता; वे केवल शेफ को निर्देश फुसफुसाते हैं।
- पुराना तरीका: "अपना हाथ 2 इंच बाईं ओर ले जाएं, फिर 1 इंच नीचे, फिर अपनी उंगलियां बंद करें।" (बहुत विस्तृत, सीखना कठिन है)।
- SARL का तरीका: सू-शेफ फुसफुसाता है, "हथौड़ा पकड़ो," फिर "हथौड़े को प्लेट पर रखो," फिर "मशरूम उठाओ।"
सू-शेफ (SARL) प्रयास और त्रुटि (trial and error) के माध्यम से सीखता है। वह अलग-अलग निर्देश फुसफुसाता है।
- यदि वह फुसफुसाता है "हथौड़ा पकड़ो" और शेफ चम्मच पकड़ लेता है, तो सू-शेफ सीखता है: "ठीक है, इस विशिष्ट हथौड़े के लिए यह फुसफुसाहट काम नहीं आई।"
- यदि वह फुसफुसाता है "दाएं जाओ और पकड़ो" और शेफ सफल हो जाता है, तो सू-शेफ सीखता है: "यह फुसफुसाहट एक विजेता थी!"
यह कैसे सीखता है: "ग्राउंडेड" डिक्शनरी (The "Grounded" Dictionary)
यह पेपर इस बात पर जोर देता है कि यह तरीका केवल एक स्मार्ट लैंग्वेज मॉडल (जैसे चैटबॉट) का उपयोग करके निर्देश देने से कैसे अलग है।
- चैटबॉट (VLM): एक स्मार्ट चैटबॉट कह सकता है, "हथौड़ा पकड़ो।" यह तार्किक लगता है। लेकिन इसे यह नहीं पता कि यह विशिष्ट रोबोट हथौड़ों के साथ भ्रमित हो जाता है और चम्मच पकड़ लेता है। यह उस शेफ की तरह है जिसने हथौड़े के बारे में पढ़ा तो है लेकिन वास्तव में उसे कभी पकड़ा नहीं है।
- SARL (द ग्राउंडेड लर्नर): SARL करने से सीखता है। यह निर्देश आजमाता है, देखता है कि रोबोट वास्तव में क्या करता है, और अपने "डिक्शनरी" को अपडेट करता है। यह सीखता है कि इस रोबोट के लिए, "नीचे जाओ और पकड़ो" कहना "हथौड़ा पकड़ो" कहने से बेहतर काम करता है।
इसे "ग्राउंडिंग" (grounding) कहा जाता है। SARL शब्दों को रोबोट की वास्तविक क्रियाओं से जोड़ता है। यह सीखता है कि "दाएं जाना" एक सुरक्षित दांव है, जबकि "हथौड़ा पकड़ो" एक जाल हो सकता है।
परिणाम: वर्षों में नहीं, मिनटों में सीखना
यह पेपर दिखाता है कि इस "फुसफुसाने" वाले तरीके का उपयोग करके, रोबोट जटिल, लंबे कार्यों (जैसे हथौड़ा और मशरूम वाला कार्य) को 100 प्रयासों से कम में हल करना सीख सकता है।
- अन्य तरीके (रोबोट के हाथों को सीधे ठीक करने की कोशिश करना) अक्सर इसलिए फंस जाते हैं क्योंकि नए कार्य के लिए रोबोट की शुरुआती "मसल मेमोरी" (muscle memory) गलत होती है।
- SARL उन मसल मेमोरी की समस्याओं को बायपास कर देता है क्योंकि यह उन सही शब्दों को ढूंढ लेता है जो रोबोट के मौजूदा कौशल को सक्रिय करते हैं।
सारांश
संक्षेप में, पेपर कहता है: रोबोट की मांसपेशियों को शून्य से फिर से प्रशिक्षित करने की कोशिश न करें। इसके बजाय, 'रीइन्फोर्समेंट लर्निंग' का उपयोग करके एक "स्मार्ट सहायक" को यह सिखाएं कि रोबोट को सही भाषा कैसे बोलनी है। यह सहायक सीखता है कि कौन से शब्द रोबोट के मौजूदा कौशल को ट्रिगर करते हैं ताकि नए, जटिल पहेलियों को हल किया जा सके, जिससे एक भ्रमित रोबोट एक सक्षम कार्यकर्ता में बदल जाता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।