SkillWrapper: Generative Predicate Invention for Task-level Robot Planning
यह शोध पत्र SkillWrapper को प्रस्तुत करता है, जो फाउंडेशन मॉडल्स का लाभ उठाकर कच्चे RGB अवलोकनों से औपचारिक, प्रमाणित रूप से सुदृढ़ और पूर्ण प्रतीकात्मक विधेयकों (predicates) को स्वचालित रूप से आविष्कार करने की एक विधि है, जिससे रोबोटों को अनदेखे दीर्घ-क्षितिज वाले कार्यों (long-horizon tasks) को हल करने के लिए ब्लैक-बॉक्स कौशलों को अमूर्त निरूपणों में सामान्यीकृत करने में सक्षम बनाया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक ऐसा रोबोट है जो शारीरिक स्तर पर अविश्वसनीय रूप से शक्तिशाली और कुशल है। वह एक चायदानी उठा सकता है, चाय डाल सकता है, और एक प्लेट पर कटोरा रख सकता है। हालाँकि, अभी, यह रोबोट एक ऐसे प्रतिभाशाली पियानो वादक की तरह है जो केवल व्यक्तिगत कुंजियों (keys) को दबाना जानता है। वह एक एकल स्वर (note) तो बजा सकता है, लेकिन उसे संगीत सिद्धांत (music theory) की समझ नहीं है। वह एक गीत रचना या पूरा कॉन्सर्ट प्लान करना नहीं जानता।
यही वह समस्या है जिसे SkillWrapper हल करता है।
समस्या: "ब्लैक बॉक्स" रोबोट
वर्तमान में, कई रोबोटों के पास "ब्लैक बॉक्स" कौशल होते हैं। ये पूर्व-निर्धारित क्रियाएं (जैसे "वस्तु उठाना" या "तरल डालना") हैं जो अपने आप में अच्छी तरह से काम करती हैं। लेकिन यदि आप चाहते हैं कि रोबोट एक जटिल, बहु-चरणीय कार्य करे—जैसे "चाय बनाना"—तो उसे इन कौशलों को एक साथ जोड़ने का तरीका नहीं पता होता।
एक रोबोट को जटिल कार्य की योजना बनाने के लिए, मनुष्यों को आमतौर पर उसके लिए एक नियम पुस्तिका (rulebook) मैन्युअल रूप से लिखनी पड़ती है। उन्हें समझाना पड़ता है: "चाय डालने के लिए, रोबोट को पहले चायदानी पकड़े होनी चाहिए, और कप खाली होना चाहिए।" यह थकाऊ, धीमा और हर नए रोबोट या वातावरण के लिए असंभव है।
समाधान: रोबोट को अपनी खुद की नियम पुस्तिका लिखना सिखाना
शोधकर्ताओं ने SkillWrapper नामक एक प्रणाली बनाई है। इंसान द्वारा नियम पुस्तिका लिखने के बजाय, SkillWrapper रोबोट को खुद को चीजें आजमाते हुए देखकर अपना स्वयं का "शब्दावली" (vocabulary) और "नियम" आविष्कार करने के लिए प्रशिक्षित करता है।
यह कैसे काम करता है, यहाँ एक सरल उपमा (analogy) दी गई है:
1. "परीक्षण और त्रुटि" चरण (सक्रिय डेटा संग्रह)
कल्पना कीजिए कि एक रसोई में एक रोबोट है। उसे अभी नियम नहीं पता। SkillWrapper रोबोट को कहता है: "जाओ चायदानी उठाने की कोशिश करो। अब स्पंज उठाने की कोशिश करो। अब कटोरा रखने की कोशिश करो।"
- सफलता: रोबोट चायदानी उठा लेता है।
- विफलता: रोबोट स्पंज उठाने की कोशिश करता है, लेकिन वह बहुत फिसलन भरा है, और वह उसे गिरा देता है।
रोबोट इन क्षणों को रिकॉर्ड करता है: "मैंने चायदानी उठाने की कोशिश की, और यह सफल रहा। मैंने स्पंज उठाने की कोशिश की, और यह विफल रहा।"
2. "अहा!" क्षण (जेनेरेटिव प्रेडिकेट इन्वेंशन)
यही जादुई हिस्सा है। रोबोट अपनी सफलताओं और विफलताओं को देखता है और पूछता है: "एक काम क्यों किया और दूसरा क्यों विफल हुआ?"
अतीत में, कंप्यूटरों को उत्तर देने के लिए मनुष्यों की आवश्यकता होती थी (जैसे, "स्पंज बहुत फिसलन भरा है")। लेकिन SkillWrapper एक फाउंडेशन मॉडल (एक सुपर-स्मार्ट AI जो छवियों और भाषा को समझता है, जैसे कि ChatGPT या DALL-E का एक बहुत उन्नत संस्करण) का उपयोग करता है।
- रोबोट AI को दो तस्वीरें दिखाता है: एक सफल पिकअप की और एक विफल पिकअप की।
- AI छवियों को देखता है और अंतर को समझाने के लिए एक नया शब्द (एक प्रेडिकेट) गढ़ता है।
- AI कहता है: "आह! अंतर यह है कि चायदानी में हैंडल है, लेकिन स्पंज फिसलन भरा है। चलिए एक नया नियम बनाते हैं जिसे
GripperEmptyयाObjectIsStableकहा जाए।"
रोबोट एक नया, मानव-पठनीय विचार (concept) बनाता है जो बताता है कि वह क्रिया क्यों सफल या विफल हुई। यह ऐसा है जैसे रोबोट अचानक "फिसलन भरा" शब्द सीख गया हो और यह महसूस कर गया हो, "ओह, मैं अपनी वर्तमान पकड़ के साथ फिसलन भरी चीजों को नहीं उठा सकता!"
3. नियम पुस्तिका बनाना (ऑपरेटर लर्निंग)
एक बार जब रोबोट इन नए शब्दों (प्रेडिकेट्स) का आविष्कार कर लेता है, तो वह एक तार्किक मानचित्र बनाना शुरू कर देता है।
- नियम: "चाय
डालनेके लिए, आपको चायदानीपकड़नीहोगी और कपखालीहोना चाहिए।" - नियम: "स्टैक (Stack) करने के लिए, प्लेट
समतलहोनी चाहिए।"
रोबोट इन नियमों को एक साथ जोड़कर एक सिंबॉलिक मॉडल (Symbolic Model) बनाता है। यह दुनिया का एक उच्च-स्तरीय मानचित्र है जो अस्त-व्यस्त विवरणों (जैसे हाथ का सटीक कोण) को अनदेखा करता है और तर्क (जैसे "क्या कप खाली है?") पर ध्यान केंद्रित करता है।
4. भव्य योजना (टास्क-लेवल प्लानिंग)
अब, जब आप रोबोट को "चाय बनाना" जैसा जटिल लक्ष्य देते हैं, तो वह घबराता नहीं है। वह एक मानक प्लानिंग एल्गोरिदम का उपयोग करता है (वही प्रकार का तर्क जिसका उपयोग वीडियो गेम AI या लॉजिस्टिक्स सॉफ्टवेयर में किया जाता है) अपनी नई नियम पुस्तिका को देखने के लिए।
- वह लक्ष्य देखता है: "कप में चाय है।"
- वह नियमों की जाँच करता है: "मुझे
डालना(Pour) है।" - वह पूर्व-शर्तों (preconditions) की जाँच करता है: "क्या मेरे पास चायदानी है? क्या कप खाली है?"
- वह चरण-दर-चरण योजना बनाता है: चायदानी उठाना -> कप की ओर बढ़ना -> चाय डालना।
यह पेपर विशेष क्यों है
यह पेपर तीन प्रमुख दावे करता है जो इसे पिछले प्रयासों से अलग बनाते हैं:
- यह शून्य से शुरू होता है: अन्य विधियों के विपरीत जिन्हें उन्हें नियम देने के लिए मनुष्यों की आवश्यकता होती है, SkillWrapper कुछ भी नहीं होने से शुरू होता है। यह केवल रोबोट को चलते हुए देखकर शून्य से अपनी शब्दावली का आविष्कार करता है।
- यह गणितीय रूप से सही होने की गारंटी देता है: लेखकों ने केवल अनुमान नहीं लगाया कि यह काम करेगा। उन्होंने गणित के साथ सिद्ध किया कि यदि रोबोट इस प्रक्रिया का पालन करता है, तो जो नियम वह सीखता है वे Sound (यह असंभव चीजें प्लान नहीं करेगा) और Complete (यदि कोई समाधान मौजूद है तो यह उसे छोड़ेगा नहीं) होंगे। यह एक पुल के सुरक्षित होने को साबित करने जैसा है, इससे पहले कि किसी को उस पर चलने दिया जाए।
- यह वास्तविक दुनिया में काम करता है: उन्होंने इसे वास्तविक रोबोटों पर परखा (केवल सिमुलेशन में नहीं)। रोबोटों ने केवल कैमरा छवियों का उपयोग करके वस्तुओं को रखने या तरल पदार्थ डालने जैसे जटिल कार्यों की योजना बनाना सीखा।
निचोड़
SkillWrapper एक ऐसी प्रणाली है जो रोबोट को उसके अपने कार्यों की "व्याकरण" (grammar) सिखाने देती है। एक इंसान द्वारा मैनुअल लिखने के बजाय, रोबोट चीजें आजमाता है, विफल होता है, एक स्मार्ट AI से पूछता है "वह क्यों विफल हुआ?", समस्या का वर्णन करने के लिए एक नया शब्द गढ़ता है, और फिर अपने अगले कदम की योजना बनाने के लिए उस शब्द का उपयोग करता है। यह रोबोट को बिना किसी मानव विशेषज्ञ द्वारा हर एक नियम को प्रोग्राम किए, वास्तविक दुनिया में लंबे, जटिल कार्यों को हल करने की अनुमति देता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।