← नवीनतम पेपर
💻 computer science

SkillWrapper: Generative Predicate Invention for Task-level Robot Planning

यह शोध पत्र SkillWrapper को प्रस्तुत करता है, जो फाउंडेशन मॉडल्स का लाभ उठाकर कच्चे RGB अवलोकनों से औपचारिक, प्रमाणित रूप से सुदृढ़ और पूर्ण प्रतीकात्मक विधेयकों (predicates) को स्वचालित रूप से आविष्कार करने की एक विधि है, जिससे रोबोटों को अनदेखे दीर्घ-क्षितिज वाले कार्यों (long-horizon tasks) को हल करने के लिए ब्लैक-बॉक्स कौशलों को अमूर्त निरूपणों में सामान्यीकृत करने में सक्षम बनाया जा सके।

मूल लेखक: Ziyi Yang, Benned Hedegaard, Ahmed Jaafar, Yichen Wei, Skye Thompson, Shreyas S. Raman, Haotian Fu, Stefanie Tellex, George Konidaris, David Paulius, Naman Shah

प्रकाशित 2026-06-09
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ziyi Yang, Benned Hedegaard, Ahmed Jaafar, Yichen Wei, Skye Thompson, Shreyas S. Raman, Haotian Fu, Stefanie Tellex, George Konidaris, David Paulius, Naman Shah

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक ऐसा रोबोट है जो शारीरिक स्तर पर अविश्वसनीय रूप से शक्तिशाली और कुशल है। वह एक चायदानी उठा सकता है, चाय डाल सकता है, और एक प्लेट पर कटोरा रख सकता है। हालाँकि, अभी, यह रोबोट एक ऐसे प्रतिभाशाली पियानो वादक की तरह है जो केवल व्यक्तिगत कुंजियों (keys) को दबाना जानता है। वह एक एकल स्वर (note) तो बजा सकता है, लेकिन उसे संगीत सिद्धांत (music theory) की समझ नहीं है। वह एक गीत रचना या पूरा कॉन्सर्ट प्लान करना नहीं जानता।

यही वह समस्या है जिसे SkillWrapper हल करता है।

समस्या: "ब्लैक बॉक्स" रोबोट

वर्तमान में, कई रोबोटों के पास "ब्लैक बॉक्स" कौशल होते हैं। ये पूर्व-निर्धारित क्रियाएं (जैसे "वस्तु उठाना" या "तरल डालना") हैं जो अपने आप में अच्छी तरह से काम करती हैं। लेकिन यदि आप चाहते हैं कि रोबोट एक जटिल, बहु-चरणीय कार्य करे—जैसे "चाय बनाना"—तो उसे इन कौशलों को एक साथ जोड़ने का तरीका नहीं पता होता।

एक रोबोट को जटिल कार्य की योजना बनाने के लिए, मनुष्यों को आमतौर पर उसके लिए एक नियम पुस्तिका (rulebook) मैन्युअल रूप से लिखनी पड़ती है। उन्हें समझाना पड़ता है: "चाय डालने के लिए, रोबोट को पहले चायदानी पकड़े होनी चाहिए, और कप खाली होना चाहिए।" यह थकाऊ, धीमा और हर नए रोबोट या वातावरण के लिए असंभव है।

समाधान: रोबोट को अपनी खुद की नियम पुस्तिका लिखना सिखाना

शोधकर्ताओं ने SkillWrapper नामक एक प्रणाली बनाई है। इंसान द्वारा नियम पुस्तिका लिखने के बजाय, SkillWrapper रोबोट को खुद को चीजें आजमाते हुए देखकर अपना स्वयं का "शब्दावली" (vocabulary) और "नियम" आविष्कार करने के लिए प्रशिक्षित करता है।

यह कैसे काम करता है, यहाँ एक सरल उपमा (analogy) दी गई है:

1. "परीक्षण और त्रुटि" चरण (सक्रिय डेटा संग्रह)

कल्पना कीजिए कि एक रसोई में एक रोबोट है। उसे अभी नियम नहीं पता। SkillWrapper रोबोट को कहता है: "जाओ चायदानी उठाने की कोशिश करो। अब स्पंज उठाने की कोशिश करो। अब कटोरा रखने की कोशिश करो।"

  • सफलता: रोबोट चायदानी उठा लेता है।
  • विफलता: रोबोट स्पंज उठाने की कोशिश करता है, लेकिन वह बहुत फिसलन भरा है, और वह उसे गिरा देता है।

रोबोट इन क्षणों को रिकॉर्ड करता है: "मैंने चायदानी उठाने की कोशिश की, और यह सफल रहा। मैंने स्पंज उठाने की कोशिश की, और यह विफल रहा।"

2. "अहा!" क्षण (जेनेरेटिव प्रेडिकेट इन्वेंशन)

यही जादुई हिस्सा है। रोबोट अपनी सफलताओं और विफलताओं को देखता है और पूछता है: "एक काम क्यों किया और दूसरा क्यों विफल हुआ?"

अतीत में, कंप्यूटरों को उत्तर देने के लिए मनुष्यों की आवश्यकता होती थी (जैसे, "स्पंज बहुत फिसलन भरा है")। लेकिन SkillWrapper एक फाउंडेशन मॉडल (एक सुपर-स्मार्ट AI जो छवियों और भाषा को समझता है, जैसे कि ChatGPT या DALL-E का एक बहुत उन्नत संस्करण) का उपयोग करता है।

  • रोबोट AI को दो तस्वीरें दिखाता है: एक सफल पिकअप की और एक विफल पिकअप की।
  • AI छवियों को देखता है और अंतर को समझाने के लिए एक नया शब्द (एक प्रेडिकेट) गढ़ता है।
  • AI कहता है: "आह! अंतर यह है कि चायदानी में हैंडल है, लेकिन स्पंज फिसलन भरा है। चलिए एक नया नियम बनाते हैं जिसे GripperEmpty या ObjectIsStable कहा जाए।"

रोबोट एक नया, मानव-पठनीय विचार (concept) बनाता है जो बताता है कि वह क्रिया क्यों सफल या विफल हुई। यह ऐसा है जैसे रोबोट अचानक "फिसलन भरा" शब्द सीख गया हो और यह महसूस कर गया हो, "ओह, मैं अपनी वर्तमान पकड़ के साथ फिसलन भरी चीजों को नहीं उठा सकता!"

3. नियम पुस्तिका बनाना (ऑपरेटर लर्निंग)

एक बार जब रोबोट इन नए शब्दों (प्रेडिकेट्स) का आविष्कार कर लेता है, तो वह एक तार्किक मानचित्र बनाना शुरू कर देता है।

  • नियम: "चाय डालने के लिए, आपको चायदानी पकड़नी होगी और कप खाली होना चाहिए।"
  • नियम: "स्टैक (Stack) करने के लिए, प्लेट समतल होनी चाहिए।"

रोबोट इन नियमों को एक साथ जोड़कर एक सिंबॉलिक मॉडल (Symbolic Model) बनाता है। यह दुनिया का एक उच्च-स्तरीय मानचित्र है जो अस्त-व्यस्त विवरणों (जैसे हाथ का सटीक कोण) को अनदेखा करता है और तर्क (जैसे "क्या कप खाली है?") पर ध्यान केंद्रित करता है।

4. भव्य योजना (टास्क-लेवल प्लानिंग)

अब, जब आप रोबोट को "चाय बनाना" जैसा जटिल लक्ष्य देते हैं, तो वह घबराता नहीं है। वह एक मानक प्लानिंग एल्गोरिदम का उपयोग करता है (वही प्रकार का तर्क जिसका उपयोग वीडियो गेम AI या लॉजिस्टिक्स सॉफ्टवेयर में किया जाता है) अपनी नई नियम पुस्तिका को देखने के लिए।

  • वह लक्ष्य देखता है: "कप में चाय है।"
  • वह नियमों की जाँच करता है: "मुझे डालना (Pour) है।"
  • वह पूर्व-शर्तों (preconditions) की जाँच करता है: "क्या मेरे पास चायदानी है? क्या कप खाली है?"
  • वह चरण-दर-चरण योजना बनाता है: चायदानी उठाना -> कप की ओर बढ़ना -> चाय डालना।

यह पेपर विशेष क्यों है

यह पेपर तीन प्रमुख दावे करता है जो इसे पिछले प्रयासों से अलग बनाते हैं:

  1. यह शून्य से शुरू होता है: अन्य विधियों के विपरीत जिन्हें उन्हें नियम देने के लिए मनुष्यों की आवश्यकता होती है, SkillWrapper कुछ भी नहीं होने से शुरू होता है। यह केवल रोबोट को चलते हुए देखकर शून्य से अपनी शब्दावली का आविष्कार करता है।
  2. यह गणितीय रूप से सही होने की गारंटी देता है: लेखकों ने केवल अनुमान नहीं लगाया कि यह काम करेगा। उन्होंने गणित के साथ सिद्ध किया कि यदि रोबोट इस प्रक्रिया का पालन करता है, तो जो नियम वह सीखता है वे Sound (यह असंभव चीजें प्लान नहीं करेगा) और Complete (यदि कोई समाधान मौजूद है तो यह उसे छोड़ेगा नहीं) होंगे। यह एक पुल के सुरक्षित होने को साबित करने जैसा है, इससे पहले कि किसी को उस पर चलने दिया जाए।
  3. यह वास्तविक दुनिया में काम करता है: उन्होंने इसे वास्तविक रोबोटों पर परखा (केवल सिमुलेशन में नहीं)। रोबोटों ने केवल कैमरा छवियों का उपयोग करके वस्तुओं को रखने या तरल पदार्थ डालने जैसे जटिल कार्यों की योजना बनाना सीखा।

निचोड़

SkillWrapper एक ऐसी प्रणाली है जो रोबोट को उसके अपने कार्यों की "व्याकरण" (grammar) सिखाने देती है। एक इंसान द्वारा मैनुअल लिखने के बजाय, रोबोट चीजें आजमाता है, विफल होता है, एक स्मार्ट AI से पूछता है "वह क्यों विफल हुआ?", समस्या का वर्णन करने के लिए एक नया शब्द गढ़ता है, और फिर अपने अगले कदम की योजना बनाने के लिए उस शब्द का उपयोग करता है। यह रोबोट को बिना किसी मानव विशेषज्ञ द्वारा हर एक नियम को प्रोग्राम किए, वास्तविक दुनिया में लंबे, जटिल कार्यों को हल करने की अनुमति देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →