← नवीनतम पेपर
🤖 AI

ASPIRE: Agentic /Skills Discovery for Robotics

ASPIRE एक निरंतर सीखने वाली प्रणाली है जो निष्पादन, विफलता निदान और विकासवादी खोज के एक पुनरावृत्ति लूप के माध्यम से स्वायत्त रूप से रोबोट नियंत्रण प्रोग्राम लिखती और परिष्कृत करती है, जिसके परिणामस्वरूप एक पुन: प्रयोज्य कौशल लाइब्रेरी प्राप्त होती है जो बाधित, द्विपक्षीय और दीर्घ-क्षितिज वाले कार्यों में पिछले तरीकों से काफी बेहतर प्रदर्शन करती है और शून्य-शॉट सामान्यीकरण एवं सिम-टू-रियल स्थानांतरण को सक्षम बनाती है।

मूल लेखक: Runyu Lu, Yubo Wu, Ethan Kou, Letian Fu, Wenli Xiao, Ajay Mandlekar, Yinzhen Xu, Guanya Shi, Ken Goldberg, Ang Chen, Mosharaf Chowdhury, Yuke Zhu, Linxi "Jim" Fan, Guanzhi Wang

प्रकाशित 2026-07-02
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Runyu Lu, Yubo Wu, Ethan Kou, Letian Fu, Wenli Xiao, Ajay Mandlekar, Yinzhen Xu, Guanya Shi, Ken Goldberg, Ang Chen, Mosharaf Chowdhury, Yuke Zhu, Linxi "Jim" Fan, Guanzhi Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ ASPIRE पेपर का सरल भाषा और रचनात्मक उपमाओं (analogies) के साथ अनुवाद दिया गया है।

मुख्य विचार: रोबोट को इंसानों की तरह "अपनी गलतियों से सीखना" सिखाना

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान, लेकिन बहुत ही शाब्दिक (literal) रोबोट को रात का खाना बनाना सिखा रहे हैं।

  • पुराना तरीका: आप एक सख्त रेसिपी (कोड) लिखते हैं। यदि रोबोट एक चम्मच गिरा देता है, तो वह रुक जाता है, आपको मैन्युअल रूप से रेसिपी फिर से लिखनी पड़ती है, और फिर से प्रयास करना पड़ता है। यदि चम्मच फिसलन भरा था, तो आपको भविष्य में हर बार चम्मच का उपयोग करने के लिए रेसिपी को फिर से लिखना होगा। काम पूरा होते ही रोबोट सब कुछ भूल जाता है।
  • ASPIRE का तरीका: रोबोट खाना बनाने की कोशिश करता है। जब वह चम्मच गिराता है, तो वह केवल रुकता नहीं है। वह देखता है कि उसने उसे क्यों गिराया (क्या हैंडल फिसलन भरा था? क्या उसने बहुत ज़ोर से पकड़ा था?)। वह तुरंत रेसिपी को ठीक करता है। फिर, वह एक साझा नोटबुक में एक "प्रो टिप" लिखता है: "फिसलन भरे चम्मचों को पकड़ते समय, पकड़ मजबूत रखें और धीरे से ऊपर उठाएं।" अगली बार जब वह खाना बनाता है, या जब कोई दूसरा रोबोट खाना बनाने की कोशिश करता है, तो वह पहले नोटबुक चेक करता है।

ASPIRE (एजेंटिक स्किल प्रोग्रामिंग थ्रू इटरेटिव रोबोट एक्सप्लोरेशन) एक ऐसा सिस्टम है जो रोबोट को अपना खुद का कोड लिखने, अपनी विफलताओं को सुधारने (debug करने) और एक स्थायी "ट्रिक्स की लाइब्रेरी" बनाने की अनुमति देता है जो उन्हें हर दिन स्मार्ट बनाती है।


यह कैसे काम करता है: तीन जादुई उपकरण

पेपर ASPIRE को एक लूप में काम करने वाले तीन कर्मियों की एक टीम के रूप में वर्णित करता है:

1. "सुपर-डीबगर" (रोबोट एक्जीक्यूशन इंजन)

अधिकांश रोबोट आपको केवल इतना बताते हैं: "मैं विफल रहा।" वे आपको यह नहीं बताते कि क्यों
ASPIRE का इंजन एक हाई-टेक सुरक्षा कैमरे की तरह है जो रोबोट द्वारा किए गए हर छोटे कदम को रिकॉर्ड करता है।

  • उपमा: कल्पना कीजिए कि आप एक तंग जगह में कार पार्क करने की कोशिश कर रहे हैं। एक सामान्य रोबोट केवल कहता है, "क्रैश!" ASPIRE का इंजन आपको वीडियो दिखाता है: "आपने पहिया बहुत जल्दी घुमाया, और पिछला बंपर दीवार से टकरा गया।"
  • यह क्या करता है: यह रोबोट को एक "ट्रेस" (एक विस्तृत लॉग) देता है कि ठीक कहाँ पर धारणा (perception) विफल हुई, कहाँ योजना गलत हुई, या कहाँ हाथ फंस गया। यह रोबोट को अनुमान लगाने के बजाय खुद समस्या का निदान करने की अनुमति देता है।

2. "साझा नोटबुक" (स्किल लाइब्रेरी)

अतीत में, यदि किसी रोबोट ने एक विशिष्ट दराज खोलने का तरीका सीखा, तो वह ज्ञान कार्य समाप्त होने के साथ ही खत्म हो जाता था।
ASPIRE "कौशलों" (Skills) की एक बढ़ती हुई लाइब्रेरी रखता है।

  • उपमा: इसे "लाइफ हैक्स" की एक कुकबुक के रूप में सोचें।
    • प्रविष्टि 1: "यदि रोबलेट किसी मेज के कारण वस्तु तक नहीं पहुँच पा रहा है, तो सीधे जाने के बजाय बगल से जाने का प्रयास करें।"
    • प्रविष्टि 2: "यदि रोबोट दो कटोरे देखता है, तो पहले बाईं ओर वाले को देखें।"
  • यह क्या करता है: जब रोबोट एक बग को ठीक करता है, तो वह केवल सुधार को ही नहीं बचाता; वह उस पैटर्न को भी बचाता है। यदि वह बाद में समान समस्या का सामना करता है (भले ही वह किसी अलग रोबोट या अलग वस्तु के साथ हो), तो वह तुरंत नोटबुक से "लाइफ हैक" निकाल लेता है और उसका उपयोग करता है। इसी तरह वह समय के साथ तेज़ और बेहतर होता जाता है।

3. "ब्रेनस्टॉर्मिंग सत्र" (इवोल्यूशनरी सर्च)

कभी-कभी, एक रोबोट एक लूप में फंस जाता है, बार-बार एक ही खराब विचार को आज़माता रहता है।
ASPIRE "इवोल्यूशनरी सर्च" नामक विधि का उपयोग करता है।

  • उपमा: कल्पना कीजिए कि आप एक लीक होते पाइप को ठीक करने की कोशिश कर रहे हैं। केवल एक बार बोल्ट को कसने के बजाय, आप एक ही समय में 10 अलग-अलग रिंच, 5 अलग-अलग कोण और 3 अलग-अलग प्रकार की टेप का परीक्षण करते हैं। आप देखते हैं कि कौन सा सबसे अच्छा काम करता है, उसे रखते हैं, और फिर उसी को बेहतर बनाने का प्रयास करते हैं।
  • यह क्या करता है: सिस्टम एक साथ रोबोट के कोड के कई संस्करण बनाता है। यह उन सभी का परीक्षण करता है, विजेताओं को रखता है, और हारने वालों को हटा देता है। यह रोबोट को "लोकल लूप्स" से बाहर निकलने और ऐसे रचनात्मक समाधान खोजने में मदद करता है जो शायद एक इंसान न सोच पाए।

उन्होंने वास्तव में क्या हासिल किया (परिणाम)

पेपर ने इस सिस्टम का परीक्षण तीन प्रकार की चुनौतियों पर किया, और परिणाम प्रभावशाली थे:

  1. "मेसी किचन" टेस्ट (LIBERO-Pro):

    • परिदृश्य: रोबोट को वस्तुओं को हिलाना था, लेकिन वस्तुओं को यादृच्छिक (random) स्थानों पर रखा गया था, या निर्देशों को थोड़ा बदल दिया गया था (जैसे, "लाल कप उठाएं" बनाम "नीला कप उठाएं")।
    • परिणाम: ASPIRE पिछले तरीकों की तुलना में 77% अधिक बार सफल रहा। उसने केवल स्थान को याद नहीं किया; उसने वस्तुओं को खोजने और पकड़ने का कौशल सीखा, चाहे वे कहीं भी हों।
  2. "दो-हाथों का हैंडऑफ" (Robosuite):

    • परिदृश्य: दो हाथों वाले रोबोट को एक हाथ से दूसरे हाथ में वस्तु देनी थी। यह बहुत कठिन है क्योंकि इसमें टाइमिंग और भौतिकी (physics) पेचीदा होती है।
    • परिणाम: पिछले तरीके केवल 20% बार सफल हुए। ASPIRE 92% तक पहुँच गया। उसने वस्तु को पास करने के "डांस" को प्रयास और त्रुटि (trial and error) के माध्यम से सीखा।
  3. "घर पर लंबा दिन" (BEHAVIOR-1K):

    • परिदृश्य: रोबोट को कार्यों की एक लंबी श्रृंखला करनी थी, जैसे "किचन में जाओ, सोडा ढूंढो, फ्रिज खोलो, उसे अंदर रखो।"
    • परिणाम: ASPIRE अगले सबसे अच्छे तरीके से 32% बेहतर था। क्योंकि उसके पास कौशलों की एक लाइब्रेरी थी, उसे हर बार फ्रिज खोलने का तरीका फिर से सीखने की आवश्यकता नहीं थी; वह बस "फ्रिज खोलें" कौशल को देख लेता था।

"जादुई ट्रांसफर": सिमुलेशन से वास्तविक जीवन तक

इस पेपर का सबसे शानदार हिस्सा सिम-टू-रियल ट्रांसफर (Sim-to-Real Transfer) है।

  • सेटअप: रोबोट ने अपने सभी कौशल एक वीडियो गेम (सिमुलेशन) में सीखे। फिर, उन्होंने इसे एक वास्तविक भौतिक रोबोट पर लगाया जो दिखने में अलग था और जिसके सेंसर भी अलग थे।
  • परिणाम: भले ही वास्तविक रोबोट अलग था, सिमुलेशन से मिले "लाइफ हैक्स" अभी भी काम कर रहे थे।
    • उदाहरण: रोबोट ने गेम में सीखा कि "यदि आप दराज को सीधा धक्का देने की कोशिश करते हैं, तो वह फंस जाती है।" उसने इसी तर्क को वास्तविक दराज पर लागू किया।
    • प्रभाव: इसने कुछ कार्यों के लिए वास्तविक रोबोट को आवश्यक "सोचने" (कंप्यूटर प्रोसेसिंग) को लगभग 10 गुना कम कर दिया। इसने साबित किया कि आभासी दुनिया में सीखे गए कौशल वास्तविक दुनिया में वास्तविक रोबोट की मदद कर सकते हैं।

सारांश

ASPIRE एक ऐसा सिस्टम है जो रोबोट को "बेवकूफ दोहराने वाले" (dumb repeaters) बनने से रोकता है और उन्हें "निरंतर सीखने वाले" (continuous learners) में बदल देता है।

  • यह उन्हें यह देखने के लिए आंखें देता है कि वे क्यों विफल हुए (एक्जीक्यूशन इंजन)।
  • यह उन्हें बाद के लिए अपने सुधारों को सहेजने के लिए एक स्मृति देता है (स्किल लाइब्रेरी)।
  • यह उन्हें एक साथ कई समाधानों को आज़माने के लिए एक दिमाग देता है (इवोल्यूशनरी सर्च)।

पेपर का दावा है कि ऐसा करके, रोबोट जटिल और अव्यवस्थित कार्यों को पहले की तुलना में बहुत तेज़ी से हल कर सकते हैं, और जो ज्ञान वे एक स्थिति में प्राप्त करते हैं वह उन्हें पूरी तरह से नई स्थितियों में सफल होने में मदद करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →