← नवीनतम पेपर
🤖 AI

ENPIRE: Agentic Robot Policy Self-Improvement in the Real World

यह शोध पत्र ENPIRE पेश करता है, जो एक ऐसा ढांचा है जो कोडिंग एजेंटों को एनवायरनमेंट रिसेट, पैरेलल रोलआउट और इटरेटिव कोड रिफाइनमेंट के क्लोज्ड-लूप सिस्टम के माध्यम से वास्तविक दुनिया में रोबोटिक मैनिपुलेशन पॉलिसी को स्वायत्त रूप से सुधारने में सक्षम बनाता है, जिससे न्यूनतम मानवीय पर्यवेक्षण के साथ जटिल डेक्सट्रस कार्यों पर उच्च सफलता दर प्राप्त होती है।

मूल लेखक: Wenli Xiao, Jia Xie, Tonghe Zhang, Haotian Lin, Letian "Max" Fu, Haoru Xue, Jalen Lu, Yi Yang, Cunxi Dai, Zi Wang, Jimmy Wu, Guanzhi Wang, S. Shankar Sastry, Ken Goldberg, Linxi "Jim" Fan, Yuke Zhu, G
प्रकाशित 2026-06-19
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Wenli Xiao, Jia Xie, Tonghe Zhang, Haotian Lin, Letian "Max" Fu, Haoru Xue, Jalen Lu, Yi Yang, Cunxi Dai, Zi Wang, Jimmy Wu, Guanzhi Wang, S. Shankar Sastry, Ken Goldberg, Linxi "Jim" Fan, Yuke Zhu, Guanya Shi

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को कोई कठिन कार्य करना सिखाना चाहते हैं, जैसे सुई में धागा पिरोना या कैंची से ज़िप टाई (zip tie) काटना। पारंपरिक रूप से, यह एक मानव शिक्षक की तरह है जो दिनों तक रोबोट के कंधे के ऊपर खड़ा रहता है, लगातार कहता है, "नहीं, फिर से कोशिश करो," "अपना हाथ बाईं ओर ले जाओ," या "अच्छा काम किया, अब इसे और तेज़ी से करने की कोशिश करो।" यह मानवीय पर्यवेक्षण (supervision) धीमा, महंगा और रोबोट के सीखने की गति को सीमित करने वाला है।

ENPIRE पेपर एक अलग तरीका प्रस्तावित करता है: एक मानव शिक्षक के बजाय, हम रोबोट को AI "शोधकर्ताओं" (कोडिंग एजेंटों) की एक टीम देते हैं जो खुद को सिखा सकते हैं, अपनी गलतियों को सुधार सकते हैं और बिना किसी मानवीय मदद के 24/7 प्रयोग चला सकते हैं।

यहाँ बताया गया है कि ENPIRE कैसे काम करता है, जिसे सरल अवधारणाओं में विभाजित किया गया है:

1. समस्या: "मानव बेबीसिटर" की बाधा

वर्तमान में, रोबोट को सिखाने के लिए मनुष्यों को लगातार दृश्य को रीसेट करने (वस्तुओं को उनकी मूल स्थिति में वापस रखने), यह जाँचने कि क्या रोबोट सफल हुआ या नहीं, और कोड में बदलाव करने की आवश्यकता होती है। यह एक ऐसे शेफ की तरह है जिसे हर एक निवाले के बाद बर्तन धोने, सब्जियां काटने और सूप चखने की आवश्यकता होती है। रोबक तेज़ी से नहीं सीख सकता क्योंकि मानव ही यहाँ मुख्य बाधा (bottleneck) है।

2. समाधान: एक सेल्फ-ड्राइविंग रिसर्च लैब

ENPIRE एक ऐसा ढांचा (framework) है जो रोबोट को एक सेल्फ-ड्राइविंग रिसर्च लैब में बदल देता है। यह AI शोधकर्ताओं को चार मुख्य चीजें स्वचालित रूप से करने के लिए उपकरणों का एक सेट देता है:

  • पर्यावरण (द "रीसेट बटन"): AI एक सुरक्षा क्षेत्र बनाने के लिए कोड लिखता है। यदि रोबोट एक पिन गिरा देता है या दीवार से टकरा जाता है, तो सिस्टम स्वचालित रूप से रुक जाता है, वस्तुओं को उनकी शुरुआती स्थिति में रीसेट कर देता है, और अगले प्रयास के लिए तैयार हो जाता है। किसी इंसान को वहां जाकर पिन उठाने की जरूरत नहीं पड़ती।
  • आंखें (द "स्कोरकीपर"): AI यह देखने का एक तरीका बनाता है कि कार्य पूरा हुआ या नहीं। उदाहरण के लिए, यह देखने के लिए कैमरा फीड का उपयोग कर सकता है कि क्या ज़िप टाई वास्तव में कट गई है। यदि नहीं, तो यह रोबोट को "खराब स्कोर" देता है। यदि कट गई है, तो यह "अच्छा स्कोर" देता है।
  • मस्तिष्क (द "पॉलिसी इम्प्रूवर"): यह मुख्य हिस्सा है। AI शोधकर्ता किताबें (वैज्ञानिक साहित्य) पढ़ते हैं, "खराब स्कोर" को देखते हैं, और फिर अपने स्वयं के कोड को फिर से लिखते हैं ताकि एक नई रणनीति आजमाई जा सके। वे कह सकते हैं, "ठीक है, यह काम नहीं किया। चलिए गति बदलकर देखते हैं," या "चलिए एक अलग लर्निंग एल्गोरिदम आज़माते हैं।"
  • बेड़ा (द "टीम एफर्ट"): केवल एक रोबोट द्वारा एक विचार आज़माने के बजाय, ENPIRE एक साथ आठ रोबोट चला सकता है। प्रत्येक रोबोट को एक अलग AI शोधकर्ता सौंपा जाता जिसके पास थोड़ा अलग विचार होता है। वे यह देखने के लिए दौड़ लगाते हैं कि कौन सा विचार सबसे अच्छा काम करता है। यदि एक रोबोट जीतने वाली रणनीति खोज लेता है, तो अन्य भी उसे कॉपी कर लेते हैं।

3. उपमा: "हिल क्लाइंबिंग" (पहाड़ चढ़ने वाली) टीम

रोबोट के सीखने की प्रक्रिया को एक टीम के हाइकर्स (पहाड़ चढ़ने वालों) की तरह समझें जो धुंध भरे पहाड़ (एक "परफेक्ट रोबोट स्किल") के शिखर तक पहुँचने की कोशिश कर रहे हैं।

  • पुराना तरीका: एक हाइकर (रोबोट) एक कदम लेता है, फिर रुक जाता है और एक गाइड (मानव) के कहने का इंतज़ार करता है, "तुम गलत दिशा में जा रहे हो, बाईं ओर जाओ।"
  • ENPIRE का तरीका: आप 8 हाइकर्स की एक टीम भेजते हैं। उन सभी के पास वॉकी-टॉकी हैं।
    • हाइकर A बाईं ओर जाने की कोशिश करता है।
    • हाइकर B दाईं ओर जाने की कोशिश करता है।
    • हाइकर C कूदने की कोशिश करता है।
    • वे सभी रिपोर्ट करते हैं: "मैं एक चट्टान से टकरा गया!" या "मुझे एक रास्ता मिल गया!"
    • टीम तुरंत सबसे अच्छे रास्ते को साझा करती है। यदि हाइकर A को कोई शॉर्टकट मिलता है, तो बाकी सभी तुरंत उस रास्ते पर स्विच कर जाते हैं। वे शिखर तक पहुँचने के लिए नए रास्ते आज़माते रहते हैं।

4. उन्होंने वास्तव में क्या हासिल किया

पेपर ने इन चार कठिन वास्तविक दुनिया के कार्यों पर इस प्रणाली का परीक्षण किया:

  1. Push-T: एक T-आकार के ब्लॉक को एक विशिष्ट स्थान पर धकेलना।
  2. Pin Insertion: एक बहुत छोटे छेद (केवल 4 मिमी चौड़ा) में पिन डालना।
  3. GPU Insertion: एक कंप्यूटर चिप को सॉकेट में सावधानी से रखना।
  4. Zip Tie Cutting: कैंची पकड़ना और एक प्लास्टिक की ज़िप टाई को काटना।

परिणाम:

  • AI शोधकर्ताओं ने इन कार्यों को स्वायत्त रूप से हल करना सीख लिया, जिससे सफलता दर 99% तक पहुँच गई।
  • उन्होंने यह कार्य मानव विशेषज्ञों द्वारा मैन्युअल रूप से किए जाने की तुलना में अधिक तेज़ी से किया।
  • स्केलिंग (Scaling): जब उन्होंने अधिक रोबोटों का उपयोग किया (1 से 8 तक), तो सीखने में लगने वाला समय काफी कम हो गया। उदाहरण के लिए, "पिन इंसर्शन" कार्य एक रोबोट के साथ 1.5 घंटे से घटकर आठ रोबोटों के साथ केवल 40 मिनट रह गया।

5. कमी (सीमाएं)

पेपर इसकी कमियों के बारे में ईमानदार है:

  • संसाधनों की बर्बादी: कभी-कभी रोबोट तब खाली बैठे रहते हैं जब AI "सोच" रहा होता है या कोड लिख रहा होता है।
  • लागत: जैसे-जैसे आप अधिक रोबोट जोड़ते हैं, "लागत" (कंप्यूटर प्रोसेसिंग पावर और डेटा उपयोग के संदर्भ में) गति में होने वाले लाभ की तुलना में तेज़ी से बढ़ती है। यह 8 लोगों को एक काम करने के लिए काम पर रखने जैसा है: वे काम जल्दी खत्म करते हैं, लेकिन आपको 8 गुना वेतन देना पड़ता है, और कभी-कभी वे काम करने के बजाय आपस में बात करने में अधिक समय बिताते हैं।

सारांश

ENPIRE एक ऐसा सिस्टम है जो AI "वैज्ञानिकों" को वास्तविक रोबोट पर अपने स्वयं के प्रयोग चलाने की अनुमति देता है। वे सुरक्षा नियम बनाते हैं, परिणामों को देखते हैं, अपने कोड को ठीक करते हैं, और कठिन भौतिक कार्यों में महारत हासिल करने के लिए एक टीम के रूप में मिलकर काम करते हैं। यह हमें "रोबोटों को मनुष्यों द्वारा देखभाल (babysit) की आवश्यकता है" से हटाकर "रोबोट खुद को सिखा सकते हैं" की ओर ले जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →