← नवीनतम पेपर
💻 computer science

Learning Robust Execution in Robotic Manipulation with Agentic Reinforcement Learning

यह शोध पत्र एक एजेंटिक सुदृढीकरण लर्निंग (reinforcement learning) ढांचे का प्रस्ताव करता है जो रनटाइम निष्पादन गुणवत्ता मेट्रिक्स और एक उच्च-स्तरीय निर्णय लेने वाली नीति को पेश करके रोबोटिक मैनिपुलेशन की मजबूती को बढ़ाता है, जो गिरावट का पता लगाती है और सामान्य कार्य अवस्थाओं को बहाल करने के लिए रिकवरी तंत्र को सक्रिय करती है, जिससे LIBERO बेंचमार्क पर सफलता दर में महत्वपूर्ण सुधार होता है।

मूल लेखक: Xiaopeng Zhang, Yueyang Weng, Qi Liu, Yongjin Mu, Yanjie Li

प्रकाशित 2026-07-16
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xiaopeng Zhang, Yueyang Weng, Qi Liu, Yongjin Mu, Yanjie Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक जटिल लेगो (Lego) किला बनाना सिखा रहे हैं। आप उसे निर्देशों का एक सेट देते हैं, और वह ईंटें लगाना शुरू कर देता है। लेकिन रोबोट अनाड़ी होते हैं; कभी-कभी वे एक मिलीमीटर की चूक कर जाते हैं, या मेज हिल जाती है, या उनकी "पकड़" थोड़ी सी फिसल जाती है। रोबोटिक्स की दुनिया में, इसे अनिश्चितता (uncertainty) कहा जाता है। जब एक रोबोट शुरुआत में छोटी सी गलती करता है, तो वह गलती गायब नहीं होती; बल्कि जैसे-जैसे कार्य आगे बढ़ता है, यह और भी खराब होती जाती है, जैसे पहाड़ से लुढ़कती हुई बर्फ का गोला। इसे संचयी त्रुटि (compounding error) के रूप में जाना जाता है। अंततः, रोबोट शायद गलत जगह पर ईंट पकड़े हुए होगा, या उसने कोई टुकड़ा पूरी तरह से गिरा दिया होगा, लेकिन वह फिर भी अपने मूल योजना का पालन करने की कोशिश करता रहता है, जिससे सब कुछ गड़बड़ हो जाता है।

लंबे समय तक, वैज्ञानिकों ने इसे इस तरह ठीक करने की कोशिश की कि रोबोट को होने वाली हर संभावित गलती के अधिक उदाहरण सिखाए जाएं। लेकिन यह ऐसा ही है जैसे लेगो टावर गिरने के हर एक तरीके को याद करने की कोशिश करना, इससे पहले कि आप वास्तव में निर्माण शुरू भी करें—इसमें बहुत समय लगता है और बहुत खर्च आता है। एक अन्य विचार यह था कि रोबोट को एक बहुत ही स्मार्ट "दिमाग" (जैसे कि एक लैंग्वेज मॉडल) दिया जाए जो लगातार उसके काम की जांच करे और उसे अगला कदम बताए। लेकिन यह रोबोट को धीमा और जटिल बना देता है, जैसे कि हर ईंट रखने पर एक शिक्षक निर्देशों की चिल्लाहट कर रहा हो। बड़ा सवाल यह है: क्या हम एक ऐसा रोबोट बना सकते हैं जो यह पहचान सके कि वह पटरी से उतर रहा है और खुद को कैसे ठीक करना है, बिना किसी सुपरकंप्यूटर या आपदाओं की लाइब्रेरी की आवश्यकता के?

यह शोध पत्र रोबोट की गलतियों को संभालने का एक चतुर नया तरीका पेश करता है, जिसे एजेंटिक रीइन्फोर्समेंट लर्निंग (Agentic Reinforcement Learning) कहा जाता है। रोबोट को उसके हाथ चलाने के तरीके (जो कठिन हिस्सा है) को पूरी तरह से सिखाने के बजाय, लेखकों ने एक "प्रबंधक" (manager) बनाया है जो रोबोट के प्रदर्शन पर नज़र रखता है और तय करता है कि कब आगे बढ़ना है, कब पीछे हटना है, या कब फिर से शुरू करना है। सोचिए कि रोबोट का हाथ एक कुशल लेकिन थोड़े अनाड़ी कार्यकर्ता की तरह है, और यह नया "प्रबंधक" एक फोरमैन की तरह है जो काम तो नहीं कर रहा है, लेकिन पूरे निर्माण स्थल की निगरानी कर रहा है।

शोधकर्ताओं ने पाया कि जब रोबमाट लड़खड़ाने लगता है, तो यह प्रबंधक आपदा बनने से पहले ही परेशानी को पहचान सकता है। उन्होंने यह मापने के लिए दो "स्कोरकार्ड" बनाए कि रोबोट कितना अच्छा प्रदर्शन कर रहा है: एक यह जांचता है कि क्या रोबोट अभी सुचारू रूप से चल रहा है (स्थानीय गुणवत्ता/local quality), और दूसरा यह जांचता है कि क्या वह एक आदर्श उदाहरण की तुलना में अभी भी सही रास्ते पर है (वैश्विक गुणवत्ता/global quality)। यदि स्कोर गिरता है, तो प्रबंधक हाथ चलाने का कोई नया तरीका आविष्कार करने की कोशिश नहीं करता है। इसके बजाय, वह रिकवरी (सुधार) के कदमों की एक छोटी, पूर्व-निर्धारित सूची में से चुनता है:

  • RETRY (पुनः प्रयास): यदि रोबोट ने पकड़ बनाने में चूक की है, तो प्रबंधक उसे कुछ कदम पीछे जाने और फिर से प्रयास करने के लिए कहता है।
  • REPAIR (मरम्मत): यदि रोबोट कहीं फंस गया है या किसी अजीब तरह से चीज़ पकड़ी हुई है, तो प्रबंधक उसे चीज़ छोड़ने, एक सुरक्षित स्थान पर जाने और अपनी पकड़ को रीसेट करने के लिए कहता है।
  • RESET (रीसेट): यदि रोबोट ने सब कुछ गिरा दिया है या किसी निराशाजनक स्थिति में है, तो वह "रीस्टार्ट" बटन दबाता है और कार्य को बिल्कुल शुरुआत से शुरू करता है।

टीम ने इस प्रणाली का परीक्षण LIBERO नामक रोबोट चुनौतियों के एक प्रसिद्ध सेट पर किया, जिसमें कटोरे उठाना, दराज खोलना और वस्तुओं को एक के ऊपर एक रखना जैसे कार्य शामिल हैं। उन्होंने पाया कि इस "प्रबंधक" को जोड़ने से रोबोट काम पूरा करने में बहुत बेहतर हो गए, भले ही चीजें गलत हो रही हों। मानक परीक्षणों में, सफलता दर में 13.7% तक की वृद्धि हुई। लेकिन असली जादू तब हुआ जब उन्होंने इसमें यादृच्छिक बाधाएं (random disturbances) डालीं, जैसे कि रोबोट को हिलाना या उसकी गतिविधियों में गड़बड़ी करना। ऐसी अराजक स्थितियों में, सफलता दर 39.2% तक बढ़ गई।

यह शोध पत्र तर्क देता है कि केवल रोबोट को अधिक डेटा पर प्रशिक्षित करना हमेशा सबसे अच्छा उत्तर नहीं होता है, और भारी, धीमे तर्क प्रणालियों को जोड़ना भी कुशल नहीं है। इसके बजाय, यह "एजेंटिक" दृष्टिकोण रिकवरी के निर्णय को क्रिया (action) के करने से अलग करता है। रोबोट को नए कौशल सीखने की आवश्यकता नहीं है; उसे बस एक स्मार्ट पर्यवेक्षक की आवश्यकता है जो यह जान सके कि कब कहना है, "रुको, यह काम नहीं किया, चलो इसे फिर से करते हैं," या "ठीक है, हम फंस गए हैं, चलो फिर से शुरू करते हैं।" परिणाम दिखाते हैं कि यह विधि विभिन्न प्रकार के रोबोटिक दिमागों (सरल से लेकर जटिल तक) के साथ अच्छी तरह काम करती है, जिससे रोबोट को शून्य से फिर से प्रशिक्षित किए बिना अधिक विश्वसनीय और मजबूत बनाया जा सकता है। हालांकि यह प्रणाली हर असंभव स्थिति को ठीक नहीं कर सकती, लेकिन यह साबित करती है कि थोड़ी सी स्मार्ट निगरानी रोबोट को उसके पैरों पर टिकाए रखने में बहुत काम आ सकती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →