← नवीनतम पेपर
🤖 machine learning

Learning Reach-Avoid Task with Reinforcement Learning: Vectorized Simulation and Benchmark

यह शोध पत्र रोबोटिक आर्म रीच-अवॉयड कार्यों के लिए पहला व्यापक, ओपन-सोर्स बेंचमार्क पेश करता है जो वेक्टरकृत मुजोको (MuJoCo) सिमुलेशन का उपयोग करता है ताकि यह प्रदर्शित किया जा सके कि जबकि डीप रिइन्फोर्समेंट लर्निंग एजेंट सरलीकृत सेटिंग्स में उच्च सफलता दर प्राप्त करते हैं, उनका प्रदर्शन वास्तविक, जटिल परिदृश्यों में काफी गिर जाता है, जो यह संकेत देता है कि इन कार्यों को मजबूती से हल करने के लिए आगे के शोध की आवश्यकता है।

मूल लेखक: Jonas Weihing, Shahram Eivazi

प्रकाशित 2026-07-20
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jonas Weihing, Shahram Eivazi

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोटिक आर्म को "गधे की पूंछ लगाना" (Pin the Tail on the Donkey) नामक खेल खेलना सिखा रहे हैं, लेकिन गधा हिल रहा है, कमरा फर्नीचर से भरा हुआ है, और रोबोट को अपने स्वयं के कोहनियों से टकराए बिना या फूलदान को गिराए बिना यह करना है। यह डीप रिइन्फोर्समेंट लर्निंग (DRL) के लिए रोबोटिक्स की दुनिया है। DRL को एक सुपर-पावर्ड वीडियो गेम कोच के रूप में सोचें। हर संभव चाल के लिए एक सख्त नियम पुस्तिका लिखने के बजाय, आप रोबोट को एक कंप्यूटर सिमुलेशन में लाखों चालें आज़माने देते हैं। हर बार जब वह टकरा जाता है, तो उसे "गेम ओवर" मिलता है और वह सीखता है कि क्या नहीं करना है। हर बार जब वह सफल होता है, तो उसे एक हाई-फाइव (पुरस्कार) मिलता है। समय के साथ, रोबोट सुरक्षित रूप से लक्ष्य तक पहुँचने के लिए गतिविधियों का एक जटिल नृत्य सीख जाता है।

बड़ा सवाल जो वैज्ञानिकों ने पूछा है वह यह है: क्या यह रोबोट एक छोटे, खाली अभ्यास कक्ष में पूरी तरह से नृत्य करना सीख सकता है, और फिर तुरंत उसी नृत्य को एक बिखरे हुए, भीड़भाड़ वाले लिविंग रूम में कर सकता है? वर्षों तक, शोधकर्ताओं ने सरल, सपाट "टेबलटॉप" दुनिया में रोबोटों का परीक्षण किया जहाँ बाधाएं दुर्लभ थीं और रोबोट की गतिविधियाँ सीमित थीं। लेकिन वास्तविक जीवन अव्यवस्थित है, इसमें खुद से टकराना (जैसे रोबोट की कोहनी का अपने ही कंधे से टकराना) और अप्रत्याशित बाधाएं शामिल हैं। यदि एक रोबोट केवल एक अभ्यास कक्ष में नृत्य कर सकता है, तो वह वास्तविक दुनिया के लिए तैयार नहीं है। यह पेपर पूछता है: क्या हम अंततः एक ऐसा रोबोट बना सकते हैं जो अपने वास्तविक कार्यक्षेत्र की पूरी, जटिल वास्तविकता में नेविगेट करना सीख सके, या हमें अभी भी एक लंबा रास्ता तय करना बाकी है?

इस पेपर का बड़ा प्रयोग: जंगल में एक रोबोट

इस अध्ययन में, शोधकर्ताओं ने ठीक यही परीक्षण करने के लिए एक विशाल, हाई-स्पीड डिजिटल प्लेग्राउंड बनाया। उन्होंने केवल एक छोटे टेबल का सिमुलेशन नहीं किया; उन्होंने दो वास्तविक दुनिया के रोबटों: UR5e और Franka Emika Robot के पूरे सुलभ स्थान (reachable space) का सिमुलेशन किया। उन्होंने एक सुपर-फास्ट फिजिक्स इंजन (MuJoCo MJX) का उपयोग किया जो एक सिंगल ग्राफिक्स कार्ड पर चल रहा था, जिससे वे एक ही समय में हजारों रोबोट सिमुलेशन चला सके। यह एक हजार रोबोटों के एक ही समय में डिजिटल जिम में अपनी चालों का अभ्यास करने जैसा है, जो पलक झपकते ही अपनी गलतियों से सीख रहे हैं।

उन्होंने दो मुख्य चुनौतियाँ सेट कीं:

  1. रीच टास्क (Reach Task): रोबोट को खुद से टकराए बिना एक विशिष्ट हरे लक्ष्य की ओर अपने हाथ को ले जाना होगा।
  2. रीच-अवॉइड टास्क (Reach-Avoid Task): रोबोट को उसी हरे लक्ष्य तक पहुँचना है, लेकिन इस बार एक विशाल लाल बाधा (एक गोला) रास्ते में तैर रही है, और रोबोट को बिना टकराए उससे बचना होगा।

उन्होंने क्या पाया: "प्रैक्टिस रूम" का जाल

परिणाम "शानदार प्रगति" और "रुको ज़रा" का मिश्रण थे।

अच्छी खबर: रोबोट सीख सकते हैं। जब शोधकर्ताओं ने सर्वोत्तम सेटिंग्स का उपयोग किया, तो रोबोट अपने काम में आश्चर्यजनक रूप से कुशल हो गए।

  • सरल रीच टास्क के लिए, फ्रैंका रोबोट 98.8% बार सफल हुआ, और UR5e 96.1% बार सफल हुआ।
  • कठिन रीच-अवॉइड टास्क (बाधा के साथ) के लिए, फ्रैंका अभी भी 95.2% सफलता हासिल करने में सक्षम था, और UR5e ने 86.8% सफलता प्राप्त की।

ये संख्याएँ प्रभावशाली हैं, लेकिन यह पेपर एक महत्वपूर्ण बात उजागर करता है: रोबोट कहाँ सीखता है, यह इस बात से अधिक महत्वपूर्ण है कि लर्निंग एल्गोरिदम कितना स्मार्ट है।

बुरी खबर (द कोलैप्स/पतन):
शोधकर्ताओं ने उन रोबोटों का परीक्षण किया जिन्हें छोटे, आसान वातावरण (जैसे पिछले अध्ययनों में उपयोग किए जाने वाले छोटे "PandaGym" अभ्यास कक्षों) में प्रशिक्षित किया गया था और फिर उन्हें बड़े, अस्त-व्यस्त पूर्ण-आकार के वर्कस्पेस में छोड़ दिया गया। परिणाम? पूर्ण विफलता।

  • एक छोटा अभ्यास कक्ष में प्रशिक्षित रोबोट और फिर पूर्ण वर्कस्पेस में परीक्षण किए जाने पर केवल 4% बार सफल हुआ।
  • यहाँ तक कि एक मध्यम आकार के कमरे में प्रशिक्षित रोबोट भी पूर्ण वर्कस्पेस में जाने पर 64.5% सफलता तक गिर गया।

यह वैसा ही है जैसे आपने किसी छात्र को खाली पार्किंग लॉट में गाड़ी चलाना सिखाया, और फिर उसे व्यस्त समय के दौरान अराजक शहर में कार की चाबियाँ थमा दीं। वे जम गए। यह पेपर दिखाता है कि पिछला शोध, जिसने दावा किया था कि रोबों ने इन कार्यों को "हल" कर लिया है, शायद केवल आसान, सरलीकृत संस्करण को हल कर रहा था। जब आप सरलीकरण को हटा देते हैं, तो रोबोट का प्रदर्शन अक्सर ध्वस्त (collapse) हो जाता है।

गुप्त नुस्खा: रोबोट को कैसे सिखाएं

इस पेपर ने केवल समस्याएँ ही नहीं ढूँढीं; इसने यह भी पता लगाया कि उन्हें कैसे ठीक किया जाए, और इन रोबोटों को वास्तविक दुनिया में प्रशिक्षित करने के लिए एक "चीट शीट" प्रदान की:

  • छोटी शुरुआत न करें: आप एक छोटे बॉक्स में रोबोट को प्रशिक्षित नहीं कर सकते और उम्मीद नहीं कर सकते कि वह एक बड़े कमरे में काम करेगा। रोबोट को पहले दिन से ही पूरे वर्कस्पेस में प्रशिक्षित किया जाना चाहिए। यदि आप इसे पूर्ण स्थान में प्रशिक्षित करते हैं, तो यह छोटे स्थानों को आसानी से संभाल सकता है। लेकिन इसका उल्टा सच नहीं है।
  • "डेंस" रिवॉर्ड (Dense Reward): अतीत में, वैज्ञानिकों ने सोचा था कि रोबोट को तभी इनाम देना जब वह कार्य पूरा कर ले (एक "स्पार्स" रिवॉर्ड) सबसे अच्छा है। इस पेपर ने पाया कि बड़े, जटिल कमरों के लिए, वह तरीका विफल हो जाता है क्योंकि रोबोट को सीखने के लिए कभी कोई पुरस्कार नहीं मिलता। इसके बजाय, रोबोट को "डेंस" रिवॉर्ड देना—हर बार जब वह लक्ष्य के करीब पहुँचता है तो थोड़ा सा प्रशंसा मिलना—उसे बहुत तेज़ी से और अधिक सटीक रूप से सीखने में मदद करता है।
  • सापेक्ष बनाम पूर्ण चालें (Relative vs. Absolute Moves): पेपर ने रोबोट को क्या करना है यह बताने के दो तरीकों का परीक्षण किया। रोबोट को यह बताना कि "अपने जोड़ों को ठीक 45 डिग्री पर ले जाएँ" (Absolute) उसे अस्थिर बना देता है और खुद से टकराने के प्रति संवेदनशील बनाता है। उसे यह बताना कि "अपने जोड़ों को अभी जहाँ वे हैं, उनसे थोड़ा सा आगे ले जाएँ" (Relative) ने रोबोट को बहुत सहज, अधिक सटीक और अपने शरीर से टकराने की संभावना कम कर दिया।
  • बाधा को देखना: "रीच-अवॉइड" टास्क के लिए, रोबोट को यह जानने की आवश्यकता थी कि उसके शरीर के हिस्से बाधा से कितनी दूर हैं। जब शोधकर्ताओं ने रोबोट को यह विशिष्ट दूरी की जानकारी दी, तो बाधाओं से टकराने की संख्या लगभग आधी हो गई।

फैसला: अभी हल नहीं हुआ है

लेखक जीत की घोषणा करने में सावधानी बरतते हैं। उन्होंने अपने सिमुलेशन में स्टेट-ऑफ-द-आर्ट परिणाम हासिल किए, जहाँ रीचिंग के लिए सफलता दर लगभग 96% और अवॉयडिंग के लिए 87-95% के आसपास रही। हालाँकि, वे इस बात पर जोर देते हैं कि ये अभी भी सिमुलेशन हैं। रोबोटों का अभी तक वास्तविक भौतिक दुनिया में परीक्षण नहीं किया गया है, और सिमुलेशन में बाधाएं सरल, स्थिर गोले थे, न कि चलते हुए लोग या खिसकता हुआ फर्नीचर।

पेपर निष्कर्ष निकालता है कि भले ही डीप रिइन्फोर्समेंट लर्निंग शक्तिशाली है, हम यह दावा नहीं कर सकते कि "रीच-अवॉइड" समस्या हल हो गई है। एक सिम्युलेटेड वीडियो गेम में काम करने वाले रोबोट और एक बिखरे हुए वास्तविक रसोईघर में काम करने वाले रोबोट के बीच का अंतर अभी भी बहुत बड़ा है। आगे बढ़ने के लिए, शोधकर्ताओं को रोबोटों को छोटे, आसान बक्सों में टेस्ट करना बंद करना होगा और उन्हें उस पूर्ण, अराजक वास्तविकता में प्रशिक्षित करना शुरू करना होगा जिसमें उन्हें रहना है। तब तक, रोबोट केवल एक बहुत अच्छा छात्र है जिसने अभी तक अंतिम परीक्षा पास नहीं की है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →