← नवीनतम पेपर
💻 computer science

MO-Playground: Massively Parallelized Multi-Objective Reinforcement Learning for Robotics

यह शोध पत्र MORLAX, जो कि एक GPU-नेटिव मल्टी-ऑब्जेक्टिव रीइन्फोर्समेंट लर्निंग एल्गोरिदम है, और MO-Playground, जो कि GPU-त्वरित वातावरणों का एक सुइट है, को प्रस्तुत करता है, जो मिलकर बड़े पैमाने पर समानांतर प्रशिक्षण (massively parallelized training) को सक्षम करते हैं जो लीगेसी CPU-आधारित दृष्टिकोणों की तुलना में जटिल रोबोटिक्स कार्यों के लिए 25–270x की गति वृद्धि और बेहतर पारेटो फ्रंट्स (Pareto fronts) प्राप्त करते हैं।

मूल लेखक: Neil Janwani, Ellen Novoseller, Vernon J. Lawhern, Maegan Tucker

प्रकाशित 2026-03-11
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Neil Janwani, Ellen Novoseller, Vernon J. Lawhern, Maegan Tucker

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को चलना सिखा रहे हैं। रोबोटिक्स के पुराने दिनों में, आपको रोबोट को एक सख्त निर्देश देना होता था: "जितनी जल्दी हो सके उतनी तेज़ी से चलो!" लेकिन अगर आप ऐसा करते, तो रोबोट इतनी तेज़ी से दौड़ सकता था कि उसकी बैटरी खत्म हो जाती या झटकेदार गति के कारण वह गिर जाता।

इसे ठीक करने के लिए, इंजीनियर "समझौते" का खेल खेलते थे। वे कहते, "ठीक है, तेज़ चलो, लेकिन ऊर्जा भी बचाओ, पर बहुत ज़्यादा भी नहीं।" उन्हें इस पूरे काम को शुरू करने से पहले ही इन लक्ष्यों को एक एकल स्कोर में मैन्युअल रूप से मिलाना पड़ता था। यह धीमा, निराशाजनक था और इसमें हर बार एक मानव विशेषज्ञ को सटीक मिश्रण का अनुमान लगाने की आवश्यकता होती थी।

पेश है नया पेपर: MO-Playground।

MO-Playground को एक विशाल, हाई-टेक "रोबोट ट्रेनिंग जिम" के रूप में समझें जो खेल के नियम पूरी तरह से बदल देता है। एक ही तरीके से चलने के लिए एक निर्देश देने के बजाय, यह पूछता है: "मुझे चलने के हर संभव तरीके दिखाओ, 'सुपर फास्ट लेकिन अनाड़ी' से लेकर 'सुपर स्लो लेकिन ऊर्जा-कुशल' तक, और इनके बीच के सभी तरीके।"

यह कैसे काम करता है, यहाँ कुछ मज़ेदार उपमाओं के साथ समझाया गया है:

1. समस्या: "सिंगल-ट्रैक" मानसिकता

पारंपरिक रोबोट प्रशिक्षण एक मानचित्र पर केवल एक समय में एक गंतव्य को देखने जैसा है। यदि आप समुद्र तट पर जाना चाहते हैं, तो आप ट्रैफ़िक को अनदेखा कर देते हैं। यदि आप ट्रैफ़िक से बचना चाहते हैं, तो आप समुद्र तट को अनदेखा कर देते हैं। आपको एक चुनना होगा, और यदि आप बाद में अपना विचार बदलते हैं, तो आपको पूरी यात्रा फिर से शुरू करनी होगी।

2. समाधान: "जादुई मेनू" (Pareto Sets)

लेखक एक अवधारणा पेश करते हैं जिसे Pareto Set कहा जाता है। कल्पना कीजिए कि एक रेस्टोरेंट मेनू है जहाँ आप केवल एक व्यंजन नहीं चुनते। इसके बजाय, शेफ आपको एक "स्वाद स्पेक्ट्रम" (Taste Spectrum) देता है।

  • मेनू के एक छोर पर, आपके पास "स्पीड बर्गर" है (तेज़, लेकिन शायद तैलीय)।
  • दूसरे छोर पर, आपके पास "हेल्थ सलाद" है (खाने में धीमा, लेकिन बहुत पौष्टिक)।
  • बीच में, आपके पास हर संभव संयोजन है: "मध्यम-गति, मध्यम-स्वास्थ्य।"

MO-Playground रोबोट को एक ही बार में पूरा मेनू सीखना सिखाता है। एक बार प्रशिक्षण पूरा हो जाने के बाद, एक मानव ऑपरेटर बस कह सकता है, "आज मैं चाहता हूँ कि रोबोट स्पीड बर्गर की तरह चले," या "कल के लिए इसे हेल्थ सलाद पर स्विच कर दें," बिना रोबोट को फिर से प्रशिक्षित किए।

3. इंजन: "सुपर-पैरेलल किचन"

अतीत में सबसे बड़ी बाधा यह थी कि इस पूरे मेनू को सीखना बहुत लंबा समय लेता था। यह एक समय में एक हज़ार अलग-अलग केक एक के बाद एक एक ओवन में बेक करने जैसा था।

लेखकों ने MORLAX बनाया है, जो एक विशाल औद्योगिक रसोई की तरह है जिसमें 1,000 ओवन हैं।

  • पुराना तरीका: आप एक केक बेक करते हैं, उसे चेक करते हैं, फिर अगला बेक करते हैं। (दिनों लग जाते हैं)।
  • नया तरीका (MO-Playground): आप एक सुपर-फास्ट GPU (एक शक्तिशाली कंप्यूटर चिप) पर एक साथ 1,000 अलग-अलग ओवन में 1,000 अलग-अलग केक रेसिपी रखते हैं।
  • परिणाम: दिनों के बजाय, रोबोट चलने की शैलियों का पूरा "मेनू" कुछ ही मिनटों में सीख जाता है। पेपर का दावा है कि यह पिछले तरीकों की तुलना में 21 से 270 गुना तेज़ है।

4. सीक्रेट सॉस: "शेप-शिफ्टिंग ब्रेन" (Hypernetworks)

आप एक रोबोट को 1,000 अलग-अलग चीजें कैसे सिखा सकते हैं बिना उसे 1,000 अलग-अलग दिमाग दिए? वह बहुत भारी और धीमा होगा।

उन्होंने एक Hypernetwork का उपयोग किया है। इसे एक शेप-शिफ्टिंग ब्रेन (आकार बदलने वाला मस्तिष्क) के रूप में सोचें।

  • कल्पना कीजिए कि यह एक ही, लचीली मिट्टी की मूर्ति है।
  • जब आप इसे "स्पीड" का निर्देश देते हैं, तो मिट्टी खुद को खींचती और नया आकार देती है ताकि वह एक स्प्रिंटर बन सके।
  • जब आप इसे "ऊर्जा-बचत" का निर्देश देते हैं, तो मिट्टी खुद को नया आकार देती है ताकि वह एक मैराथन धावक बन सके।
  • मस्तिष्क वही है, लेकिन यह आपके द्वारा पूछे गए आधार पर तुरंत अपना आकार बदल लेता है। यह कंप्यूटर मेमोरी और समय की भारी बचत करता है।

5. वास्तविक दुनिया का परीक्षण: BRUCE रोबोट

यह साबित करने के लिए कि यह काम करता है, उन्होंने इसे BRUCE पर टेस्ट किया, जो एक वास्तविक ह्यूमनाइड रोबोट (इंसान के रोबोट संस्करण जैसा) है।

  • उन्होंने BRUCE को एक साथ छह अलग-अलग लक्ष्यों को संतुलित करने के लिए कहा: तेज़ चलना, ऊर्जा बचाना, सुचारू रूप से चलना, हाथ हिलाना, हाथों को सख्त रखना और एक लक्ष्य का पीछा करना।
  • परिणाम: लगभग 2 घंटों में, सिस्टम ने इन सभी लक्ष्यों के साथ चलना सीख लिया।
  • दिलचस्प खोज: रोबोट ने खुद ही पता लगा लिया कि हाथ हिलाने से वास्तव में उसे तेज़ चलने और कम ऊर्जा उपयोग करने में मदद मिलती! उसने एक "गुप्त ट्रिक" ढूंढ ली जिसे मानव इंजीनियर शायद मिस कर देते क्योंकि वे लक्ष्यों को मैन्युअल रूप से संतुलित करने में बहुत व्यस्त थे।

सारांश

MO-Playground एक ऐसा टूलकिट है जो रोबोट को एक साथ कई परस्पर विरोधी लक्ष्यों (जैसे गति बनाम सुरक्षा) को संभालने के लिए सीखने में मदद करता है। सुपर-फास्ट कंप्यूटर चिप्स और एक "शेप-शिफ्टिंग" मस्तिष्क का उपयोग करके, यह एक ऐसी प्रक्रिया को जो दिनों लेती थी, मिनटों में बदल देता है।

इसका मतलब यह है कि भविष्य में, हमें हर विशिष्ट स्थिति के लिए रोबोट को हफ्तों तक प्रोग्राम करने की आवश्यकता नहीं होगी। हम बस इसे संभावनाओं के पूरे "मेनू" को समझने के लिए एक बार प्रशिक्षित कर सकते हैं, और फिर इसे वास्तविक दुनिया में आने वाली किसी भी चीज़ के अनुसार तुरंत ढलने दे सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →