← नवीनतम पेपर
💻 computer science

GPU-Parallel Multi-Task Reinforcement Learning with Demonstration Guided Policy Optimization

यह शोध पत्र संरचित हेरफेर कार्यों (structured manipulation tasks) के लिए एक GPU-समानांतर मल्टी-टास्क सुदृढीकरण शिक्षण (reinforcement learning) बेंचमार्क, MT-Libero को प्रस्तुत करता है, और DGPO का प्रस्ताव करता है, जो एक ऑन-पॉलिसी प्रदर्शन-निर्देशित विधि है जो स्पार्स रिवार्ड्स (sparse rewards) के तहत विषम कार्य सूट्स को प्रभावी ढंग से प्रशिक्षित करने के लिए इम्पोर्टेंस-वेटेड PPO को एडेप्टिव बिहेवियर क्लोनिंग के साथ जोड़ती है।

मूल लेखक: Rui Zhang, Qiwei Wu, Zhengyu Zhang, Tao Li, Yunrong Guo, Junjie Lai, Renjing Xu, Weihua Zhang

प्रकाशित 2026-06-03
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Rui Zhang, Qiwei Wu, Zhengyu Zhang, Tao Li, Yunrong Guo, Junjie Lai, Renjing Xu, Weihua Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोटिक हाथ को घर के काम करना सिखाने की कोशिश कर रहे हैं। अतीत में, यदि आप चाहते थे कि रोबोट कॉफी डालना सीख जाए, तो आपको उसे कॉफी के लिए प्रशिक्षित करना पड़ता था। फिर, यदि आप चाहते थे कि वह दराज (drawer) खोलना सीखे, तो आपको उसकी मेमोरी मिटानी पड़ती थी और दराज के लिए एक बिल्कुल नया प्रशिक्षण सत्र शुरू करना पड़ता था। यह हर एक काम के लिए एक अलग विशेषज्ञ को काम पर रखने जैसा था।

यह पेपर रोबोट को प्रशिक्षित करने का एक नया तरीका पेश करता है जो तेज़, स्मार्ट और अधिक बहुमुखी (versatile) है। यह मुख्य रूप से दो काम करता है: यह एक विशाल, उच्च-गति वाला प्रशिक्षण जिम बनाता है, और यह एक नया शिक्षण तरीका आविष्कार करता है जो मानव "प्रदर्शन" (demonstrations) का उपयोग एक मार्गदर्शक के रूप में करता है, बिना रोबोट को हमें आँख मूंदकर कॉपी करने के लिए मजबूर किए।

यहाँ उनके दृष्टिकोण का सरल उपमाओं (analogies) का उपयोग करके विवरण दिया गया है:

1. समस्या: "एक-समय-में-एक-कार्य" की बाधा (The "One-Task-at-a-Time" Bottleneck)

वर्तमान रोबोट प्रशिक्षण को एक सिंगल-लेन सड़क की तरह समझें। आप एक बार में केवल एक कार (एक रोबोट एक कार्य सीखते हुए) ही भेज सकते हैं। भले ही हमारे पास शक्तिशाली कंप्यूटर (GPUs) हों जो हजारों कारों को संभाल सकते हैं, हम उन्हें एक-एक करके भेजने में फंसे हुए हैं। यह धीमा और अक्षम है।

2. समाधान भाग 1: MT-Libero (द "सुपर जिम")

लेखकों ने MT-Libero बनाया है, जो उस सिंगल-लेन सड़क को एक विशाल, मल्टी-लेन सुपरहाइवे में बदलने जैसा है।

  • उपमा: कल्पना कीजिए कि एक विशाल जिम है जहाँ 40 अलग-अलग प्रकार के रोबोट एक ही कमरे में एक साथ प्रशिक्षण ले रहे हैं। 40 अलग-अलग जिम बनाने के बजाय, उन्होंने एक विशाल, साझा जिम बनाया है जहाँ प्रत्येक रोबोट का अपना स्टेशन है लेकिन वे सभी एक ही उपकरण, एक ही कोच और एक ही शेड्यूल साझा करते हैं।
  • यह कैसे काम करता है: उन्होंने रोबोट कार्यों का एक मानक सेट लिया (जैसे ब्लॉक को स्टैक करना, दराज खोलना, या वस्तुओं को हिलाना) और कंप्यूटर को प्रोग्राम किया कि वह उन सभी को एक ही ग्राफिक्स कार्ड पर एक ही समय में चलाए।
  • परिणाम: वे एक रोबोट को एक साथ 40 विभिन्न कार्यों पर प्रशिक्षित कर सकते हैं, जो पहले की तुलना में 1,600 गुना तेज़ है, और कंप्यूटर मेमोरी का एक बहुत छोटा हिस्सा उपयोग करते हैं। यह एक "जनरलिस्ट" (generalist) रोबोट को प्रशिक्षित करने जैसा है जो हर चीज़ के बारे में थोड़ा बहुत जानता है, बजाय एक "स्पेशलिस्ट" (specialist) के जो केवल एक ही चीज़ जानता है।

3. समाधान भाग 2: DGPO (द "स्मार्ट मेंटर")

40 कार्यों पर एक साथ रोबोट को प्रशिक्षित करना कठिन है क्योंकि कुछ कार्य आसान होते हैं (जैसे हल्का ब्लॉक उठाना) और कुछ कठिन (जैसे एक चिपचिपी दराज खोलना)। यदि रोबोट आसान कार्यों में अच्छा हो जाता है, तो वह कठिन कार्यों को सीखने के लिए प्रयास करना बंद कर सकता है। साथ ही, कभी-कभी रोबोट फंस जाता है और उसे समझ नहीं आता कि क्या करना है।

यहीं पर DGPO आता है। इसे एक स्मार्ट मेंटर के रूप में सोचें जो कार्यों को करने के लिए एक मानव विशेषज्ञ को देखता है।

  • पुराना तरीका: कुछ विधियाँ बस कहती हैं, "मानव की हुबहू नकल करो।" यदि मानव गलती करता है, तो रोबोट गलती की नकल करता है। अन्य विधियाँ कहती हैं, "मानव को अनदेखा करें और खुद इसे समझें," जिसमें बहुत समय लगता है।
  • DGPO का तरीका: मेंटर कहता है, "मैं तुम्हें शुरू करने के लिए मानव को देखूँगा, लेकिन मैं तुम्हें बाकी चीजें खुद समझने दूँगा।"
    • जब रोबट संघर्ष कर रहा होता है: मेंटर करीब आता है और कहता है, "हे, देखो मानव ने यहाँ क्या किया। वैसा ही करो।" (इसे Adaptive Behavior Cloning कहा जाता है)।
    • जब रोबोट अच्छा कर रहा होता है: मेंटर पीछे हट जाता है और कहता है, "बहुत बढ़िया! अब अपने आप सुधार करने की कोशिश करो।" (यह मानक Reinforcement Learning वाला हिस्सा है)।
    • "निष्पक्षता" का नियम: मेंटर एक स्कोरबोर्ड भी रखता है। यदि रोबोट "कठिन" कार्यों में विफल हो रहा है लेकिन "आसान" कार्यों में अच्छा कर रहा है, तो मेंटर रोबोट को कठिन कार्यों का अधिक अभ्यास करने के लिए मजबूर करता है। यह सुनिश्चित करता है कि रोबोट हर चीज़ में अच्छा हो जाए, न कि केवल आसान चीज़ों में।

4. परिणाम: एक "VLA-जैसा" रोबोट

पेपर ने विभिन्न कार्यों (Goal, Object, Spatial, और Long-horizon tasks) पर इस प्रणाली का परीक्षण किया।

  • परिणाम: MT-Libero और DGPO के साथ प्रशिक्षित रोबोट एक सच्चा "जनरलिस्ट" बन गया। इसने एक ही प्रशिक्षण सत्र में सभी 40 कार्यों को सीखा।
  • तुलना: इसने उन रोबोटों को पछाड़ दिया जो मानव सहायता के बिना प्रशिक्षित थे (जो धीमे थे) और उन रोबोटों को भी जो केवल मनुष्यों की नकल कर रहे थे (जो कठोर थे और सुधार नहीं कर सके)।
  • वास्तविक दुनिया की जाँच: उन्होंने इस कंप्यूटर सिमुलेशन में प्रशिक्षित एक रोबोट को एक वास्तविक कमरे में एक वास्तविक रोबोटिक हाथ पर भी आजमाया। यह आश्चर्यजनक रूप से अच्छा काम कर रहा था, जिससे पता चला कि "सुपर जिम" में सीखे गए कौशल वास्तविक दुनिया में स्थानांतरित (transfer) हो सकते हैं।

सारांश

संक्षेप में, यह पेपर कहता है:

  1. रोबोट को एक-एक करके प्रशिक्षित करना बंद करें। एक साझा, उच्च-गति वाले वातावरण का निर्माण करें जहाँ वे कई कार्य एक साथ सीख सकें (MT-Libero)।
  2. केवल मनुष्यों की नकल न करें; उनसे सीखें। मानव प्रदर्शनों का उपयोग एक लचीले मार्गदर्शक के रूप में करें जो तब मदद करता है जब रोबोट फंसा हुआ हो, लेकिन जब रोबोट तैयार हो तो उसे अपने आप सुधार करने देता है (DGPO)।

परिणामस्वरूप एक ऐसा रोबोट मिलता है जो तेज़ी से सीखता है, विभिन्न प्रकार के कार्यों को संभालता है, और हर नए काम के लिए शून्य से पुन: प्रशिक्षित होने की आवश्यकता के बिना कठिन चीज़ों में बेहतर होता जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →