← नवीनतम पेपर
💻 computer science

Collaborative Task and Path Planning for Heterogeneous Robotic Teams using Multi-Agent PPO

यह शोध पत्र अन्यग्रह अन्वेषण के लिए विषम रोबोटिक टीमों को कुशलतापूर्वक समन्वित करने हेतु मल्टी-एजेंट प्रॉक्सिमल पॉलिसी ऑप्टिमाइज़ेशन (MAPPO) का उपयोग करते हुए एक सहयोगात्मक नियोजन रणनीति प्रस्तुत करता है, जो वास्तविक समय में कार्य आवंटन और ऑनलाइन पुनर्रचना को सक्षम करने के लिए कम्प्यूटेशनल जटिलता को प्रशिक्षण समय की ओर स्थानांतरित करके शास्त्रीय एल्गोरिदम की स्केलेबिलिटी सीमाओं को संबोधित करता है।

मूल लेखक: Matthias Rubio, Julia Richter, Hendrik Kolvenbach, Marco Hutter

प्रकाशित 2026-04-02
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Matthias Rubio, Julia Richter, Hendrik Kolvenbach, Marco Hutter

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक दूरस्थ, चट्टानी ग्रह पर बनी एक फिल्म के निर्देशक हैं। आपके पास रोबोटों की एक टीम है जो बहुत अलग है: एक तेज़ ड्रोन जो उड़ सकता है, एक मजबूत रोवर जो पहियों पर चलता है, और एक फुर्तीला लेग्ड-बॉट (legged-bot) जो चट्टानों पर चढ़ सकता है। आपका लक्ष्य उन्हें फोटो लेने, नमूने ड्रिल करने और मिट्टी को मापने के लिए कुछ विशिष्ट स्थानों पर भेजना है।

समस्या क्या है? आप उन्हें बस यह नहीं कह सकते कि "जाओ और यह करो।" आपको यह पता लगाना होगा कि:

  1. कौन किस काम के लिए सबसे उपयुक्त है? (ड्रोन ड्रिल नहीं कर सकता; रोवर उड़ नहीं सकता)।
  2. उन्हें किस क्रम में जाना चाहिए?
  3. वे काम करते समय एक-दूसरे से टकराने से कैसे बचें?

यदि आप एक मानक कंप्यूटर एल्गोरिदम का उपयोग करके एक आदर्श योजना की गणना करने की कोशिश करते हैं, तो यह एक सुडोकू पहेली को हल करने जैसा है जो हर बार एक नया रोबोट जोड़ने पर बड़ी होती जाती है। गणित इतना जटिल हो जाता है कि कंप्यूटर को योजना बनाने में घंटों लग सकते हैं, और तब तक मिशन पुराना समाचार बन चुका होगा।

यह शोध पत्र इसे हल करने का एक नया तरीका प्रस्तुत करता है: रोबोटों को "खेल" खेलना सिखाना जब तक कि वे इसमें बहुत माहिर न हो जाएं।

यहाँ उनके समाधान का विवरण दिया गया है, सरल उपमाओं का उपयोग करते हुए:

1. "वीडियो गेम" प्रशिक्षण मैदान

रोबोटों के लिए जटिल नियमों को लिखने के बजाय, शोधकर्ताओं ने एक आभासी वीडियो गेम बनाया। इस खेल में:

  • रोबोट (एजेंट) और कार्य (लक्ष्य) एक ग्रिड पर रखे गए हैं।
  • कुछ कार्यों के लिए एक रोबोट की आवश्यकता होती है (जैसे फोटो लेना), जबकि अन्य कार्यों के लिए एक टीम की आवश्यकता होती है (जैसे एक भारी ड्रिल जिसे पकड़ने के लिए एक रोवर और स्थिर करने के लिए एक लेग्ड-बॉट की आवश्यकता हो)।
  • रोबोटों को एक "मस्तिष्क" दिया गया है जो MAPPO (मल्टी-एजेंट प्रॉक्सिमल पॉलिसी ऑप्टिमाइज़ेशन) नामक सीखने की पद्धति पर आधारित है। इसे एक कोच की तरह समझें जो हजारों बार रोबोटों को खेल खेलते हुए देखता है।

2. पुरस्कार प्रणाली (कैंडी जार)

ठीक वैसे ही जैसे एक कुत्ते को प्रशिक्षित किया जाता है, रोबोट पुरस्कार और दंड के माध्यम से सीखते हैं:

  • अच्छा व्यवहार: यदि कोई रोबोट उस कार्य के करीब जाता है जो वह कर सकता है, तो उसे एक छोटा "कैंडी" (पुरस्कार) मिलता है। यदि वह एक कार्य पूरा करता है, तो पूरी टीम को एक बड़ा ट्रीट मिलता है।
  • बुरा व्यवहार: यदि कोई रोबोट गोल-गोल घूमकर समय बर्बाद करता है, तो उसके अंक कट जाते हैं। यदि वह ऐसे कार्य पर काम करने की कोशिश करता है जिसके लिए उसके पास उपकरण नहीं हैं, तो उसे पेनल्टी मिलती है।
  • लक्ष्य: रोबोट कम से कम समय में सबसे अधिक कैंडी पाने के लिए सहयोग करना सीखते हैं।

3. "दो-चरणों वाला" प्रशिक्षण

शोधकर्ताओं ने महसूस किया कि यदि वे रोबोटों को एक साथ सभी नियम दे देते, तो वे भ्रमित हो जाते और बस स्थिर बैठे रहते। इसलिए, उन्होंने उन्हें दो चरणों में प्रशिक्षित किया:

  • चरण 1 (बुनियादी बातें): उन्होंने रोबोटों को केवल कार्यों को खोजना सिखाया।
  • चरण 2 (विशेषज्ञ): एक बार जब वे कार्यों को खोजना सीख गए, तो उन्होंने उन्हें यह सिखाया कि इसे कुशलतापूर्वक कैसे किया जाए और एक-दूसरे के रास्ते में आए बिना कैसे काम किया जाए।

4. जादुई ट्रिक: "काम को शिफ्ट करना"

यह इस शोध पत्र का सबसे महत्वपूर्ण हिस्सा है।

  • पुराना तरीका (कैलकुलेटर): हर बार जब एक नया पत्थर या नया कार्य दिखाई देता है, तो कंप्यूटर को नई योजना बनाने के लिए शुरू से एक विशाल, धीमी गणना करनी पड़ती है। यह हर कदम पर एक गणित की समस्या को हल करने जैसा है।
  • नया तरीका (एथलीट): रोबोट मिशन शुरू होने से पहले काफी समय तक "प्रशिक्षण" (सीखना) लेते हैं। यह कठिन काम है और मिशन शुरू होने से पहले इसमें बहुत समय लगता है। लेकिन एक बार प्रशिक्षित होने के बाद, जब मिशन शुरू होता है, तो उन्हें कुछ भी गणना करने की आवश्यकता नहीं होती है। वे तुरंत "प्रतिक्रिया" देते हैं, जैसे एक पेशेवर एथलीट जिसने इतना अभ्यास किया है कि उसका शरीर बिना सोचे समझे जानता है कि क्या करना है।

परिणाम क्या है? रोबोट पलक झपकते ही निर्णय ले सकते हैं, भले ही स्थिति अचानक बदल जाए (जैसे कि एक नया कार्य दिखाई देना)।

5. चलते-फिरते पुनर्रचना (Replanning on the Fly)

अंतरिक्ष में, चीजें गलत हो जाती हैं। एक रोबोट टूट सकता है, या एक दिलचस्प नया पत्थर मिल सकता है।
चूंकि रोबोटों ने एक सामान्य रणनीति सीखी है (केवल एक विशिष्ट मानचित्र नहीं), वे तुरंत अनुकूलित हो सकते हैं। यदि कोई नया कार्य सामने आता है, तो वे उसे अपने वीडियो गेम के एक नए स्तर की तरह देखते हैं। वे अभी-अभी पूरे किए गए पुराने कार्य को नए कार्य से बदल देते हैं और आगे बढ़ते रहते हैं। उन्हें पृथ्वी से मदद मांगने के लिए रुकने की आवश्यकता नहीं है; वे बस खेलते रहते हैं।

सारांश

यह शोध पत्र दिखाता है कि रोबोट की एक टीम के लिए हर चाल की योजना बनाने के लिए एक सुपर-स्मार्ट कैलकुलेटर बनाने के बजाय, हमें उन्हें एक स्पोर्ट्स टीम की तरह प्रशिक्षित करना चाहिए

  • लागत: उन्हें शुरू में प्रशिक्षित करने के लिए एक लंबे समय और एक शक्तिशाली कंप्यूटर की आवश्यकता होती है।
  • लाभ: एक बार प्रशिक्षित होने के बाद, वे अविश्वसनीय रूप से तेज़ होते हैं, जटिल टीम वर्क को संभाल सकते हैं, और गणित की समस्याओं में फंसे बिना वास्तविक समय में नई स्थितियों के अनुकूल हो सकते हैं।

यह एक इंसान द्वारा गाड़ी चलाते समय किराने की दुकान तक जाने के लिए सही मार्ग की गणना करने (धीमा और तनावपूर्ण) बनाम एक डिलीवरी ड्राइवर जो शहर को इतनी अच्छी तरह जानता है कि ट्रैफिक बदलने पर वह तुरंत अपना रास्ता बदल सकता है (तेज़ और सुचारू) के बीच का अंतर है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →