← नवीनतम पेपर
🤖 AI

M2^{2}GRPO: Mamba-based Multi-Agent Group Relative Policy Optimization for Biomimetic Underwater Robots Pursuit

यह शोध पत्र M2^{2}GRPO का प्रस्ताव करता है, जो बायोमिमेटिक अंडरवॉटर रोबॉट्स के सहयोगात्मक पीछा करने वाले कार्यों (cooperative pursuit tasks) के लिए दीर्घकालिक निर्णय लेने (long-horizon decision-making), अंतर-एजेंट समन्वय और प्रशिक्षण स्थिरता को बढ़ाने हेतु एक CTDE प्रतिमान के तहत ग्रूप रिलेटिव पॉलिसी ऑप्टिमाइजेशन के साथ मम्बा-आधारित नीतियों को संयोजित करने वाला एक नवीन ढांचा है।

मूल लेखक: Yukai Feng, Zhiheng Wu, Zhengxing Wu, Junwen Gu, Junzhi Yu

प्रकाशित 2026-04-22
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yukai Feng, Zhiheng Wu, Zhengxing Wu, Junwen Gu, Junzhi Yu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप रोबोटिक मछलियों के एक स्कूल को एक तेज़, फिसलन भरी और चतुर "शिकार" मछली को पकड़ने के लिए मिलकर काम करना सिखाने की कोशिश कर रहे हैं। यह वह चुनौती है जिसका सामना शोधकर्ताओं ने इस पेपर में किया है।

यहाँ उनके समाधान, M2GRPO की कहानी है, जिसे सरल अवधारणाओं और रोजमर्रा के उपमाओं (analogies) में तोड़कर समझाया गया है।

1. समस्या: गहरे पानी का "विस्मृति" (Amnesia) और "शोर" (Noise)

पारंपरिक रोबोट टीमें एक धुंधले कमरे में गेंद पकड़ने की कोशिश करने वाले दोस्तों के समूह की तरह होती हैं।

  • धुंध (आंशिक अवलोकन/Partial Observability): रोबट पूरे पूल को नहीं देख सकते; वे केवल वही देखते हैं जो उनके ठीक सामने होता है।
  • विस्मृति (लंबी अवधि के निर्णय/Long-Horizon Decisions): यदि कोई रोबोट भूल जाता है कि 10 सेकंड पहले शिकार कहाँ था, तो वह भविष्यवाणी नहीं कर सकता कि शिकार आगे कहाँ होगा। पुराने रोबोट दिमाग (जिन्हें MLPs कहा जाता है) अल्पकालिक स्मृति की तरह होते हैं; वे अतीत को जल्दी भूल जाते हैं।
  • शोर (तालमेल/Coordination): यदि एक रोबोट घबरा जाता है, तो पूरी टीम भ्रमित हो सकती है।

शोधकर्ताओं को एक ऐसे सिस्टम की आवश्यकता थी जो अतीत को याद रख सके, बिना बोले एक-दूसरे से बात कर सके, और बिना सुपरकंप्यूटर की आवश्यकता के तेजी से सीख सके।

2. मस्तिष्क: "माम्बा" (Mamba) (सुपर-शॉर्ट-टर्म मेमोरी)

शोधकर्ताओं ने रोबोटों को Mamba नामक एक नया प्रकार का मस्तिष्क दिया।

  • उपमा: कल्पना कीजिए कि एक मानक रोबốt मस्तिष्क एक ऐसे व्यक्ति की तरह है जो एक बार में एक पन्ना पढ़ता है, और दसवें पन्ने तक पहुँचते-पहुँचते पहला पन्ना भूल जाता है।
  • Mamba अपग्रेड: Mamba उस व्यक्ति की तरह है जो पूरी किताब पढ़ सकता है, हर पात्र के इरादों को याद रख सकता है, और मैराथन दौड़ते हुए भी अंत की भविष्यवाणी कर सकता है। यह एक "चयनात्मक अवस्था-स्थान" (selective state-space) तंत्र का उपयोग करता है। इसे एक स्मार्ट फिल्टर के रूप में सोचें जो केवल महत्वपूर्ण यादों (जैसे "शिकार बाईं ओर मुड़ा") को रखता है और शोर (जैसे "एक बुलबुला तैर कर आया") को भूल जाता है।
  • यह क्यों मायने रखता है: यह रोबोटों को भविष्य की योजना बनाने में सक्षम बनाता है। वे केवल शिकार की वर्तमान स्थिति का पीछा नहीं करते; वे उस स्थान का पीछा करते हैं जहाँ शिकार भविष्य में होगा।

3. टीम वर्क: "ग्रुप रिलेटिव" लर्निंग (Group Relative Learning)

आमतौर पर, एक टीम को सिखाने के लिए, आपको एक कोच (एक "क्रिटिक") की आवश्यकता होती है जो किनारे पर खड़ा होकर सबको ठीक-ठीक बताए कि उन्होंने कैसा प्रदर्शन किया। लेकिन अंडरवॉटर रोबोटिक्स में, एक कोच रखना महंगा और धीमा होता है।

शोधकर्ताओं ने ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइजेशन (GRPO) नामक एक ट्रिक का उपयोग किया।

  • उपमा: एक ऐसी कक्षा की कल्पना करें जहाँ शिक्षक ग्रेड (अंक) किसी पूर्ण टेस्ट स्कोर के आधार पर नहीं देता। इसके बजाय, शिक्षक कहता है, "आज कक्षा के औसत से बेहतर किसने किया?"
  • यह कैसे काम करता है: रोबोट एक ही समय में (समानांतर में) 10 बार एक ही पीछा करने वाला खेल खेलते हैं। अंत में, वे अपने स्कोर की तुलना करते हैं। यदि रोबोट A ने समूह के औसत से तेज़ी से शिकार पकड़ा, तो उसे "हाई फाइव" (सकारात्मक इनाम) मिलता है। यदि वह धीमा था, तो उसे "थम्स डाउन" मिलता है।
  • लाभ: उन्हें "परफेक्ट" स्कोर की गणना करने के लिए एक जटिल कोच की आवश्यकता नहीं है। वे बस एक-दूसरे से तुलना करते हैं। यह प्रशिक्षण को तेज़, सस्ता और अधिक स्थिर बनाता है।

4. आर्किटेक्चर: CTDE ("स्टडी हॉल" बनाम "परीक्षा")

यह सिस्टम CTDE (सेंट्रलाइज्ड ट्रेनिंग, डिसेंट्रलाइज्ड एक्जीक्यूशन) नामक एक विधि का उपयोग करता है।

  • प्रशिक्षण (स्टडी हॉल): अभ्यास के दौरान, सभी रोबोट अपने नोट्स साझा करते हैं। वे पूरे पूल को देखते हैं और मिलकर सबसे अच्छी रणनीति बनाने के लिए एक-दूसरे से बात करते हैं।
  • एक्जीक्यूशन (परीक्षा): जब वास्तविक खेल शुरू होता है, तो रोबोट पानी में अकेले होते हैं। वे कोच से बात नहीं कर सकते या पूरे पूल को नहीं देख सकते। उन्हें निर्णय लेने के लिए केवल अपनी आँखों और अपनी याददाश्त (Mamba मस्तिष्क) पर निर्भर रहना पड़ता है।
  • परिणाम: रोबोट स्टडी हॉल में एक जटिल टीम रणनीति सीखते हैं, लेकिन वे अंधेरे में अकेले होने पर भी इसे पूरी तरह से लागू कर सकते हैं।

5. वास्तविक दुनिया का परीक्षण: रोबोटिक शार्क

शोधकर्ताओं ने इसे केवल कंप्यूटर पर सिम्युलेट नहीं किया; उन्होंने असली रोबोटिक शार्क बनाए।

  • इन शार्क्स की पूंछ असली मछली की तरह हिलती है, जिससे वे शांत और फुर्तीले बनते हैं।
  • उन्होंने उन्हें 4x4 मीटर के पूल में रखा।
  • परिणाम: M2GRPO शार्क्स अविश्वसनीय रूप से सफल रहे। उन्होंने "शिकार" को 97% बार पकड़ा (पुराने तरीकों के 80-90% की तुलना में) और उन्होंने यह काम तेज़ी से किया।
  • रणनीति: वीडियो में, आप देख सकते हैं कि शार्क्स भेड़ियों के झुंड की तरह काम करते हैं। वे केवल सीधी रेखा में नहीं दौड़ते; वे भागने के रास्तों को काट देते हैं, शिकार को घेर लेते हैं, और बारी-बारी से पीछा करते हैं।

सारांश: यह एक बड़ी बात क्यों है?

यह पेपर ऐसा है जैसे रोबोटिक मछलियों के एक स्कूल को सुपर-मेमोरी और एक टीम स्पिरिट देना, जिसके लिए किसी केंद्रीय बॉस की आवश्यकता नहीं है।

  • पुराना तरीका: रोबोट कम दृष्टि वाले, भूलक्कड़ और तालमेल बिठाने के लिए सुपरकंप्यूटर पर निर्भर होते हैं।
  • नया तरीका (M2GRPO): रोबोट अतीत को याद रखते हैं, भविष्य की भविष्यवाणी करते हैं, अपने साथियों के साथ तुलना करके सीखते हैं, और सीमित शक्ति के साथ भी कुशलता से काम कर सकते हैं।

इस तकनीक का उपयोग जल्द ही वास्तविक दुनिया के कार्यों के लिए किया जा सकता है जैसे खोए हुए गोताखोरों की तलाश करना, अंडरवॉटर पाइपलाइनों का निरीक्षण करना, या महासागर के स्वास्थ्य की निगरानी करना, जहाँ रोबोटों को गहरे, अंधेरे पानी में चुपचाप और बुद्धिमानी से मिलकर काम करने की आवश्यकता होती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →